立即注册

Discuz! Board

扫描二维码关注官方公众号
查看: 6|回复: 0

[交流] 缅甸腾龙公司游戏网址 xs10159.com

[复制链接]

771

主题

0

回帖

2323

积分

金牌会员

Rank: 6Rank: 6

积分
2323
发表于 4 天前 | 显示全部楼层 |阅读模式
  • 环境奖励是真实环境中自然产生的反馈信号:
  • 评估方式:直接来自环境的状态变化或用户行为
  • 信号来源:真实的系统响应、用户后续行为、任务完成状态
  • 评分标准:环境本身的成功/失败指标(如工具返回码、任务完成度)
  • 实现机制:直接观察环境状态变化,无需额外的评估模型
在MDP 形式化中:Environment=(S,A,T,R,γ),其中 R 是 reward function,通常被视为 environment
的一部分。所以从纯理论角度,Reward Model也可以算 environment的组成部分。
但在现代LLM RL的工程实践中:Environment(信息来自外部)和Reward Model(独立计算的评估)在系统架构上被明确分离原因如下:
  • 真实reward(用户满意度)无法直接观测,Reward Model是对真实reward的近似(代理)
  • Environment是不可控的(真实用户),Reward Model是可设计的
  • 两者的计算位置不同(GPU 4-5 VS GPU 6-7)
  • 两者的作用时机不同(state transition时vs回复完成后异步)

回复 关闭延时

使用道具 举报

游客
回复
您需要登录后才可以回帖 登录 | 立即注册

Archiver|手机版|小黑屋| DiscuzX

GMT+8, 2026-7-31 13:11 , Processed in 0.091064 second(s), 18 queries .

Powered by Discuz! X3.4

© 2001-2013 Discuz Team.

快速回复 返回顶部 返回列表