- 环境奖励是真实环境中自然产生的反馈信号:
- 评估方式:直接来自环境的状态变化或用户行为
- 信号来源:真实的系统响应、用户后续行为、任务完成状态
- 评分标准:环境本身的成功/失败指标(如工具返回码、任务完成度)
- 实现机制:直接观察环境状态变化,无需额外的评估模型
在MDP 形式化中:Environment=(S,A,T,R,γ),其中 R 是 reward function,通常被视为 environment
的一部分。所以从纯理论角度,Reward Model也可以算 environment的组成部分。 但在现代LLM RL的工程实践中:Environment(信息来自外部)和Reward Model(独立计算的评估)在系统架构上被明确分离原因如下: - 真实reward(用户满意度)无法直接观测,Reward Model是对真实reward的近似(代理)
- Environment是不可控的(真实用户),Reward Model是可设计的
- 两者的计算位置不同(GPU 4-5 VS GPU 6-7)
- 两者的作用时机不同(state transition时vs回复完成后异步)
|