课程信息
- 官网主题:Training 3: Advanced RL Algorithms
- 所属模块:训练方法
- 授课日期:2026-09-29
学习重点
- 比较适用于语言模型与智能体训练的高级 RL 算法。
- 理解离策略数据、重要性修正与稳定训练的关键问题。
- 分析过程奖励、结果奖励和验证器信号的组合方式。
核心问题
- 哪些算法假设在智能体长轨迹中最容易失效?
- 过程监督和结果监督分别适合哪些任务?
- 如何区分策略真正变强与对训练环境过拟合?
学习记录
- [ ] 看完课程视频或完成对应阅读。
- [ ] 整理本讲的核心概念、方法与系统结构。
- [ ] 记录关键实验、评测指标和失败案例。
- [ ] 补充一个能够动手验证的实现或复现实验。
