课程信息

  • 官网主题:Training 3: Advanced RL Algorithms
  • 所属模块:训练方法
  • 授课日期:2026-09-29

学习重点

  • 比较适用于语言模型与智能体训练的高级 RL 算法。
  • 理解离策略数据、重要性修正与稳定训练的关键问题。
  • 分析过程奖励、结果奖励和验证器信号的组合方式。
赞助商

核心问题

  • 哪些算法假设在智能体长轨迹中最容易失效?
  • 过程监督和结果监督分别适合哪些任务?
  • 如何区分策略真正变强与对训练环境过拟合?

学习记录

  • [ ] 看完课程视频或完成对应阅读。
  • [ ] 整理本讲的核心概念、方法与系统结构。
  • [ ] 记录关键实验、评测指标和失败案例。
  • [ ] 补充一个能够动手验证的实现或复现实验。

参考资料