课程信息

  • 官网主题:Training 2: Reinforcement Learning Basics
  • 所属模块:训练方法
  • 授课日期:2026-09-22

学习重点

  • 建立状态、动作、轨迹、奖励与策略在智能体任务中的对应关系。
  • 理解策略梯度、优势估计和探索的基本作用。
  • 分析长任务稀疏奖励与信用分配问题。
赞助商

核心问题

  • 多步智能体任务的奖励应在何时、以什么粒度给出?
  • 环境随机性如何影响训练和评测结果?
  • 怎样防止模型优化代理指标而偏离真实任务目标?

学习记录

  • [ ] 看完课程视频或完成对应阅读。
  • [ ] 整理本讲的核心概念、方法与系统结构。
  • [ ] 记录关键实验、评测指标和失败案例。
  • [ ] 补充一个能够动手验证的实现或复现实验。

参考资料