课程信息
- 官网主题:Training 2: Reinforcement Learning Basics
- 所属模块:训练方法
- 授课日期:2026-09-22
学习重点
- 建立状态、动作、轨迹、奖励与策略在智能体任务中的对应关系。
- 理解策略梯度、优势估计和探索的基本作用。
- 分析长任务稀疏奖励与信用分配问题。
核心问题
- 多步智能体任务的奖励应在何时、以什么粒度给出?
- 环境随机性如何影响训练和评测结果?
- 怎样防止模型优化代理指标而偏离真实任务目标?
学习记录
- [ ] 看完课程视频或完成对应阅读。
- [ ] 整理本讲的核心概念、方法与系统结构。
- [ ] 记录关键实验、评测指标和失败案例。
- [ ] 补充一个能够动手验证的实现或复现实验。
