课程信息
- 官网主题:Training 4: RL Systems
- 所属模块:训练方法
- 授课日期:2026-10-01
- 主讲人:Apurva Gandhi
学习重点
- 理解 rollout、环境执行、推理服务与参数更新组成的训练系统。
- 分析沙箱并发、异步采样、吞吐和资源利用率。
- 关注长轨迹训练中的故障恢复、可复现性与数据版本。
核心问题
- Agent RL 的主要系统瓶颈位于推理、环境还是训练阶段?
- 异步 rollout 如何影响数据新鲜度和训练稳定性?
- 怎样记录足够的信息以复现一条失败训练轨迹?
学习记录
- [ ] 看完课程视频或完成对应阅读。
- [ ] 整理本讲的核心概念、方法与系统结构。
- [ ] 记录关键实验、评测指标和失败案例。
- [ ] 补充一个能够动手验证的实现或复现实验。
