课程信息

  • 官网主题:Training 4: RL Systems
  • 所属模块:训练方法
  • 授课日期:2026-10-01
  • 主讲人:Apurva Gandhi

学习重点

  • 理解 rollout、环境执行、推理服务与参数更新组成的训练系统。
  • 分析沙箱并发、异步采样、吞吐和资源利用率。
  • 关注长轨迹训练中的故障恢复、可复现性与数据版本。
赞助商

核心问题

  • Agent RL 的主要系统瓶颈位于推理、环境还是训练阶段?
  • 异步 rollout 如何影响数据新鲜度和训练稳定性?
  • 怎样记录足够的信息以复现一条失败训练轨迹?

学习记录

  • [ ] 看完课程视频或完成对应阅读。
  • [ ] 整理本讲的核心概念、方法与系统结构。
  • [ ] 记录关键实验、评测指标和失败案例。
  • [ ] 补充一个能够动手验证的实现或复现实验。

参考资料