项目目标

实现用于适配和改进智能体的训练流程。课程官网尚未公开完整题目,本页先围绕数据、训练、评测和系统复现建立记录骨架。

实验结构

  • 基线:固定基础模型、Harness、工具与评测集。
  • 数据:记录轨迹生成、清洗、筛选和训练样本格式。
  • 训练:分别记录 SFT 与 RL 的目标函数、超参数和资源消耗。
  • 评测:比较训练前后任务成功率、过程指标、成本和泛化能力。
  • 分析:检查奖励投机、灾难性遗忘和对训练环境过拟合。
赞助商

核心问题

  • 哪类失败需要通过训练修复,哪类失败应通过 Harness 修复?
  • 奖励信号是否与真实任务目标一致?
  • 训练收益能否迁移到未见任务和不同环境?
  • Rollout 与参数更新系统的瓶颈在哪里?

验收清单

  • [ ] 保存模型、数据、代码与环境版本。
  • [ ] 建立可重复运行的训练前基线。
  • [ ] 报告训练曲线、评测结果和资源成本。
  • [ ] 分析至少一种失败模式和一种副作用。
  • [ ] 课程发布正式题目后核对并补齐要求。

参考资料