项目目标
实现用于适配和改进智能体的训练流程。课程官网尚未公开完整题目,本页先围绕数据、训练、评测和系统复现建立记录骨架。
实验结构
- 基线:固定基础模型、Harness、工具与评测集。
- 数据:记录轨迹生成、清洗、筛选和训练样本格式。
- 训练:分别记录 SFT 与 RL 的目标函数、超参数和资源消耗。
- 评测:比较训练前后任务成功率、过程指标、成本和泛化能力。
- 分析:检查奖励投机、灾难性遗忘和对训练环境过拟合。
核心问题
- 哪类失败需要通过训练修复,哪类失败应通过 Harness 修复?
- 奖励信号是否与真实任务目标一致?
- 训练收益能否迁移到未见任务和不同环境?
- Rollout 与参数更新系统的瓶颈在哪里?
验收清单
- [ ] 保存模型、数据、代码与环境版本。
- [ ] 建立可重复运行的训练前基线。
- [ ] 报告训练曲线、评测结果和资源成本。
- [ ] 分析至少一种失败模式和一种副作用。
- [ ] 课程发布正式题目后核对并补齐要求。
