项目目标
在开源 LLM 之上实现一个可复用的智能体 Harness,完成工具调用、上下文管理和跨领域复用。本项目是课程“构建 → 评测 → 训练”实践主线的起点。
项目结构
Part 1:Coding Agent
- 实现消息构造、ReAct 主循环和工具调用分发。
- 实现遵循 Agent Skills 规范的技能加载机制,通过渐进式披露控制上下文。
- 在隔离沙箱中完成代码修改任务并生成补丁。
Part 2:Context Compaction
- 从历史轨迹中生成工作记忆,保留目标、进度、证据与失败经验。
- 比较开启和关闭上下文压缩时的任务结果与 Token 消耗。
- 分析压缩率、信息损失、成本和任务成功率之间的取舍。
Part 3:Chess Agent
- 复用同一套智能体循环完成象棋任务。
- 实现 UCI 走子、无状态局面模拟与程序化工具调用。
- 完成模型与合法走法提示的
2 × 2消融实验。
验收清单
- [ ] 智能体循环能够处理工具调用、工具结果和可恢复错误。
- [ ] 模型生成的代码只在隔离沙箱中执行。
- [ ] 上下文压缩实验包含统一任务、结果和 Token 统计。
- [ ] 象棋智能体只提交一个真实动作,其余搜索动作保持可回滚。
- [ ] 实验结论由轨迹、日志和结果支持。
