项目目标
设计能够衡量智能体正确性与功能性的评测框架。课程官网尚未公开完整题目,本页先建立实验设计与记录骨架,后续按正式要求更新。
设计框架
- 任务定义:明确环境、输入、可用工具、成功条件和终止条件。
- 数据集:记录任务来源、覆盖范围、难度分层和污染风险。
- 指标:同时衡量最终结果、过程约束、成本、延迟与安全性。
- 执行器:隔离运行环境,固定依赖并保存完整轨迹。
- 分析:按任务类型和失败模式分组,报告均值与方差。
核心问题
- 评测是否在测量真实任务完成能力?
- 成功判定能否通过程序稳定复现?
- 测试集是否能够区分不同能力水平的智能体?
- 如何控制环境波动、模型随机性和外部服务变化?
验收清单
- [ ] 建立任务 Schema、评测协议和版本记录。
- [ ] 同时保存最终产物与中间执行轨迹。
- [ ] 设计至少一个弱基线和一个强基线。
- [ ] 对主要失败模式进行分类和案例分析。
- [ ] 课程发布正式题目后核对并补齐要求。
