项目目标

设计能够衡量智能体正确性与功能性的评测框架。课程官网尚未公开完整题目,本页先建立实验设计与记录骨架,后续按正式要求更新。

设计框架

  • 任务定义:明确环境、输入、可用工具、成功条件和终止条件。
  • 数据集:记录任务来源、覆盖范围、难度分层和污染风险。
  • 指标:同时衡量最终结果、过程约束、成本、延迟与安全性。
  • 执行器:隔离运行环境,固定依赖并保存完整轨迹。
  • 分析:按任务类型和失败模式分组,报告均值与方差。
赞助商

核心问题

  • 评测是否在测量真实任务完成能力?
  • 成功判定能否通过程序稳定复现?
  • 测试集是否能够区分不同能力水平的智能体?
  • 如何控制环境波动、模型随机性和外部服务变化?

验收清单

  • [ ] 建立任务 Schema、评测协议和版本记录。
  • [ ] 同时保存最终产物与中间执行轨迹。
  • [ ] 设计至少一个弱基线和一个强基线。
  • [ ] 对主要失败模式进行分类和案例分析。
  • [ ] 课程发布正式题目后核对并补齐要求。

参考资料