Agent 会调用工具、改变环境并跨多步完成任务,因此只评最终文字远远不够。我们需要知道它完成了什么、花了多少、在哪一步失败,以及结果是否可重复。
评估不是发布前的一次考试,而是设计、选型、上线和持续改进共用的基础设施。
先定义可验证任务,再谈模型排名;先保留失败轨迹,再谈系统优化。
01 / EVAL ENVIRONMENT评估环境必须能重置、观察和判分。
工具调用型任务要模拟真实接口与副作用,人机交互任务还要包含中间状态。每次运行应从可控起点开始,并能检查最终环境,而不是只读 Agent 自己的总结。
02 / TASK DATASET任务描述要精确,难度与分布要真实。
数据集既要覆盖常见路径,也要保留边界与失败案例。任务必须有客观可验证目标,并持续清理含糊、泄题或已经失效的样本。
- 分层设置简单、组合与长程任务。
- 覆盖真实工具、数据规模和权限条件。
- 防止测试答案泄漏进提示词或训练集。
- 记录任务版本,避免前后比较失真。
03 / METRICS & JUDGE成功率之外,还要看成本与过程。
可同时记录任务成功率、步骤数、工具错误、延迟、Token 与金额成本。主观质量可以由 LLM-as-a-Judge 辅助,但评分标准、位置偏差和评审模型版本都要控制。
配对比较往往比绝对打分更稳定;样本足够时,还要报告置信区间和统计显著性。
04 / OBSERVE & IMPROVE从 Benchmark 回到具体失败。
总分只能告诉你有没有变化,轨迹才能解释为什么。可观测性应保留模型输入、工具调用、错误、耗时和关键状态,再通过消融和 A/B 测试确认是哪项改动真正起作用。
第一道练习:为案件整理 Agent 写 20 个可验证任务,同时记录完整率、引用准确率、耗时和人工纠错次数。
原书与章节来源
- bojieli/ai-agent-book:开源主仓库与全书目录。
- 第 6 章正文:本页概念主线与术语来源。
- 第 6 章实验:配套代码、复现说明与读者练习。
- 本页是面向应用的学习整理与转述,不替代原书;准确表述以原文和代码为准。
下一篇:什么时候才需要后训练
继续沿着“理解结构—动手改变—观察结果—形成判断”的方式学习。
继续学习 →

读者评论
把这篇文章留给你的想法写下来。
还没有评论。你可以留下第一条。