胡泽贤 律师RULES & BEYONDLEARNING NOTE 06 / 2026

AI AGENT / 第 6 章应用笔记

没有评估,就不知道 Agent 是变好还是更会取巧。

一次漂亮演示无法说明系统可靠。评估要把任务、环境、成本、成功标准和失败轨迹变成可重复比较的信号。

任务、指标、成本与失败轨迹进入统一测量系统的编辑视觉
VISUAL METAPHOR / 主题隐喻测量系统 · 任务、指标、成本与失败轨迹

Agent 会调用工具、改变环境并跨多步完成任务,因此只评最终文字远远不够。我们需要知道它完成了什么、花了多少、在哪一步失败,以及结果是否可重复。

评估不是发布前的一次考试,而是设计、选型、上线和持续改进共用的基础设施。

先定义可验证任务,再谈模型排名;先保留失败轨迹,再谈系统优化。

01 / EVAL ENVIRONMENT评估环境必须能重置、观察和判分。

工具调用型任务要模拟真实接口与副作用,人机交互任务还要包含中间状态。每次运行应从可控起点开始,并能检查最终环境,而不是只读 Agent 自己的总结。

02 / TASK DATASET任务描述要精确,难度与分布要真实。

数据集既要覆盖常见路径,也要保留边界与失败案例。任务必须有客观可验证目标,并持续清理含糊、泄题或已经失效的样本。

  • 分层设置简单、组合与长程任务。
  • 覆盖真实工具、数据规模和权限条件。
  • 防止测试答案泄漏进提示词或训练集。
  • 记录任务版本,避免前后比较失真。

03 / METRICS & JUDGE成功率之外,还要看成本与过程。

可同时记录任务成功率、步骤数、工具错误、延迟、Token 与金额成本。主观质量可以由 LLM-as-a-Judge 辅助,但评分标准、位置偏差和评审模型版本都要控制。

配对比较往往比绝对打分更稳定;样本足够时,还要报告置信区间和统计显著性。

04 / OBSERVE & IMPROVE从 Benchmark 回到具体失败。

总分只能告诉你有没有变化,轨迹才能解释为什么。可观测性应保留模型输入、工具调用、错误、耗时和关键状态,再通过消融和 A/B 测试确认是哪项改动真正起作用。

第一道练习:为案件整理 Agent 写 20 个可验证任务,同时记录完整率、引用准确率、耗时和人工纠错次数。

原书与章节来源

  • bojieli/ai-agent-book:开源主仓库与全书目录。
  • 6 章正文:本页概念主线与术语来源。
  • 6 章实验:配套代码、复现说明与读者练习。
  • 本页是面向应用的学习整理与转述,不替代原书;准确表述以原文和代码为准。

下一篇:什么时候才需要后训练

继续沿着“理解结构—动手改变—观察结果—形成判断”的方式学习。

继续学习

读者评论

把这篇文章留给你的想法写下来。

0 / 300

还没有评论。你可以留下第一条。