Agent 评估(Agent Evaluation)
也叫: Agent 评估 · 评估框架
Agent 评估,是把智能体放到一组任务里从头跑到尾,看它完整的多步执行过程——而不只是某一次回答——做得怎么样。
评估单次模型输出很直接:给一个输入,看模型吐出的一句回答或一段代码,对着参考答案打分。但智能体不一样:它要连续调用工具、读取中间结果、修正自己的计划,往往几十步之后才有一个最终状态。评估 agent,本质上要评估整条轨迹,而不是某一个孤立的输出。
之所以要专门发展出这一套评估方法,是因为智能体的错误会累积:某一步工具调用参数错了,或者理解偏了任务范围,后面几十步都可能建立在这个错误之上,最终结果却可能"看起来"正常。所以团队在改模型、改提示词、换工具的时候,需要一套系统的方法去发现这类回归,而不是靠人工抽查几个案例。
评估通常会从几个维度定性地看:任务是不是真的完成了(而不是看起来完成)、工具调用的参数和顺序对不对、完成任务花了多少步骤或成本(效率)、过程中有没有触发不该触发的操作(安全/护栏遵守情况)。这几个维度没有统一的官方权重,不同团队、不同评估框架的侧重点也不一样。
怎么运作
具体做法通常是:先定义一套任务集,让 agent 端到端跑完整个任务(不是只跑一步),再对完整轨迹打分——可能是自动化检查(比如代码能不能跑通测试)、用另一个模型当裁判、或者人工审阅——最后把多个任务的结果汇总成一个整体表现的判断。
举个例子
比如评估一个编程 agent,任务集可能是一批真实的 GitHub issue:agent 需要理解问题、修改代码、跑测试、提交改动。评估时看的不只是"测试是否通过",还包括它改了多少不相关的文件、用了多少次工具调用、有没有中途卡在死循环里又自己走出来。
和相关概念的区别
"Agent 评估"和"Agent 基准测试(benchmark)"的区别:评估是更宽泛的方法论和实践,可以完全围绕某个团队自己的任务和工具来设计;基准测试只是评估里常用的一种具体工具——一套公开的、固定可重复运行的任务集,主要用来在同样条件下横向比较不同 agent。
常见误解
常见问题
怎么评估一个 AI Agent 的表现?
Agent 评估都看哪些指标?
Agent 评估和基准测试是一回事吗?
最近核实: 2026-08-28