评测与安全

Agent 评估(Agent Evaluation)

也叫: Agent 评估 · 评估框架

Agent 评估,是把智能体放到一组任务里从头跑到尾,看它完整的多步执行过程——而不只是某一次回答——做得怎么样。

定义任务集端到端运行 Agent评分完整轨迹汇总结果
让 Agent 端到端跑完一套任务集,对完整轨迹打分,而不仅仅是最终结果。

评估单次模型输出很直接:给一个输入,看模型吐出的一句回答或一段代码,对着参考答案打分。但智能体不一样:它要连续调用工具、读取中间结果、修正自己的计划,往往几十步之后才有一个最终状态。评估 agent,本质上要评估整条轨迹,而不是某一个孤立的输出。

之所以要专门发展出这一套评估方法,是因为智能体的错误会累积:某一步工具调用参数错了,或者理解偏了任务范围,后面几十步都可能建立在这个错误之上,最终结果却可能"看起来"正常。所以团队在改模型、改提示词、换工具的时候,需要一套系统的方法去发现这类回归,而不是靠人工抽查几个案例。

评估通常会从几个维度定性地看:任务是不是真的完成了(而不是看起来完成)、工具调用的参数和顺序对不对、完成任务花了多少步骤或成本(效率)、过程中有没有触发不该触发的操作(安全/护栏遵守情况)。这几个维度没有统一的官方权重,不同团队、不同评估框架的侧重点也不一样。

怎么运作

具体做法通常是:先定义一套任务集,让 agent 端到端跑完整个任务(不是只跑一步),再对完整轨迹打分——可能是自动化检查(比如代码能不能跑通测试)、用另一个模型当裁判、或者人工审阅——最后把多个任务的结果汇总成一个整体表现的判断。

举个例子

比如评估一个编程 agent,任务集可能是一批真实的 GitHub issue:agent 需要理解问题、修改代码、跑测试、提交改动。评估时看的不只是"测试是否通过",还包括它改了多少不相关的文件、用了多少次工具调用、有没有中途卡在死循环里又自己走出来。

和相关概念的区别

"Agent 评估"和"Agent 基准测试(benchmark)"的区别:评估是更宽泛的方法论和实践,可以完全围绕某个团队自己的任务和工具来设计;基准测试只是评估里常用的一种具体工具——一套公开的、固定可重复运行的任务集,主要用来在同样条件下横向比较不同 agent。

常见误解

常被以为: 评估 agent 就是看它最后给出的答案对不对,跟评估普通模型回答没什么两样。
实际上: agent 的价值恰恰体现在过程里——工具调用是否正确、中间出错后能不能自己纠正、有没有绕远路——只看最终结果会漏掉这些真正决定它能不能用的因素。
常被以为: 某个公开基准测试分数高,就说明这个 agent 在我们自己的场景里也可靠。
实际上: 公开基准测试覆盖的任务类型有限,跟具体团队的真实工具、真实数据往往差别很大,高分并不直接等于在生产环境里同样稳。

常见问题

怎么评估一个 AI Agent 的表现?
通常是定义一套有代表性的任务,让 agent 端到端跑完,再对完整过程(而不只是最终结果)打分,包括任务是否完成、工具调用是否正确、效率和安全表现。
Agent 评估都看哪些指标?
常见的定性维度包括任务成功率、工具调用的正确性、完成任务所花的步骤或成本,以及过程中是否遵守了安全护栏,具体权重因团队和框架而异。
Agent 评估和基准测试是一回事吗?
不完全是。评估是更大的方法论,基准测试是其中常用的一种具体工具——一套固定、可重复的公开任务集,方便做横向对比。

最近核实: 2026-08-28

相关术语