Agent 基准测试(Benchmark)
也叫: Agent 基准测试 · 评测排行榜
Agent 基准测试是一套固定的任务和打分方法,让不同的智能体或模型在同样条件下跑一遍,方便横向比较。
基准测试的核心就是"固定"两个字:任务集合固定,打分方法也固定,不同 agent、不同模型跑同一套题、用同一套规则打分,出来的数字才能放在一起比。这也是"排行榜"(leaderboard)能存在的前提。
基准测试有用,是因为它省掉了每次选型都要自己设计一套测试的成本——想知道某个新模型或新 agent 大概处于什么水平,看几个主流基准测试的表现,是一个常见的起点,通常还会在此基础上再针对自己的场景做进一步评估。SWE-bench 就是编程类 agent 领域一个广为人知的例子:它用一批真实开源项目的 issue 来考验 agent 能不能提交出让相关测试通过的修复。具体到某个模型某次跑分的数字,会随模型版本和时间推移变化,这里刻意不引用具体分数。
但基准测试的局限也同样真实,"agent 基准测试不靠谱"是业内一直存在的批评:固定的任务集合覆盖不了真实世界工作的全部多样性;题目公开的时间越长,越有可能被后续的训练数据"看到过",导致分数虚高而实际能力没有同步提升;排行榜的存在本身也会造成一种优化排行榜、而不是优化真实能力的倾向。
怎么运作
常见的基准测试构建方式,是先挑选或构造一批有明确、可核查对错标准的任务——比如"这段代码改动能不能让测试通过"——再配一套自动化或半自动化的打分规则。因为每个 agent 都在完全相同的任务集合、相同的打分规则下跑一遍,不同团队、不同时间跑出来的结果才具备可比性,这是零散测试做不到的。
和相关概念的区别
Agent 基准测试和"Agent 评估"的区别:基准测试是一种具体的、固定的、公开可重复运行的工具,价值在于让不同 agent 之间可以比较;评估是更宽泛的实践,可以完全围绕某个团队自己的场景设计,不需要公开或标准化也能发挥作用。
常见误解
常见问题
AI agent 基准测试是什么意思?
为什么不同基准测试排行榜的名次差别很大?
基准测试分数能代表 agent 的真实可靠性吗?
最近核实: 2026-08-28