数据与分析 function-callingdocker-composedatabase-benchmarkknowledge-graphweb-shoppingos-interaction

AgentBench

用于评测大语言模型在多轮环境中执行任务能力的基准套件。

FollowAgents 评估 · FARS-2.1
不推荐
0/ 100 五分制 0.0 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全0 / 29 · 0.0/5

证据不足:仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的说明。所有标准均未得到支持,因此评分为0。

2可靠稳定0 / 14 · 0.0/5

证据不足:未提供自洽性、依赖可用性或失败消息的说明。所有标准均未得到支持,因此评分为0。

3适用触发0 / 18 · 0.0/5

证据不足:未提供受众与场景、能力边界、触发精度或环境适配的说明。所有标准均未得到支持,因此评分为0。

4规范维护0 / 18 · 0.0/5

证据不足:未提供信息架构、安装说明、命名稳定性、示例与FAQ、已知限制、许可证、版本变更日志或维护责任的说明。所有标准均未得到支持,因此评分为0。

5有效结果0 / 13 · 0.0/5

证据不足:未提供输出可用性、边际价值或成本效益的说明。所有标准均未得到支持,因此评分为0。

6证据核验0 / 8 · 0.0/5

证据不足:未提供声明可追溯性、跨来源佐证或事实与推断分离的说明。所有标准均未得到支持,因此评分为0。

证据充分度: 评估于 2026年8月9日 审查版本 d1e4a10db08c
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 该仓库是一个基准测试框架,而非可直接使用的Agent产品;其用途是评估LLM代理,而非作为代理本身。
  • 仓库未提供任何安全或信任相关的文档,如权限管理、数据流透明或敏感数据处理。
  • 依赖项未固定版本,且未提供安全审计或漏洞缓解措施。
  • 发布者身份未经验证,且未提供维护责任或更新路径的明确说明。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

AgentBench 是一个评测大语言模型作为自主执行主体表现的基准项目,当前仓库提供基于函数调用的 AgentBench FC,并与 AgentRL 集成。FC 版本通过 Docker Compose 部署 AgentRL Controller、任务 worker、Freebase 服务和 Redis,覆盖 alfworld、dbbench、knowledgegraph、os_interaction 与 webshop 五类任务。项目也保留了原始 v0.2 的说明:该版本包含八个环境,并提供 Dev 与 Test 数据划分。旧版通过任务 worker、controller 和 assigner 组织评测流程,支持用配置中的 OpenAI Chat 模型运行任务。它适合需要自建、可重复的多环境评测基础设施的研究者或模型团队,而不是提供面向终端用户的通用对话式助手。

在 FC 部署中,执行 docker compose -f extra/docker-compose.yml up 会启动 AgentRL Controller、五类任务 worker、knowledgegraph 所需的 Freebase 服务和 Redis 容器分配服务;其中 dbbench 使用 mysql:8,os_interaction 需要构建 local-os/defaultlocal-os/packageslocal-os/ubuntu 镜像。knowledgegraph 需要将 Freebase 数据放到 ./virtuoso_db/virtuoso.db,或修改 extra/docker-compose.yml 的挂载点。旧版流程通过 python -m src.client.agent_test 检查模型配置,以 python -m src.start_task -a 启动任务 worker,再由 python -m src.assigner 发起评测。该流程产生各模型在测试集上的任务分数,并在项目排行榜中汇总展示。

  1. 模型研究团队需要在数据库、操作系统、知识图谱和网页购物等环境中比较候选模型时,可部署 FC 版本并运行对应 worker。
  2. 希望复现实验性 LLM-as-Agent 测评的研究者,可使用旧版 v0.2 的 Dev/Test 划分、任务服务和 assigner 流程。
  3. 已有 OpenAI API 密钥、希望先验证 gpt-3.5-turbo-0613 配置是否可用的工程师,可运行 src.client.agent_test
  4. 需要控制资源占用的个人研究者,可在旧版使用 configs/start_task_lite.yamlconfigs/assignments/lite.yaml 以每任务一个 worker 运行。
  5. 需要本地运行知识图谱任务的团队,可部署 Freebase 服务并在 configs/tasks/kg.yaml 配置自己的 SPARQL 服务地址。

这个 Agent 有哪些优点和局限?

优点
  • 当前 FC 版本将五类任务、AgentRL Controller、Freebase 与 Redis 纳入 Docker Compose 部署,便于统一拉起评测环境。
  • 原始基准覆盖八个差异明显的环境,包括 OS、DB、KG、数字卡牌、横向思维谜题、家务、网页购物和网页浏览。
  • 旧版提供 task worker、controller 与 assigner 的明确执行路径,以及普通和轻量两套启动配置。
  • README 明确列出了任务启动时间和单 worker 的大致内存占用,便于容量规划。
局限
  • 当前 FC 文档未给出配置模型凭据、调用 Controller 或启动实际评测作业的具体命令。
  • webshop 环境启动约需 16GB 内存;旧版表格也标注其单 worker 内存约为 15GB。
  • README 明确警告当前 alfworld 实现会持续泄漏内存和磁盘空间,需重启 task worker。
  • knowledgegraph 依赖额外的 Freebase 数据和服务部署;旧版在线服务被说明为不稳定。
  • 旧版依赖较旧的科学计算包,README 推荐 Python 3.9 以提高安装可靠性。

如何安装或部署这个 Agent?

当前 FC 版本需要 Docker 和 Docker Compose。先准备镜像:docker pull mysql:8;随后分别执行 docker build -t local-os/default -f ./data/os_interaction/res/dockerfiles/default data/os_interaction/res/dockerfilesdocker build -t local-os/packages -f ./data/os_interaction/res/dockerfiles/packages data/os_interaction/res/dockerfilesdocker build -t local-os/ubuntu -f ./data/os_interaction/res/dockerfiles/ubuntu data/os_interaction/res/dockerfiles。下载并解压 Freebase-Setup 数据后,将数据库放在 ./virtuoso_db/virtuoso.db。README 未说明 FC 版本配置模型凭据或提交评测作业的具体命令。若使用旧版 v0.2,README 推荐以 conda 创建 Python 3.9 环境并执行 pip install -r requirements.txt,然后在 configs/agents/openai-chat.yaml 填入 OpenAI API Key。

如何使用这个 Agent?

启动当前 FC 栈:docker compose -f extra/docker-compose.yml up。该命令会启动 Controller、五类任务 worker、Freebase 和 Redis;若本机已有 Redis 7+,可从 compose 文件中省略 Redis 服务。旧版 v0.2 的首个完整评测调用为:先运行 python -m src.start_task -a,等待任务服务就绪后执行 python -m src.assigner;轻量配置分别使用 python -m src.start_task -a --config configs/start_task_lite.yamlpython -m src.assigner --config configs/assignments/lite.yaml

这个 Agent 与同类方案有什么区别?

AgentBench 将其原始八环境中的 House-Holding、Web Shopping 和 Web Browsing 分别建立在已发布的 ALFWorld、WebShop 和 Mind2Web 数据集之上;其余五个领域在 README 中被描述为新创建的环境。VisualAgentBench 是同一组织介绍的视觉基础执行主体评测项目,覆盖具身、GUI 与视觉设计环境,范围不同于 AgentBench 的文本任务环境。

常见问题

运行 AgentBench FC 需要付费模型 API 吗?
当前 FC 快速开始部分没有说明模型 API 凭据或计费方式。旧版示例要求在 configs/agents/openai-chat.yaml 填入 OpenAI API Key。
是否可以不使用 Docker?
README 的 FC 快速开始以 Docker Compose 为部署方式;旧版也要求 Docker,并要求为 dbbench 和 os-std 准备容器镜像。
知识图谱任务为什么需要额外准备?
它需要 Freebase-Setup 数据和 Freebase 服务。FC 版本要求数据库位于 ./virtuoso_db/virtuoso.db 或调整 compose 挂载;旧版可在 configs/tasks/kg.yaml 指定自己的 SPARQL 地址。
笔记本电脑能运行吗?
旧版提供每个任务一个 worker 的 lite 预设,但 webshop 的内存需求很高;当前 FC README 标注启动 webshop 约需 16GB 内存。

相关 Agents