开发与工程 multimodal-benchmarkingcross-environmentpython-frameworkgraph-evaluationgui-automationdocker

CRAB 跨环境智能体基准

用 Python 构建并评测跨环境、多模态语言模型智能体。

FollowAgents 评估 · FARS-2.1
不推荐
28/ 100 五分制 1.4 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全0 / 29 · 0.0/5

证据显示仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的机制。README和pyproject.toml未提及安全特性。因此所有信任标准得分为0。

2可靠稳定3 / 14 · 1.1/5

自一致性:README和pyproject.toml中的描述一致,但测试文件显示许多测试被跳过,且未提供失败消息。依赖可用性:pyproject.toml列出了依赖,但未提供锁定文件或验证机制。失败消息:未提供错误处理或用户可操作的失败消息。

3适用触发9 / 18 · 2.5/5

受众和场景:README明确面向研究人员和开发者,提供了基准测试场景。能力边界:文档描述了框架功能,但未明确限制。触发精度:动作通过装饰器定义,但未提供精确触发条件。环境适配:支持多种环境,但未提供详细配置指南。

4规范维护8 / 18 · 2.2/5

信息架构:README和文档结构清晰。安装说明:提供了pip安装命令。命名稳定性:版本号存在,但未提供变更日志。示例和FAQ:提供了示例,但无FAQ。已知限制:未提及。许可证:pyproject.toml声明Apache 2.0,但未提供许可证文件。版本和变更日志:版本号存在,但无变更日志。维护责任:作者和维护者信息存在,但未明确维护政策。

5有效结果6 / 13 · 2.3/5

输出可用性:提供了示例输出,但未详细说明。边际价值:作为基准测试框架,提供了新颖的评估方法。成本效益:未提供性能或成本分析。

6证据核验2 / 8 · 1.3/5

声明可追溯性:README引用了论文,但未提供详细验证。跨来源佐证:有arXiv链接,但未提供其他来源。事实与推断分离:未区分事实和推断。

证据充分度: 评估于 2026年8月9日 审查版本 c0790b0d55e3
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 仓库未提供安全机制,如权限控制、用户确认或数据流透明,使用时应谨慎。
  • 测试文件显示许多测试被跳过,且未提供失败消息,可靠性证据不足。
  • 未提供许可证文件,尽管pyproject.toml声明Apache 2.0,需确认。
  • 未提供变更日志,版本更新历史不透明。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

CRAB 是一个以 Python 为中心的框架,用于构建 LLM 智能体的基准测试环境。它可将内存环境、Docker 托管环境、虚拟机和分布式物理机器纳入同一接口,前提是这些环境可通过 Python 函数访问。开发者可在 Python 函数上添加 @action 装饰器来定义动作,并通过组合动作定义环境。任务及对应评估器也以 Python 原生方式定义,图评估器可提供细粒度指标。仓库同时提供 crab-benchmark-v0 数据集与实验代码,以及使用 OpenAI 智能体运行模板环境的示例。

CRAB 让开发者以 Python 函数作为环境访问边界:在函数上添加 @action 可新增动作,组合多个动作可定义一个环境。智能体通过统一接口同时访问多个环境;这些环境可以是内存实现、Docker 托管实例、虚拟机或分布式物理机器。开发者以 Python 定义任务和评估器,图评估器输出细粒度指标。仓库给出的运行路径是先设置 OPENAI_API_KEY,再执行 python examples/single_env.py 或 python examples/multi_env.py。

  1. 需要为多模态语言模型智能体设计可重复任务和评估器的研究人员。
  2. 需要在同一智能体实验中协调多个可由 Python 函数访问环境的工程团队。
  3. 希望把 Docker 托管环境、虚拟机和内存环境一起纳入评测的基准开发者。
  4. 需要通过图评估器获得细粒度任务指标的智能体评估人员。
  5. 希望先运行模板单环境或多环境示例来验证 OpenAI 智能体接入的开发者。

这个 Agent 有哪些优点和局限?

优点
  • 以 @action 装饰器把 Python 函数直接转为环境动作,环境配置路径明确。
  • 一个统一接口可面向内存、Docker、虚拟机和分布式物理机器等多种部署形态。
  • 图评估器提供细粒度指标,而不只限定于单一汇总结果。
  • 仓库提供单环境与多环境的 OpenAI 模板运行示例。
局限
  • 明确的可运行示例依赖 OPENAI_API_KEY,采用该路径需要 OpenAI 凭据。
  • 环境必须能够通过 Python 函数访问,不能满足这一访问边界的系统需要额外集成工作。
  • Docker、虚拟机和物理机仅被列为支持的部署选项,所给材料未说明各选项的配置细节。
  • 许可证信息在提供的仓库资料中未知。

如何安装或部署这个 Agent?

运行环境要求 Python 3.10 或更高版本。安装命令:pip install crab-framework[client]。如需运行仓库提供的 OpenAI 模板示例,设置凭据 export OPENAI_API_KEY=<your api key>,然后运行 python examples/single_env.py 或 python examples/multi_env.py。

如何使用这个 Agent?

先使用 @action 装饰 Python 函数来添加动作,再组合动作定义环境;随后以 Python 定义任务及其评估器,并将可访问的多个环境交给统一接口。首次验证可设置 OPENAI_API_KEY 后运行 python examples/single_env.py;多环境示例使用 python examples/multi_env.py。CRAB-Benchmark-v0 的数据和实验代码位于 crab-benchmark-v0/ 目录。

常见问题

运行提供的示例需要什么凭据?
README 中的 OpenAI 模板示例要求设置 OPENAI_API_KEY。
CRAB 能评测哪些部署形态?
可通过 Python 函数访问的内存环境、Docker 托管环境、虚拟机及分布式物理机器都在其说明范围内。
是否必须在一个环境中运行智能体?
不是。README 说明智能体可通过统一接口同时访问多个环境,并提供 multi_env.py 示例。
如何定义新的环境动作?
在 Python 函数上添加 @action 装饰器,然后组合这些动作定义环境。
基准数据和实验代码在哪里?
它们位于仓库的 crab-benchmark-v0/ 目录。

相关 Agents