开发与工程 multimodal-benchmarkingcross-environmentpython-frameworkgraph-evaluationgui-automationdocker

CRAB 跨环境智能体基准

用 Python 构建并评测跨环境、多模态语言模型智能体。

FollowAgents 评估 · FARS-2.0
待评估
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

CRAB 是一个以 Python 为中心的框架,用于构建 LLM 智能体的基准测试环境。它可将内存环境、Docker 托管环境、虚拟机和分布式物理机器纳入同一接口,前提是这些环境可通过 Python 函数访问。开发者可在 Python 函数上添加 @action 装饰器来定义动作,并通过组合动作定义环境。任务及对应评估器也以 Python 原生方式定义,图评估器可提供细粒度指标。仓库同时提供 crab-benchmark-v0 数据集与实验代码,以及使用 OpenAI 智能体运行模板环境的示例。

CRAB 让开发者以 Python 函数作为环境访问边界:在函数上添加 @action 可新增动作,组合多个动作可定义一个环境。智能体通过统一接口同时访问多个环境;这些环境可以是内存实现、Docker 托管实例、虚拟机或分布式物理机器。开发者以 Python 定义任务和评估器,图评估器输出细粒度指标。仓库给出的运行路径是先设置 OPENAI_API_KEY,再执行 python examples/single_env.py 或 python examples/multi_env.py。

  1. 需要为多模态语言模型智能体设计可重复任务和评估器的研究人员。
  2. 需要在同一智能体实验中协调多个可由 Python 函数访问环境的工程团队。
  3. 希望把 Docker 托管环境、虚拟机和内存环境一起纳入评测的基准开发者。
  4. 需要通过图评估器获得细粒度任务指标的智能体评估人员。
  5. 希望先运行模板单环境或多环境示例来验证 OpenAI 智能体接入的开发者。

这个 Agent 有哪些优点和局限?

优点
  • 以 @action 装饰器把 Python 函数直接转为环境动作,环境配置路径明确。
  • 一个统一接口可面向内存、Docker、虚拟机和分布式物理机器等多种部署形态。
  • 图评估器提供细粒度指标,而不只限定于单一汇总结果。
  • 仓库提供单环境与多环境的 OpenAI 模板运行示例。
局限
  • 明确的可运行示例依赖 OPENAI_API_KEY,采用该路径需要 OpenAI 凭据。
  • 环境必须能够通过 Python 函数访问,不能满足这一访问边界的系统需要额外集成工作。
  • Docker、虚拟机和物理机仅被列为支持的部署选项,所给材料未说明各选项的配置细节。
  • 许可证信息在提供的仓库资料中未知。

如何安装或部署这个 Agent?

运行环境要求 Python 3.10 或更高版本。安装命令:pip install crab-framework[client]。如需运行仓库提供的 OpenAI 模板示例,设置凭据 export OPENAI_API_KEY=<your api key>,然后运行 python examples/single_env.py 或 python examples/multi_env.py。

如何使用这个 Agent?

先使用 @action 装饰 Python 函数来添加动作,再组合动作定义环境;随后以 Python 定义任务及其评估器,并将可访问的多个环境交给统一接口。首次验证可设置 OPENAI_API_KEY 后运行 python examples/single_env.py;多环境示例使用 python examples/multi_env.py。CRAB-Benchmark-v0 的数据和实验代码位于 crab-benchmark-v0/ 目录。

常见问题

运行提供的示例需要什么凭据?
README 中的 OpenAI 模板示例要求设置 OPENAI_API_KEY。
CRAB 能评测哪些部署形态?
可通过 Python 函数访问的内存环境、Docker 托管环境、虚拟机及分布式物理机器都在其说明范围内。
是否必须在一个环境中运行智能体?
不是。README 说明智能体可通过统一接口同时访问多个环境,并提供 multi_env.py 示例。
如何定义新的环境动作?
在 Python 函数上添加 @action 装饰器,然后组合这些动作定义环境。
基准数据和实验代码在哪里?
它们位于仓库的 crab-benchmark-v0/ 目录。

相关 Agents