数据与分析 agent-evaluationgaia2-benchmarkdynamic-scenariosmulti-step-reasoninglitellmhuggingface

Meta ARE

在持续变化的真实任务中评测可多步推理的 AI 代理。

FollowAgents 评估 · FARS-2.1
不推荐
37/ 100 五分制 1.9 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全0 / 29 · 0.0/5

证据显示:仓库包含MIT许可证和CodeQL工作流,但未提供权限管理、用户确认、数据流透明性、敏感数据处理、依赖安全审计、外部影响控制、回滚机制或来源归属的明确说明。扣分原因:这些方面在提供的文件中均未提及,因此无法评估。

2可靠稳定8 / 14 · 2.9/5

证据显示:README和pyproject.toml中的描述一致,依赖列表明确且版本固定,但失败消息处理未详细说明。扣分原因:自一致性良好,依赖可用性有明确列表,但失败消息仅部分提及,未提供具体错误处理策略。

3适用触发9 / 18 · 2.5/5

证据显示:README描述了多种使用场景和GUI模式,但能力边界和触发精度未明确。扣分原因:受众和场景覆盖较好,但能力边界和触发精度缺乏详细说明,环境适配有文档但未深入。

4规范维护9 / 18 · 2.5/5

证据显示:README提供了安装、使用、API文档链接,许可证明确,但版本变更日志和已知限制未提供。扣分原因:信息架构清晰,安装说明详细,命名稳定但未明确,示例和FAQ有,但已知限制和版本变更日志缺失,维护责任未明确。

5有效结果7 / 13 · 2.7/5

证据显示:README提供了CLI和GUI输出示例,但成本效益分析未提供。扣分原因:输出可用性有示例,边际价值有描述,但成本效益未量化。

6证据核验4 / 8 · 2.5/5

证据显示:README引用了论文和博客,但未提供独立验证。扣分原因:声明可追溯,但交叉来源验证有限,事实与推断分离不明确。

证据充分度: 评估于 2026年8月9日 审查版本 794636741312
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 未提供权限管理、数据流透明性、敏感数据处理等安全相关文档,需谨慎评估。
  • 依赖版本固定但未提供安全审计,建议检查依赖漏洞。
  • 未提供版本变更日志和已知限制,可能影响长期维护。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Meta Agents Research Environments(ARE)是用于评测 AI 代理的研究环境平台,重点覆盖需要多步推理和动态适应的任务。它以 Agents、Apps、Events 和 Scenarios 为核心概念:应用可包括电子邮件、日历和文件系统,事件会让环境随时间变化,场景则组合应用、事件和验证逻辑。ARE 运行 Gaia2 基准,该基准包含跨 10 个 universe 的 800 个动态场景。平台提供 are-run、are-benchmark 和 are-gui 命令行入口,GUI 支持交互式探索、实时监控和场景 DAG 可视化。它可通过 LiteLLM 配置不同模型提供商,也支持指向本地模型服务端点;评测结果可写入指定输出目录,并可按示例上传至 Hugging Face。

使用 are-run 时,ARE 按 -s 指定的场景和 -a 指定的代理运行单个场景。使用 are-benchmark run 时,它从 -d 场景目录或 --hf 指定的 Hugging Face 数据集读取场景,执行代理,并可通过 --limit 控制运行数量。Gaia2 评测可用 are-benchmark gaia2-run 或 are-benchmark run 配合 --hf meta-agents-research-environments/gaia2 和 --hf_split validation 启动。执行过程中,代理以 ReAct(Reasoning + Acting)方式与 Apps 交互,Events 让环境状态发生变化,场景的验证逻辑负责评估任务执行。模型可通过 --model、--provider 或 --model_provider 配置;本地服务可使用 --endpoint,结果可通过 --output_dir 保存,Gaia2 示例还使用 --hf_upload 上传结果。

  1. 研究团队要比较不同代理在会收到新信息、条件会变化的任务中的表现时,可运行 Gaia2 验证集或完整评测。
  2. 正在开发本地部署模型的工程师需要将其 HTTP 服务接入评测流程时,可用 --provider local 和 --endpoint 指定服务地址。
  3. 需要检查代理能否完成涉及电子邮件、日历或文件系统的组合任务的开发者,可运行单个场景并观察执行结果。
  4. 希望以图形界面审阅任务执行与场景依赖关系的研究人员,可通过 are-gui 启动交互式 Playground 或 Scenarios 视图。
  5. 准备提交 Gaia2 自发布结果的团队,可将评测输出写入目录,并按示例使用 --hf_upload 上传结果。

这个 Agent 有哪些优点和局限?

优点
  • Gaia2 提供 800 个、覆盖 10 个 universe 的动态场景,而不是只评测静态任务。
  • 场景明确结合 Apps、Events 和验证逻辑,可表示环境变化及多步任务执行。
  • 同时提供单场景运行、批量基准评测和带 DAG 可视化的 Web GUI。
  • 通过 LiteLLM 支持多个模型提供商,并明确给出了 Llama API 与本地端点配置路径。
局限
  • 运行环境要求 Python 3.8+;快速启动路径还要求先安装 uv。
  • 使用远程模型需要配置相应提供商凭据,例如 LLAMA_API_KEY;本地模型则需要可访问的服务端点。
  • README 没有给出稳定的 Python API 调用签名,因此基于库接口进行深度集成前需查阅 API 文档。
  • Gaia2 结果上传示例依赖 Hugging Face,且仓库材料未说明上传认证、费用或排行榜审核规则。

如何安装或部署这个 Agent?

前置条件:安装 Python 3.8+ 与 uv。最快的首次运行方式是:

uvx --from meta-agents-research-environments are-run -s scenario_tutorial -a default

也可安装包:

pip install meta-agents-research-environments

如需 GUI:

pip install "meta-agents-research-environments[gui]"

运行需要远程模型时,按所选提供商设置凭据;README 示例使用:

export LLAMA_API_KEY="your-api-key"

如何使用这个 Agent?

运行单个场景:

are-run -s scenario_find_image_file -a default

从本地场景目录运行基准:

are-benchmark run -d /path/to/scenarios --agent default --limit 10

运行 Gaia2 验证集:

are-benchmark gaia2-run --hf meta-agents-research-environments/gaia2 --hf_split validation -l 5

使用 Llama API 的示例配置:

export LLAMA_API_KEY="your-api-key"
are-benchmark run --hf meta-agents-research-environments/gaia2 --hf_split validation --model Llama-3.1-70B-Instruct --provider llama-api --agent default

启动 GUI:

are-gui -s scenario_find_image_file

GUI 通常运行在 http://localhost:8080;各命令可加 --help 查看参数。

常见问题

ARE 是一个现成的生产代理吗?
它定位为代理评测研究环境。README 展示了 default 代理和模型配置方式,但没有把它描述为面向业务任务的预构建生产代理。
是否只能使用某一家模型提供商?
不是。README 说明通过 LiteLLM 支持多个模型提供商,并展示了 Llama API 和 local provider 的配置。
运行 Gaia2 是否需要网络?
README 示例从 Hugging Face 引用 Gaia2 数据集,并可将结果上传至 Hugging Face;这些流程需要网络连接。
如何排查命令参数或配置问题?
README 建议对任意命令使用 --help 查看全部可用选项,并提供了 LLM Configuration Guide 的链接。

相关 Agents