Meta ARE
在持续变化的真实任务中评测可多步推理的 AI 代理。
按维度查看评分与理由
证据显示:仓库包含MIT许可证和CodeQL工作流,但未提供权限管理、用户确认、数据流透明性、敏感数据处理、依赖安全审计、外部影响控制、回滚机制或来源归属的明确说明。扣分原因:这些方面在提供的文件中均未提及,因此无法评估。
证据显示:README和pyproject.toml中的描述一致,依赖列表明确且版本固定,但失败消息处理未详细说明。扣分原因:自一致性良好,依赖可用性有明确列表,但失败消息仅部分提及,未提供具体错误处理策略。
证据显示:README描述了多种使用场景和GUI模式,但能力边界和触发精度未明确。扣分原因:受众和场景覆盖较好,但能力边界和触发精度缺乏详细说明,环境适配有文档但未深入。
证据显示:README提供了安装、使用、API文档链接,许可证明确,但版本变更日志和已知限制未提供。扣分原因:信息架构清晰,安装说明详细,命名稳定但未明确,示例和FAQ有,但已知限制和版本变更日志缺失,维护责任未明确。
证据显示:README提供了CLI和GUI输出示例,但成本效益分析未提供。扣分原因:输出可用性有示例,边际价值有描述,但成本效益未量化。
证据显示:README引用了论文和博客,但未提供独立验证。扣分原因:声明可追溯,但交叉来源验证有限,事实与推断分离不明确。
- 未提供权限管理、数据流透明性、敏感数据处理等安全相关文档,需谨慎评估。
- 依赖版本固定但未提供安全审计,建议检查依赖漏洞。
- 未提供版本变更日志和已知限制,可能影响长期维护。
这个 Agent 能做什么,适合哪些场景?
Meta Agents Research Environments(ARE)是用于评测 AI 代理的研究环境平台,重点覆盖需要多步推理和动态适应的任务。它以 Agents、Apps、Events 和 Scenarios 为核心概念:应用可包括电子邮件、日历和文件系统,事件会让环境随时间变化,场景则组合应用、事件和验证逻辑。ARE 运行 Gaia2 基准,该基准包含跨 10 个 universe 的 800 个动态场景。平台提供 are-run、are-benchmark 和 are-gui 命令行入口,GUI 支持交互式探索、实时监控和场景 DAG 可视化。它可通过 LiteLLM 配置不同模型提供商,也支持指向本地模型服务端点;评测结果可写入指定输出目录,并可按示例上传至 Hugging Face。
使用 are-run 时,ARE 按 -s 指定的场景和 -a 指定的代理运行单个场景。使用 are-benchmark run 时,它从 -d 场景目录或 --hf 指定的 Hugging Face 数据集读取场景,执行代理,并可通过 --limit 控制运行数量。Gaia2 评测可用 are-benchmark gaia2-run 或 are-benchmark run 配合 --hf meta-agents-research-environments/gaia2 和 --hf_split validation 启动。执行过程中,代理以 ReAct(Reasoning + Acting)方式与 Apps 交互,Events 让环境状态发生变化,场景的验证逻辑负责评估任务执行。模型可通过 --model、--provider 或 --model_provider 配置;本地服务可使用 --endpoint,结果可通过 --output_dir 保存,Gaia2 示例还使用 --hf_upload 上传结果。
- 研究团队要比较不同代理在会收到新信息、条件会变化的任务中的表现时,可运行 Gaia2 验证集或完整评测。
- 正在开发本地部署模型的工程师需要将其 HTTP 服务接入评测流程时,可用 --provider local 和 --endpoint 指定服务地址。
- 需要检查代理能否完成涉及电子邮件、日历或文件系统的组合任务的开发者,可运行单个场景并观察执行结果。
- 希望以图形界面审阅任务执行与场景依赖关系的研究人员,可通过 are-gui 启动交互式 Playground 或 Scenarios 视图。
- 准备提交 Gaia2 自发布结果的团队,可将评测输出写入目录,并按示例使用 --hf_upload 上传结果。
这个 Agent 有哪些优点和局限?
- Gaia2 提供 800 个、覆盖 10 个 universe 的动态场景,而不是只评测静态任务。
- 场景明确结合 Apps、Events 和验证逻辑,可表示环境变化及多步任务执行。
- 同时提供单场景运行、批量基准评测和带 DAG 可视化的 Web GUI。
- 通过 LiteLLM 支持多个模型提供商,并明确给出了 Llama API 与本地端点配置路径。
- 运行环境要求 Python 3.8+;快速启动路径还要求先安装 uv。
- 使用远程模型需要配置相应提供商凭据,例如 LLAMA_API_KEY;本地模型则需要可访问的服务端点。
- README 没有给出稳定的 Python API 调用签名,因此基于库接口进行深度集成前需查阅 API 文档。
- Gaia2 结果上传示例依赖 Hugging Face,且仓库材料未说明上传认证、费用或排行榜审核规则。
如何安装或部署这个 Agent?
前置条件:安装 Python 3.8+ 与 uv。最快的首次运行方式是:
uvx --from meta-agents-research-environments are-run -s scenario_tutorial -a default也可安装包:
pip install meta-agents-research-environments如需 GUI:
pip install "meta-agents-research-environments[gui]"运行需要远程模型时,按所选提供商设置凭据;README 示例使用:
export LLAMA_API_KEY="your-api-key"如何使用这个 Agent?
运行单个场景:
are-run -s scenario_find_image_file -a default从本地场景目录运行基准:
are-benchmark run -d /path/to/scenarios --agent default --limit 10运行 Gaia2 验证集:
are-benchmark gaia2-run --hf meta-agents-research-environments/gaia2 --hf_split validation -l 5使用 Llama API 的示例配置:
export LLAMA_API_KEY="your-api-key"
are-benchmark run --hf meta-agents-research-environments/gaia2 --hf_split validation --model Llama-3.1-70B-Instruct --provider llama-api --agent default启动 GUI:
are-gui -s scenario_find_image_fileGUI 通常运行在 http://localhost:8080;各命令可加 --help 查看参数。