Arbor 自主研究优化器

面向可量化目标的自主实验、验证与迭代优化框架。

Star 数
★ 1.1k
最近更新
16 天前
License
Apache-2.0
主语言
Python

30 秒速览

可在哪里用
通用 · 跨平台Codex · Claude Code · OpenAI API · Claude API
开始前需要
Python >= 3.10GitShell / 命令行网络访问本地文件系统MCP Server
典型场景
负责机器学习基准的研究工程师,希望在固定实验预算内系统尝试优化器或架构改动,并以开发集和留出测试集区分调参与保留改进。
主要局限
原生研究运行需要配置模型提供商与凭据;无密钥模式依赖 Codex 或 Claude Code 等宿主编码代理的模型能力。

这个 Agent 能做什么,适合哪些场景?

Arbor 是一个以假设树为核心的自主研究运行时,用于对具有目标和评测指标的任务持续开展实验优化。它由 Coordinator 和 Executor 协作:前者维护 Idea Tree、选择研究方向并作出合并或剪枝决策,后者在独立 Git worktree 中实现单个想法并运行评测。原生 Python CLI 提供配置、交互式 intake、仪表盘、检查点恢复、报告导出和只读 Web 监控;每次运行会在 .arbor/sessions/ 下保存事件、统计、树和实验产物。它也可通过 arbor install、技能套件及可选 MCP 服务嵌入 Codex 或 Claude Code,由宿主模型负责推理而 Arbor 提供确定性研究工具。适合已有可运行评测、明确指标和干净 Git 仓库的优化任务,而不是代替尚未定义评测标准的项目规划。

启动 arbor 后,系统通过 intake 将目标、目标目录、指标、基线、预算、dev/test 划分和产物路径整理为 Arbor Research Contract。Coordinator 按 Observe、Ideate、Select、Dispatch、Backpropagate、Decide 六步循环维护 Idea Tree,并把候选假设分派给 Executor。Executor 在专用分支和 Git worktree 中修改代码、在 dev 信号上迭代、回报证据;只有超过配置阈值的改进才会经过 held-out test 并合并到每次运行的 trunk。CLI 可用 arbor replay 重放事件,arbor report 重新生成 REPORT.md,arbor export 输出 HTML 或 JSONL,arbor web 提供只读会话监控;arbor idea-check 可通过 alphaXiv 检查想法的相关工作与新颖性。

  1. 负责机器学习基准的研究工程师,希望在固定实验预算内系统尝试优化器或架构改动,并以开发集和留出测试集区分调参与保留改进。
  2. 维护代码评测基准的开发团队,需要让多个候选实现各自在隔离 Git worktree 中运行,避免未验证变更直接污染 main。
  3. 构建 BrowseComp、Terminal-Bench 一类可执行评测任务的人员,希望让研究过程记录失败分支、得分和可复用洞见,而非只保留最后一次尝试。
  4. 使用 Codex 或 Claude Code 订阅而没有单独 API 密钥的开发者,希望通过 Arbor 技能和可选 MCP 工具执行带树结构、评测与受保护合并的研究流程。
  5. 需要先检查某项技术思路是否已有近似工作的研究者,可在投入实验前运行 arbor idea-check 取得 alphaXiv 驱动的简要判定。

如何安装或部署这个 Agent?

要求 Python 3.10+ 与 Git。安装原生 CLI:

pip install arbor-agent
arbor doctor

随后运行 arbor quickstart 配置免费密钥或本地 Ollama,或运行 arbor setup 配置 provider、model、base_url 与 API key;配置写入 ~/.arbor/config.yaml。只看演示无需密钥:arbor replay --demo。若要在 Codex 或 Claude Code 内以宿主模型运行,可执行 pip install arbor-agent、arbor install;可选 MCP 支持需先执行 pip install "arbor-agent[mcp]",再将 arbor mcp 注册到支持 MCP 的宿主。

如何使用这个 Agent?

在包含可运行评测脚本、评测数据(最好含 dev 与 held-out test)且工作区干净的 Git 仓库中运行:

arbor "improve validation score without touching the test split" --cwd ./benchmark

在 intake 中确认目标、指标、预算与权限后才会启动实验。也可用 research_config.yaml 指定 task、coordinator.max_cycles、coordinator.max_depth、merge_threshold 和 executor.max_turns,再运行:

arbor --cwd ./benchmark --config research_config.yaml

中断的任务可用 arbor --resume --run-name <run_name> 恢复;通过 git merge research/run_xxx/trunk 将满意的运行结果提升到 main。

这个 Agent 有哪些优点和局限?

优点
  • Coordinator 与 Executor 分工明确,并用 Idea Tree 记录结果、失败模式和向上抽象的洞见,支持跨循环的结构化探索。
  • 每项实验使用独立 Git worktree;变更先在 dev 上迭代,再以 held-out test 和可配置 merge_threshold 决定是否进入运行 trunk。
  • 同时提供原生 CLI、独立技能套件和可选 MCP 服务;既可使用 OpenAI、Anthropic 或 OpenAI 兼容后端,也能在 Codex/Claude Code 中采用无 API key 的宿主模型流程。
  • 会话产物可恢复和审计,包含 REPORT.md、events.jsonl、run_stats.json、Idea Tree 及每项实验的产物,并支持 HTML/JSONL 导出。
局限
  • 原生研究运行需要配置模型提供商与凭据;无密钥模式依赖 Codex 或 Claude Code 等宿主编码代理的模型能力。
  • 目标项目必须具备可运行评测、最好分开的 dev/test 数据,并且要求干净 Git 仓库;没有这些基础设施时需先自行准备。
  • 自动文献检索并非所有环境可用:内置 alphaXiv 后端要求 Python 3.12+,Python 3.10/3.11 会降级;运行内默认也关闭网络检索。
  • Arbor 将通过运行的 trunk 与 main 分离,最终是否把 trunk 合并进 main 仍由使用者执行和判断。

这个 Agent 与同类方案有什么区别?

仓库报告称,在其列出的六项任务的 held-out 测试中,Arbor 的结果高于所比较的 Claude Code 与 Codex 基线;例如 BrowseComp 为 67.67,对比 Claude Code 的 53.33 和 Codex 的 50.00,Terminal-Bench 2.0 为 77.36,对比 71.70 和 73.59。这些是该仓库披露的评测结果,不等同于所有项目上的通用性能保证。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
Arbor 自主研究优化器 当前 55 · 缺口较多 ★ 1.1k 16 天前 Python Codex · Claude Code · OpenAI API · Claude API
Happier 82 · 表现良好 ★ 1.7k 今天 TypeScript Codex · Claude Code
Bernstein 78 · 表现良好 ★ 1.3k 今天 Python Codex · Claude Code · OpenAI API
Loop Engineering 69 · 存在缺口 ★ 11k 今天 TypeScript Codex · Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
55/ 100 五分制 2.8 / 5
信任安全 12/29
可靠稳定 9/14
适用触发 12/18
规范维护 10/18
有效结果 9/13
证据核验 3/8
查看各维度的扣分理由
信任安全12 / 29 · 2.1/5

证据显示:README 描述了多种交互模式(auto/direction/review/collaborative),其中 review 模式在节点和执行器前暂停,体现了用户确认机制;实验在独立 git worktree 中进行,main 分支不受影响,提供了回滚能力;但权限最小化、数据流透明性、敏感数据处理、依赖安全、外部影响和来源归属的证据不足。扣分原因:未明确说明工具权限范围、数据流向、敏感数据保护措施、依赖漏洞扫描、外部网络请求的明确控制(除文献搜索外)以及第三方代码来源验证。

可靠稳定9 / 14 · 3.2/5

证据显示:README 和代码结构一致,描述了清晰的六步循环和 Idea Tree 机制;依赖列表明确,且 alphaxiv-py 在 Python 3.10/3.11 上优雅降级;测试覆盖了失败场景(如搜索失败、缺失包)。扣分原因:未提供运行时错误消息的具体示例,且依赖可用性未经过实际验证。

适用触发12 / 18 · 3.3/5

证据显示:README 描述了多种使用场景(CLI、技能套件、MCP),并提供了配置选项和插件机制;能力边界通过交互模式和权限设置(如 review 模式)有所体现;触发精度通过明确的命令和配置(如 --max-cycles)实现;环境适配通过支持多种模型后端和平台(如 Claude Code、Codex)体现。扣分原因:能力边界描述不够详细,未明确列出所有限制。

规范维护10 / 18 · 2.8/5

证据显示:README 结构清晰,包含安装、配置、CLI 参考、示例和文档链接;提供了安装说明和示例配置;命名稳定(arbor 命令和包名一致);提供了示例任务和 FAQ 链接;许可证为 Apache-2.0;版本通过 setuptools-scm 自动生成。扣分原因:已知限制未明确列出,版本变更日志未提供,维护责任未明确说明。

有效结果9 / 13 · 3.5/5

证据显示:README 提供了输出示例(如报告、dashboard),并声称在多个基准上优于其他工具;边际价值体现在自动化研究流程和假设树机制;成本效益通过可配置的预算和交互模式体现。扣分原因:输出可用性未提供具体格式示例,边际价值和成本效益的声明缺乏独立验证。

证据核验3 / 8 · 1.9/5

证据显示:README 引用了 arXiv 论文和项目页面,提供了基准结果表格;测试文件验证了部分功能(如 alphaXiv 后端)。扣分原因:基准结果未提供复现细节,事实与推断未明确分离,跨来源验证不足。

风险与缓解建议
  • 该 Agent 具有自主执行实验和修改代码的能力,需在受控环境中使用,并确保用户确认机制(如 review 模式)已启用。
  • 依赖项未进行漏洞扫描,建议在部署前检查依赖安全性。
  • 基准性能声明(如 2.5× 提升)缺乏独立复现,应谨慎对待。
证据充分度: 评估于 2026年8月9日 审查版本 65ffcc8fdf23 评估后仓库已有新提交,评分可能未覆盖最新改动
查看完整评分方法 →

常见问题

运行 Arbor 是否一定需要 API key?
不一定。原生 CLI 运行需通过 arbor setup 或 quickstart 配置模型提供商;在 Codex 或 Claude Code 的 keyless 集成中,宿主编码代理的模型负责推理,Arbor 不直接调用 LLM。
它会直接修改 main 分支吗?
Executor 在独立 worktree 和分支中工作,验证过的改进进入每次运行的 trunk。将 trunk 合并到 main 是用户后续执行的操作。
如何避免只对开发集过拟合?
文档描述的流程是先在 dev 信号上迭代,再用 held-out test 验证;仅达到配置的 merge_threshold 的提升才会被保留。
能否在没有真实任务前先体验?
可以。arbor replay --demo 会在实时仪表盘中重放内置样例,不需要 API key 或配置。
文献检索会默认访问网络吗?
不会。运行中的内置检索默认关闭;启用 alphaXiv 后端或主动执行 arbor idea-check 时才会进行相关工作与新颖性检查。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents