Arbor 自主研究优化器
面向可量化目标的自主实验、验证与迭代优化框架。
这个 Agent 能做什么,适合哪些场景?
Arbor 是一个以假设树为核心的自主研究运行时,用于对具有目标和评测指标的任务持续开展实验优化。它由 Coordinator 和 Executor 协作:前者维护 Idea Tree、选择研究方向并作出合并或剪枝决策,后者在独立 Git worktree 中实现单个想法并运行评测。原生 Python CLI 提供配置、交互式 intake、仪表盘、检查点恢复、报告导出和只读 Web 监控;每次运行会在 .arbor/sessions/ 下保存事件、统计、树和实验产物。它也可通过 arbor install、技能套件及可选 MCP 服务嵌入 Codex 或 Claude Code,由宿主模型负责推理而 Arbor 提供确定性研究工具。适合已有可运行评测、明确指标和干净 Git 仓库的优化任务,而不是代替尚未定义评测标准的项目规划。
启动 arbor 后,系统通过 intake 将目标、目标目录、指标、基线、预算、dev/test 划分和产物路径整理为 Arbor Research Contract。Coordinator 按 Observe、Ideate、Select、Dispatch、Backpropagate、Decide 六步循环维护 Idea Tree,并把候选假设分派给 Executor。Executor 在专用分支和 Git worktree 中修改代码、在 dev 信号上迭代、回报证据;只有超过配置阈值的改进才会经过 held-out test 并合并到每次运行的 trunk。CLI 可用 arbor replay 重放事件,arbor report 重新生成 REPORT.md,arbor export 输出 HTML 或 JSONL,arbor web 提供只读会话监控;arbor idea-check 可通过 alphaXiv 检查想法的相关工作与新颖性。
- 负责机器学习基准的研究工程师,希望在固定实验预算内系统尝试优化器或架构改动,并以开发集和留出测试集区分调参与保留改进。
- 维护代码评测基准的开发团队,需要让多个候选实现各自在隔离 Git worktree 中运行,避免未验证变更直接污染 main。
- 构建 BrowseComp、Terminal-Bench 一类可执行评测任务的人员,希望让研究过程记录失败分支、得分和可复用洞见,而非只保留最后一次尝试。
- 使用 Codex 或 Claude Code 订阅而没有单独 API 密钥的开发者,希望通过 Arbor 技能和可选 MCP 工具执行带树结构、评测与受保护合并的研究流程。
- 需要先检查某项技术思路是否已有近似工作的研究者,可在投入实验前运行 arbor idea-check 取得 alphaXiv 驱动的简要判定。
这个 Agent 有哪些优点和局限?
- Coordinator 与 Executor 分工明确,并用 Idea Tree 记录结果、失败模式和向上抽象的洞见,支持跨循环的结构化探索。
- 每项实验使用独立 Git worktree;变更先在 dev 上迭代,再以 held-out test 和可配置 merge_threshold 决定是否进入运行 trunk。
- 同时提供原生 CLI、独立技能套件和可选 MCP 服务;既可使用 OpenAI、Anthropic 或 OpenAI 兼容后端,也能在 Codex/Claude Code 中采用无 API key 的宿主模型流程。
- 会话产物可恢复和审计,包含 REPORT.md、events.jsonl、run_stats.json、Idea Tree 及每项实验的产物,并支持 HTML/JSONL 导出。
- 原生研究运行需要配置模型提供商与凭据;无密钥模式依赖 Codex 或 Claude Code 等宿主编码代理的模型能力。
- 目标项目必须具备可运行评测、最好分开的 dev/test 数据,并且要求干净 Git 仓库;没有这些基础设施时需先自行准备。
- 自动文献检索并非所有环境可用:内置 alphaXiv 后端要求 Python 3.12+,Python 3.10/3.11 会降级;运行内默认也关闭网络检索。
- Arbor 将通过运行的 trunk 与 main 分离,最终是否把 trunk 合并进 main 仍由使用者执行和判断。
如何安装或部署这个 Agent?
要求 Python 3.10+ 与 Git。安装原生 CLI:
pip install arbor-agent
arbor doctor
随后运行 arbor quickstart 配置免费密钥或本地 Ollama,或运行 arbor setup 配置 provider、model、base_url 与 API key;配置写入 ~/.arbor/config.yaml。只看演示无需密钥:arbor replay --demo。若要在 Codex 或 Claude Code 内以宿主模型运行,可执行 pip install arbor-agent、arbor install;可选 MCP 支持需先执行 pip install "arbor-agent[mcp]",再将 arbor mcp 注册到支持 MCP 的宿主。
如何使用这个 Agent?
在包含可运行评测脚本、评测数据(最好含 dev 与 held-out test)且工作区干净的 Git 仓库中运行:
arbor "improve validation score without touching the test split" --cwd ./benchmark
在 intake 中确认目标、指标、预算与权限后才会启动实验。也可用 research_config.yaml 指定 task、coordinator.max_cycles、coordinator.max_depth、merge_threshold 和 executor.max_turns,再运行:
arbor --cwd ./benchmark --config research_config.yaml
中断的任务可用 arbor --resume --run-name <run_name> 恢复;通过 git merge research/run_xxx/trunk 将满意的运行结果提升到 main。
这个 Agent 与同类方案有什么区别?
仓库报告称,在其列出的六项任务的 held-out 测试中,Arbor 的结果高于所比较的 Claude Code 与 Codex 基线;例如 BrowseComp 为 67.67,对比 Claude Code 的 53.33 和 Codex 的 50.00,Terminal-Bench 2.0 为 77.36,对比 71.70 和 73.59。这些是该仓库披露的评测结果,不等同于所有项目上的通用性能保证。