开源编程 Agent 横向对比

12 个已完成评审的 agent

下面每个 agent 都带有 GitHub 能识别出的开源许可证,并且都过了同一套 FARS 评审,所以这些数字之间是可比的,不是各自 README 里搬来的自述。表格先给评审结果,下面每一节是该 agent 自己的定位,包括它的文档承认自己不适合的场景。

# Agent FARS 信任 Star 许可证 语言 最近提交
1 elizaOS 88 24/25 19.2k MIT TypeScript 2026-09-02
2 Unlazy 完成纪律 86 25/25 3.0k MIT JavaScript 2026-08-29
3 Better Harness 85 23/25 2.1k MIT JavaScript 2026-09-02
4 Apache Maka 82 22/25 4.6k Apache-2.0 TypeScript 2026-09-02
5 JS Reverse MCP 82 21/25 2.7k Apache-2.0 TypeScript 2026-08-25
6 NotebookLM Python 自动化套件 81 21/25 19.1k MIT Python 2026-09-02
7 ADK 智能体配方库 ✓ Google 81 23/25 10.3k Apache-2.0 Python 2026-09-01
8 Kungfu 81 18/25 4.5k Apache-2.0 C++ 2026-09-02
9 Osaurus 80 22/25 7.8k MIT Swift 2026-09-02
10 Chrome DevTools MCP 79 17/25 50.6k Apache-2.0 TypeScript 2026-09-02
11 LangWatch 78 19/25 3.5k Apache-2.0 TypeScript 2026-09-02
12 Harmonist 78 21/25 2.3k MIT Python 2026-06-09
这个排序是怎么来的

排序依据是 FARS 总分,Star 只用来打平手——热度衡量的是关注度,不是这东西撑不撑得住。看排序之前有两点要知道:这些都是静态评审(只看源码、文档与仓库元数据,没有做运行复测),可靠性、有效性、可验证三项因此被压了上限,实际可得满分是 77 而不是 100;而且几分之差落在这套方法的噪声范围内。请把这张表当成值得进一步考察的短名单,而不是结论。每个分数都链到完整的维度拆解和背后的证据。 评分方法 →

1. elizaOS

差异在哪

与可选的 Eliza Cloud 路径相比,本地运行时和直接模型提供商配置仍是一等选择:前者提供账户、认证、托管模型路由、应用与智能体部署、远程连接及跨设备服务;后两者提供更直接的自托管与提供商控制。对于整机系统,当前单体仓库负责 Eliza 应用外壳和原生运行时桥接,而独立的 elizaOS/os 仓库负责可启动 Linux、AOSP、安装器、发布清单和操作系统工具链。

完整评审 → GitHub →

2. Unlazy 完成纪律

完整评审 → GitHub →

3. Better Harness

完整评审 → GitHub →

4. Apache Maka

完整评审 → GitHub →

5. JS Reverse MCP

差异在哪

相较于把 Chrome DevTools API 原样暴露给模型,该项目将脚本、断点、网络、WebSocket、状态和本地文件操作组合成面向连续推理的 MCP primitives。默认 Patchright 模式使用系统 Google Chrome,保留 Web Store、扩展和同步;可选 --cloak 模式改用带 C++ 源码级指纹 patch 的 CloakBrowser,但不提供 Google 服务或 Web Store。维护者明确将反检测定位为调试链路的支撑能力,而不是把项目做成通用爬虫框架。

完整评审 → GitHub →

6. NotebookLM Python 自动化套件

差异在哪

相较 Gemini Notebook 网页界面,这个项目侧重程序化操作和本地导出:它可批量下载产物、导出测验与闪卡的结构化格式、提取思维导图 JSON、下载 CSV、获取来源全文、修改单张幻灯片并管理分享权限。代价是它依赖未公开接口,稳定性低于由 Google 正式维护的网页产品。

完整评审 → GitHub →

7. ADK 智能体配方库

完整评审 → GitHub →

8. Kungfu

差异在哪

与在 Codex、Claude、OpenCode 或 Amp 之间手动复制聊天和重新解释决策相比,Kungfu 把同一 Work 的目标、证据、进度和 Attempt 历史保存在会话之外。它不是这些 Agent 的替代品,而是让它们共享持久工作状态的协调层;TUI 和 GUI 也只是可选侧边视图,不取代原生 Agent 控制台。

完整评审 → GitHub →

9. Osaurus

完整评审 → GitHub →

10. Chrome DevTools MCP

差异在哪

完整模式面向深入调试,提供自动化、性能、网络、控制台及其他可选工具;--slim 模式只暴露导航、脚本执行和截图三项工具,更适合基础浏览和控制上下文规模。MCP 服务器适合让兼容客户端以结构化工具调用集成浏览器;附带的 CLI 则用于不采用 MCP 的场景。默认启动专用 Chrome 能隔离日常浏览状态,而连接已有 Chrome 更适合保留登录和手工测试状态,但会提高敏感数据暴露风险。

完整评审 → GitHub →

11. LangWatch

差异在哪

与自行拼接追踪、数据集、评测和提示词优化工具相比,LangWatch 明确将这些环节整合为 trace → dataset → evaluate → optimize → re-test 的循环。它还以 OpenTelemetry 为基础,因此可接收兼容该标准的库所产生的追踪,而不局限于 README 列出的直接集成。

完整评审 → GitHub →

12. Harmonist

差异在哪

Harmonist 将自己定位为治理 AI 编码工作流的项目内置包,而非用于构建智能体应用的 LangChain、CrewAI、AutoGen 或 MetaGPT 替代品。文档称这些框架提供编排原语,而 Harmonist 通过 IDE 钩子约束编码助手的审查、记忆和完成流程;两者可以同时使用。

完整评审 → GitHub →