开源编程 Agent 横向对比
下面每个 agent 都带有 GitHub 能识别出的开源许可证,并且都过了同一套 FARS 评审,所以这些数字之间是可比的,不是各自 README 里搬来的自述。表格先给评审结果,下面每一节是该 agent 自己的定位,包括它的文档承认自己不适合的场景。
| # | Agent | FARS | 信任 | Star | 许可证 | 语言 | 最近提交 |
|---|---|---|---|---|---|---|---|
| 1 | elizaOS | 88 | 24/25 | 19.2k | MIT | TypeScript | 2026-09-02 |
| 2 | Unlazy 完成纪律 | 86 | 25/25 | 3.0k | MIT | JavaScript | 2026-08-29 |
| 3 | Better Harness | 85 | 23/25 | 2.1k | MIT | JavaScript | 2026-09-02 |
| 4 | Apache Maka | 82 | 22/25 | 4.6k | Apache-2.0 | TypeScript | 2026-09-02 |
| 5 | JS Reverse MCP | 82 | 21/25 | 2.7k | Apache-2.0 | TypeScript | 2026-08-25 |
| 6 | NotebookLM Python 自动化套件 | 81 | 21/25 | 19.1k | MIT | Python | 2026-09-02 |
| 7 | ADK 智能体配方库 ✓ Google | 81 | 23/25 | 10.3k | Apache-2.0 | Python | 2026-09-01 |
| 8 | Kungfu | 81 | 18/25 | 4.5k | Apache-2.0 | C++ | 2026-09-02 |
| 9 | Osaurus | 80 | 22/25 | 7.8k | MIT | Swift | 2026-09-02 |
| 10 | Chrome DevTools MCP | 79 | 17/25 | 50.6k | Apache-2.0 | TypeScript | 2026-09-02 |
| 11 | LangWatch | 78 | 19/25 | 3.5k | Apache-2.0 | TypeScript | 2026-09-02 |
| 12 | Harmonist | 78 | 21/25 | 2.3k | MIT | Python | 2026-06-09 |
排序依据是 FARS 总分,Star 只用来打平手——热度衡量的是关注度,不是这东西撑不撑得住。看排序之前有两点要知道:这些都是静态评审(只看源码、文档与仓库元数据,没有做运行复测),可靠性、有效性、可验证三项因此被压了上限,实际可得满分是 77 而不是 100;而且几分之差落在这套方法的噪声范围内。请把这张表当成值得进一步考察的短名单,而不是结论。每个分数都链到完整的维度拆解和背后的证据。 评分方法 →
1. elizaOS
构建、运行并扩展自主 AI 智能体的开源 TypeScript 系统。
差异在哪
与可选的 Eliza Cloud 路径相比,本地运行时和直接模型提供商配置仍是一等选择:前者提供账户、认证、托管模型路由、应用与智能体部署、远程连接及跨设备服务;后两者提供更直接的自托管与提供商控制。对于整机系统,当前单体仓库负责 Eliza 应用外壳和原生运行时桥接,而独立的 elizaOS/os 仓库负责可启动 Linux、AOSP、安装器、发布清单和操作系统工具链。
2. Unlazy 完成纪律
用深度拆解、验收账本和可执行门禁约束 AI 代理过早交付。
3. Better Harness
用可核验证据诊断并改进编码智能体的工作闭环。
4. Apache Maka
面向真实项目、保留可恢复执行记录的本地优先智能体工作区。
5. JS Reverse MCP
让 AI 助手持续调试和复盘网页 JavaScript 行为。
差异在哪
相较于把 Chrome DevTools API 原样暴露给模型,该项目将脚本、断点、网络、WebSocket、状态和本地文件操作组合成面向连续推理的 MCP primitives。默认 Patchright 模式使用系统 Google Chrome,保留 Web Store、扩展和同步;可选 --cloak 模式改用带 C++ 源码级指纹 patch 的 CloakBrowser,但不提供 Google 服务或 Web Store。维护者明确将反检测定位为调试链路的支撑能力,而不是把项目做成通用爬虫框架。
6. NotebookLM Python 自动化套件
用 Python、CLI 或智能体自动操作 Gemini Notebook。
差异在哪
相较 Gemini Notebook 网页界面,这个项目侧重程序化操作和本地导出:它可批量下载产物、导出测验与闪卡的结构化格式、提取思维导图 JSON、下载 CSV、获取来源全文、修改单张幻灯片并管理分享权限。代价是它依赖未公开接口,稳定性低于由 Google 正式维护的网页产品。
7. ADK 智能体配方库
用可运行的 ADK 示例快速搭建智能体项目。
8. Kungfu
让同一项工作跨 Agent、故障与会话持续推进。
差异在哪
与在 Codex、Claude、OpenCode 或 Amp 之间手动复制聊天和重新解释决策相比,Kungfu 把同一 Work 的目标、证据、进度和 Attempt 历史保存在会话之外。它不是这些 Agent 的替代品,而是让它们共享持久工作状态的协调层;TUI 和 GUI 也只是可选侧边视图,不取代原生 Agent 控制台。
9. Osaurus
在 Mac 上运行可记忆、可执行任务且不绑定模型的个人 AI 智能体。
10. Chrome DevTools MCP
让编码智能体直接操控 Chrome,完成自动化、调试与性能分析。
差异在哪
完整模式面向深入调试,提供自动化、性能、网络、控制台及其他可选工具;--slim 模式只暴露导航、脚本执行和截图三项工具,更适合基础浏览和控制上下文规模。MCP 服务器适合让兼容客户端以结构化工具调用集成浏览器;附带的 CLI 则用于不采用 MCP 的场景。默认启动专用 Chrome 能隔离日常浏览状态,而连接已有 Chrome 更适合保留登录和手工测试状态,但会提高敏感数据暴露风险。
11. LangWatch
面向 LLM 应用的评测、智能体测试、追踪与生产监控平台。
差异在哪
与自行拼接追踪、数据集、评测和提示词优化工具相比,LangWatch 明确将这些环节整合为 trace → dataset → evaluate → optimize → re-test 的循环。它还以 OpenTelemetry 为基础,因此可接收兼容该标准的库所产生的追踪,而不局限于 README 列出的直接集成。
12. Harmonist
用 IDE 钩子强制执行多智能体开发流程中的审查、记忆与完整性检查。
差异在哪
Harmonist 将自己定位为治理 AI 编码工作流的项目内置包,而非用于构建智能体应用的 LangChain、CrewAI、AutoGen 或 MetaGPT 替代品。文档称这些框架提供编排原语,而 Harmonist 通过 IDE 钩子约束编码助手的审查、记忆和完成流程;两者可以同时使用。