Best of Agent Harnesses
收录并每周重新评分的 100+ AI 代理 Harness 排名清单,并通过 MCP 服务器、llms.txt 与 JSON 让代理自己也能查询推荐。
CI 工作流声明最小权限(contents: read),仅安装 pytest/markdown 等少数依赖,数据流透明度尚可;来源引用非常完整(链接到 Willison、Karpathy、SWE-agent 论文等)。扣分项:README 提供 curl 下载 agent 骨架写入 .claude/agents/ 的用法,属于引入外部指令文件,未提示用户审查其内容,用户确认环节偏薄;weekly-rescore 工作流使用 GITHUB_TOKEN 推送但脚本本体未见,回滚仅靠 git 隐式能力,无明确回滚说明。
仓库带 pytest 套件,测试覆盖 ARCHIVED 块解析的回归场景并对格式漂移以 SystemExit 明确失败(有意的失败信息);CI 在 PR 和 push 时运行并含端到端站点构建。扣分项:未见针对核心推荐逻辑/渲染输出的更广测试,依赖(pip install markdown 等)未锁定版本。
面向明确的多受众场景(人类读者、编码 agent、研究者),按用例索引、按能力/自主性/恢复力分层,决策指南和对比页丰富;MCP 提供 recommend/pick_harness 等多入口。扣分项:环境适配(需 uv、Python 3.12)有说明但边界条件(离线、限流、GitHub API 失败时 pick_infrastructure 的降级行为)未见描述。
信息架构出色:目录、标签交叉引用、分层表格、FAQ、机器可读产物(llms.txt/JSON)齐备;许可证为完整的 CC-BY-SA-4.0 文本。扣分项:无 CHANGELOG 或正式版本号(仅 stars 捕获日期),命名稳定性依赖单维护者,维护承诺('merged fast')为断言而非制度性证据。
输出可用性高:站点、JSON、MCP、agent 骨架多种消费形态;边际价值明确——解决 agent 为特定模型/任务选 harness 的实际问题,且每周重评;成本极低(读一个列表或一条 MCP 调用),性价比高。未发现明显扣分点,满分为文本证据所支持。
主张可追溯性强:排名方法、星数捕获日期、外部基准引用(SWE-bench Pro、AINews)均有链接;编辑评分明确标注为 editorial 并接受维护者更正。扣分项:部分引用(2026 年日期、未来基准数据)在静态审查下无法独立佐证,事实与推断的分离仅在局部(评分标注)做到,星数等数字本身无法核验。
- curl 安装 agent 骨架会将远程 Markdown 指令直接放入 .claude/agents/,安装前应人工审查该文件内容。
- weekly-rescore 工作流使用 GITHUB_TOKEN 自动推送,来源脚本未在本仓库证据中出现,建议核对其行为。
- README 中的星数、日期(含 2026 年)与外部引用为静态文本,使用前应自行核验时效性。
- 发布者身份未经企业注册库验证;对推荐结论的信任应基于仓库内证据而非身份。
- 依赖未锁版本(pip install markdown/pytest),复现构建时建议自行固定。
这个 Agent 能做什么,适合哪些场景?
该仓库是一份精选、排名并每周重新评分的 AI 代理 harness(代理运行时)清单,收录 160 余个项目,覆盖编码代理产品、框架、多代理编排、记忆层、沙箱执行、评测基准等类别。每个条目带有星标数、开源状态、简洁度-能力分层、自主性与故障恢复分层标记以及一个具体示例链接。清单同时以 harnesses. 和 llms.txt 两种机器可读格式发布,并提供一个 MCP 服务器(发布于 PyPI 与官方 MCP 注册表,名称为 io.github.RyanAlberts/agent-harnesses),暴露 recommend、pick_harness、compare 等工具。仓库还附带三个可直接安装的代理骨架(harness-scout、stack-auditor、harness-radar),可运行在用户已有的 AI 订阅上,并将结果推送到 Slack 或 Notion。仓库以 CC-BY-SA-4.0 许可发布,并提供可搜索的在线站点,支持按能力、自主性、恢复能力过滤。
仓库每周重新抓取并重排 160+ 个 harness 项目的排名,按环境、编排、生命周期、护栏等 harness 关注维度与星标/活跃度评分,并从清单数据自动生成景观图(landscape.svg、axes-grid.svg)。它发布三份机器可读产物:harnesses.(含类别、复杂度分层、能力标签、星数、许可信号、示例链接)、llms.txt(整份清单的代理可读文件)以及一个 MCP 服务器,工具包括 recommend(一个有观点的推荐加替代项与避坑提示)、compare/compare_for(2–4 个 harness 多轴对比)、pick_harness(支持复杂度/自主性/恢复力过滤的排名选择)、pick_infrastructure(覆盖基础设施栈各层并进行实时的 GitHub/Hacker News 发现)、search_harnesses、get_harness、list_categories、list_comparisons、get_comparison。agents/ 目录提供三个代理骨架:harness-scout(按需求选 harness 并做坟场检查)、stack-auditor(识别代码库中已死亡的 harness)、harness-radar(每周变动简报),均可将结果交付到 Slack 或 Notion。清单还包含多份对比决策指南,如如何挑选 harness、两周试用协议、终端编码代理对比、多代理编排对比等。
- 团队在为自己的模型和任务挑选编码 harness 时,希望基于 SWE-bench Pro 等基准证据而非随大流做决策——harness 换动可使 pass@1 从 23% 变到 52%
- 代理开发者希望让自己的编码代理直接调用 MCP 工具(recommend、pick_harness)自动为用户推荐匹配的 harness
- 工程负责人想对比 opencode、Codex、Gemini CLI、crush、goose 等终端编码代理,或对比 OpenAI Agents SDK、CrewAI、AutoGen、LangGraph 等编排框架
- 需要为代理挑选记忆层(Mem0、Letta、claude-mem)、沙箱执行(E2B、Daytona、Modal)或评测平台(Langfuse、LangSmith、Braintrust、Phoenix)的团队
- 维护多代理技术栈的工程师想每周获得 harness 上升、新入、死亡、毕业的变动简报(harness-radar 骨架)
- 个人开发者想搭建常驻聊天应用的个人代理,可在 OpenClaw、Hermes、Khoj、Agent Zero 等常驻代理运行时类别中筛选
这个 Agent 有哪些优点和局限?
- 规模与维护频率突出:164 个项目、每周重评分,且提供可搜索站点与自动再生的景观图表
- 原生面向代理:MCP 服务器(发布于 PyPI 与官方 MCP 注册表)、llms.txt 与 harnesses. 使代理可直接查询推荐,而非仅供人类浏览
- 基于证据的选型内容:引用 SWE-bench Pro 数据说明 harness 对分数的影响(同一模型在不同 harness 下 pass@1 从 23% 到 52%),并提供两周试用协议、坟场警告(如标记星标操纵的仓库)等决策工具
- 三个开箱即用的代理骨架(harness-scout、stack-auditor、harness-radar)可克隆到 .claude/agents/ 直接使用,并支持 Slack/Notion 交付
- 评分是编辑性的,来自公开文档而非第一手测试;维护者需通过 issue/PR 自行纠错
- README 仅展示部分内容,部分条目(尤其低星项目)的许可状态标注为 ❓(无或不明许可),采用前需自行核实
- 部分条目有许可限制或来源可用限制(如 ⚠️ 标记的 Fair-code、FSL-1.1-MIT、Elastic-2.0、Polyform-SU 等),不能当作纯开源采用
- 星标数据为快照(2026-09-09 抓取),清单侧重 harness 生态的信息聚合,本身不是可运行的代理产品
如何安装或部署这个 Agent?
仓库本身是清单/数据项目,克隆即可:git clone https://github.com/RyanAlberts/best-of-Agent-Harnesses。机器可读数据可直接访问 raw URL:https://raw.githubusercontent.com/RyanAlberts/best-of-Agent-Harnesses/main/llms.txt 和同仓库下的 harnesses.。MCP 服务器已发布到 PyPI 与官方 MCP 注册表(io.github.RyanAlberts/agent-harnesses),需先安装 uv,然后执行:claude mcp add agent-harnesses -- uvx agent-harnesses-mcp。代理骨架的安装示例:curl -fsSL https://raw.githubusercontent.com/RyanAlberts/best-of-Agent-Harnesses/main/agents/harness-scout.md -o .claude/agents/harness-scout.md
如何使用这个 Agent?
三种主要用法:1)人类读者:访问 https://ryanalberts.github.io/best-of-Agent-Harnesses/ 可搜索站点,按能力、自主性与恢复力过滤;或阅读"Pick by use case"索引与对比决策指南。2)代理调用:在支持 MCP 的客户端中注册 agent-harnesses MCP 服务器后,代理可调用 recommend、pick_harness、compare、pick_infrastructure 等工具获得带证据的 harness 推荐。3)骨架代理:将 agents/ 下的 harness-scout、stack-auditor 或 harness-radar 的 markdown 文件放入 .claude/agents/ 目录,按需自定义指令;连接 Slack 或 Notion 后,骨架会在每个数据周期交付结果。所有三种用法都基于当周重新评分的数据运行。
这个 Agent 与同类方案有什么区别?
同类awesome-list项目多为静态人工维护清单;本仓库的差异化在于每周重评分、机器可读发布(JSON/llms.txt)以及内置 MCP 推荐服务器。清单内部还系统对比了多组真实替代品:opencode vs Codex vs Gemini CLI vs crush vs goose(终端编码代理)、OpenAI Agents SDK vs CrewAI vs AutoGen vs LangGraph(多代理编排)、Mem0 vs Letta vs claude-mem(记忆层)、E2B vs Daytona vs Modal(沙箱)、Langfuse vs LangSmith vs Braintrust vs Phoenix(评测可观测平台)。