开发与工程 agent-scaffoldingmcp-serverrepo-analysismodel-routingrelease-provenancesandboxingmulti-agentwasm

MetaHarness

把代码仓库生成可发布、可治理的专属 AI Agent 工具链。

FollowAgents 评估 · FARS-2.1
推荐
86/ 100 五分制 4.3 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全25 / 29 · 4.3/5

证据展示了强默认安全姿态:MCP 默认拒绝网络、Shell 和写文件,危险操作需批准并受超时、调用预算与审计约束;CI 权限为只读,发布使用短期 WIF 凭据;API 密钥经过哈希、作用域和到期检查,错误响应防枚举;发布和 IPFS 写入存在确认门,Darwin/AVO 描述了隔离、回退与签名收据。扣分在于完整端到端数据流仅由 README 概述,复杂的远程 MCP、模型提供商、记忆和遥测路径没有在所给文件中逐项说明;回滚虽然多处出现,却缺少覆盖整个产品的统一恢复流程;Cargo 元数据仍指向旧仓库名,削弱来源归属的一致性。

2可靠稳定11 / 14 · 3.9/5

CI 文件提供 Rust、WASM、Node、多操作系统、安装烟测和真实系统生命周期门,并且测试覆盖认证、预算预留/提交、故障转移、错误码与密钥不泄露,失败信息设计充分。扣分是 README 内部存在数量不一致(例如 21 与 17 个子命令、19 与 18 个示例包),且一处称相关包仍为私有实验,其他段落又声称多个包已发布;依赖安装包含“npm ci || npm install”和运行时外部模型/注册表依赖,因此可用性不是完全封闭或固定的。

3适用触发16 / 18 · 4.4/5

19 类垂直模板、10 个主机目标、浏览器/CLI/本地仓库入口、可替换模型、可裁剪组件和配置化治理充分覆盖不同用户及环境;实验功能、宿主差异、禁止列表、存储适配器和认证前置条件也明确界定能力边界。扣分主要在触发精度:模板推荐、自动模型路由、升级覆盖层和进化循环的具体选择规则未在所给实现文件中完整呈现,部分行为只能依赖说明性断言。

4规范维护15 / 18 · 4.2/5

README 的导航、架构、命令表、主机和模板表、ADR 指引及快速示例组织良好;Node 20 要求、npx 用法、向导、诊断命令、安全限制和实验状态均有说明。MIT 许可证文本和元数据完整。扣分在于命名明显漂移:MetaHarness、metaharness、agent-harness-generator、create-agent-harness 及 Cargo 中旧仓库 URL 并存;仅见版本状态和发布流程摘要,没有所给 CHANGELOG 内容;维护者有姓名、邮箱和安全响应承诺,但发布者未由企业注册表验证,且未展示更广泛的维护治理或继任安排。

5有效结果12 / 13 · 4.6/5

产物被具体定义为可发布 ZIP、品牌化 npx CLI、主机配置、MCP、记忆和治理文件,且有 doctor、validate、compare、audit、SBOM、sign/verify 等可直接使用的操作界面;相对手工拼装多个宿主适配器具有清晰增量价值。扣分在成本收益:项目明确提供成本估算、预算门和低价模型路由,但“一成成本达到前沿质量”“60 秒内完成”等强收益主张未由所给基准结果或完整方法数据交叉证明,部分高级功能还需要 GPU、外部模型或运行服务。

6证据核验7 / 8 · 4.4/5

大量主张指向具体 ADR、工作流、包和测试,测试代码也直接验证认证、预算、错误脱敏、路由与故障转移;README 对实验结果、非正式烟测、未达门槛的 AVO/ARC/PTC 主张进行了清晰限定,事实与推断分隔较好。扣分在交叉佐证:未提供 ADR 正文、锁文件、发布工作流、安全工作流、实际 CI 日志、基准报告或签名产物,因而测试数量、全部绿色、SLSA、性能和发布状态主要仍是仓库自述,无法仅凭这些摘录完全核对。

证据充分度: 评估于 2026年9月11日 审查版本 d5833dc6512a
使用前请注意
  • 这是低置信度静态审查;未执行代码、测试、安装、发布或签名验证。
  • 在采用前,应核对锁文件、完整安全与发布工作流、实际 CI 运行、npm 产物及见证签名,并确认 Cargo 中旧仓库地址是否仅为遗留元数据。
  • 远程 MCP、模型提供商、记忆存储和实验性 AVO/ARC/field-memory 功能会扩大数据与执行边界;部署时应逐项审查网络、密钥、存储、沙箱和确认策略。
  • 不要将 README 中的测试数量、性能、成本或 SLSA 声明视为独立验证结果;所给材料没有包含相应运行记录和产物。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

MetaHarness 是一个面向代码仓库的 Agent harness 生成器,而不是固定的 Agent 框架。它通过浏览器 Studio 或 `npx metaharness` 分析 GitHub 仓库或空白项目,生成带品牌名称、独立 `npx` CLI、项目级记忆、技能、命令、治理策略和可选 MCP 服务的 npm 包。生成结果使用共享的 `@metaharness/kernel`,该内核以 Rust 实现并提供 WASM 与 NAPI-RS 构建。项目明确支持 Claude Code、Codex、pi.dev、Hermes、OpenClaw、RVM、GitHub Copilot、OpenCode、Prime Agent 和 GitHub Actions,其中部分宿主使用 MCP,pi.dev 和 Prime Agent 则使用各自的原生扩展或技能形式。默认安全策略禁止网络、Shell 和文件写入,并提供审核、超时、调用额度、静态 MCP 扫描、Ed25519 见证签名、SPDX SBOM 与发布门禁。它适合希望把仓库知识、工具权限和发布流程固化为可版本化 Agent 产品的团队,但部分高级能力仍属实验性或尚未通过预注册评测门槛。

典型流程从 npx metaharness --wizardnpx metaharness my-bot --template vertical:coding --host claude-code,或针对现有仓库执行 harness analyze-repo . --scaffold my-bot 开始。仓库分析是确定性的静态分析,不执行仓库代码;识别出的构建和测试命令会标记为 trust: inferred · execution: disabled。生成器输出一个可发布到 npm 的 harness,其中包含 package.json、可执行 CLI、推荐的 agents、skills、slash commands、项目作用域记忆、治理配置以及宿主适配文件。MCP 可设为 off、本地 stdio 或带认证的远程 HTTPS 模式,并生成 src/mcp/{server,tools,resources,prompts,policy,audit}.ts.harness/mcp-policy.json。生成后的 harness CLI 可执行 doctorvalidatediagscoregenomemcp-scanthreat-modelcompareauditsbomupgradesignverifypublish --confirm 等操作。可选 Darwin Mode 会在沙箱中修改配置、运行测试、评估并保留可测量改进;可选路由器依据评测日志选择预计能够达到质量门槛的最低成本模型。

  1. 平台工程团队希望把内部仓库的编码约定、项目记忆、工具权限和发布检查封装成统一的组织级 npx 包。
  2. 开源维护者需要为现有仓库生成 repo-aware 维护 Agent,同时确保分析阶段不执行不受信任的仓库代码。
  3. 使用多个 Agent 宿主的团队希望从同一份 harness 配置生成 Claude Code、Codex、OpenCode、Copilot 或 GitHub Actions 集成。
  4. 安全负责人需要审查 MCP 工具的 Shell、网络、超时、审计、通配权限、密钥处理和依赖固定情况,并让高风险结果导致扫描失败。
  5. 需要降低模型成本的工程团队希望利用 @metaharness/router 或便宜模型到前沿模型的级联策略,并基于自己的评测日志训练路由。
  6. 需要可验证发布物的团队希望生成 Ed25519 签名见证、SPDX-2.3 SBOM,并通过 CI 与发布门禁检查篡改和供应链状态。

这个 Agent 有哪些优点和局限?

优点
  • 输出是团队拥有并可改名发布的 npm 包,带独立 CLI 和品牌,而不是只能在生成器内部运行的配置。
  • 同一生成模型覆盖十个明确列出的宿主,并针对无 MCP 的 pi.dev 和 Prime Agent 提供原生适配形式。
  • 静态仓库分析不执行目标代码,推断命令默认禁用;MCP 还采用禁止网络、Shell 与文件写入的默认策略。
  • 发布链包含 Ed25519 见证签名、篡改测试、SPDX-2.3 SBOM、npm provenance、CodeQL 和多平台 CI。
  • 既提供纯浏览器 Studio,也提供 CLI、宿主专用 npm 包和可复用的 Rust/WASM/NAPI-RS 内核。
局限
  • 项目仍标记为 v0.1.x beta,README 还指出可信度与文档对齐工作正在进行。
  • AVO 的更强能力声明仍受预注册的 100 任务 SWE-bench 门槛阻挡;ARC-AGI-3 包为私有实验状态,尚无正式性能声明。
  • 不同宿主的能力不完全一致:Codex 没有 hooks,pi.dev 不使用 MCP,Prime Agent 无法自行执行 deny-list,并可能要求额外沙箱。
  • 启用 field memory 需要绝对存储路径、兼容适配器、部署认证支持的 principal verifier,以及至少 32 字节且可随状态恢复的部署密钥;多进程部署还需要分布式 writer 模式。
  • 完整源码开发横跨 Node.js、Rust、WASM 与 NAPI-RS,维护和发布链比单一 JavaScript Agent 模板更复杂。
  • 成本与基准结果包含估算和范围限制,例如 SWE-bench Verified 的单实例成本未直接采集,LiveCodeBench 的 100 题结果也被说明为方向性证据。

如何安装或部署这个 Agent?

CLI 路径需要 Node.js 与 npm。可直接运行 npx metaharness --wizard,无需预先全局安装;也可以克隆源码后执行 npm install。浏览器路径可打开 https://ruvnet.github.io/metaharness/,Studio 在客户端运行,不需要 MetaHarness 账户、托管后端或 API 密钥。源码开发还使用 Rust 工具链,并通过 cargo test --workspacecargo clippy --workspace --all-targets -- -D warningsnpm run build:wasmnpm testnode scripts/healthcheck.mjs 验证。

如何使用这个 Agent?

首次生成可执行:npx metaharness my-bot --template vertical:coding --host claude-code,然后运行 cd my-bot && npx . --help。针对当前仓库,可执行 harness analyze-repo . 查看确定性建议,或执行 harness analyze-repo . --scaffold my-bot 生成项目。生成后先运行 harness doctor 做冒烟检查,再用 harness validate 执行发布门禁;需要检查工具暴露面时运行 harness mcp-scan <path>。可通过 --host 选择宿主,通过 --no-darwin 禁用默认接入的 Darwin Mode,通过 --field-memory 选择实验性 field memory。远程 MCP、发布、IPFS 或外部模型调用所需的认证信息取决于实际部署;本地 Studio 和静态仓库分析本身不要求 API 密钥。

这个 Agent 与同类方案有什么区别?

与传统 Agent 框架相比,MetaHarness 的定位不是让开发者在一个固定框架里构建 Agent,而是让每个仓库生成并发布自己的 Agent harness。其架构还明确借鉴 Prime Agent 的持续改进设计,但 Prime Agent 宿主没有 MCP,生成内容采用 .prime/agent/skills/ 下的 Python 技能,并在无法落实 deny-list 时提供 SANDBOX-REQUIRED.md。与单一昂贵模型方案相比,项目主张通过 @metaharness/router 和便宜模型到前沿模型的级联,根据质量门槛减少昂贵调用;README 同时明确披露相关评测的估算和样本限制。

常见问题

分析陌生仓库时会运行其中的代码吗?
不会。analyze-repogenome 被描述为确定性的静态分析;推断出的构建或测试命令会标记为禁用执行。
必须运行托管服务或提供 OpenAI API Key 吗?
不必须。Studio 完全在浏览器客户端运行,CLI 在本地运行,且没有 MetaHarness 账户、托管后端或遥测。实验性的 ChatGPT ARC 包也明确不使用 OpenAI API 或 OPENAI_API_KEY;外部模型或远程 MCP 部署可能另需各自的认证。
MCP 是否是必需组件?
不是。MCP 可配置为 off、本地 stdio 或远程 HTTPS;pi.dev 和 Prime Agent 的适配本身也不采用 MCP。
默认能获得哪些危险操作权限?
文档列出的 MCP 默认值禁止网络、Shell 和文件写入,危险操作需批准,同时启用 30 秒超时、每轮 8 次调用限制和审计。团队仍应检查生成的策略和目标宿主能否落实这些限制。
现在适合把实验性自我改进或 ARC 能力用于关键生产指标吗?
应谨慎。Darwin Mode 已被描述为在 SWE-bench Lite 上验证,但 AVO-class 声明仍未通过预注册门槛;ARC-AGI-3 包保持私有和实验状态,也没有正式 ARC 性能声明。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents