开发与工程 coding-agentsubagentstest-driven-developmentterminal-benchcodexopencodeworkflow-automation

Autoprompt Skill

一个面向编码代理的多智能体技能,通过协调、执行与独立审查分层,在代理式编码任务中减少约 45% 的失败。

FollowAgents 评估 · FARS-2.1
谨慎使用
69/ 100 五分制 3.5 / 5
1 2 3 4 5 6
1信任安全18 / 29 · 3.1/5

适配器测试显示子代理派发有白名单、深度与父边校验、任务绑定哈希复验并默认失败关闭,运行控制为显式 `/autoprompt` 触发,交互式安装/卸载/doctor 提供确认与恢复路径;CI 使用 SHA 固定的 actions 且只授予最小权限。扣分点:安装器会改写各编码代理的本地配置,但源码中未见逐项变更清单或用户对具体写入内容的确认机制;敏感数据处理(遥测、日志、令牌)完全没有文件提及。

2可靠稳定9 / 14 · 3.2/5

package. 声明零运行时 npm 依赖,仅要求 Node 20+/Python 3.11+/Bash 4.3+/PyYAML 并在 requirements 中列出;CI 在三档 Node 与 Windows 上跑测试,测试规模庞大且覆盖契约与生命周期。扣分点:错误信息与降级行为只能在测试夹具中间接推断(如 codex 探针超时、绑定校验失败),没有面向用户的失败信息文档,`doctor --strict` 的具体行为未展示。

3适用触发14 / 18 · 3.9/5

支持表逐个列出 9 家供应商及审计版本号,另附自定义代理兼容指南与自定义模型指南;mode=/max_subs=/agents= 的能力边界按供应商明确标注(不支持路由的标 ✕),并说明 Codex/Oh My Pi 的不同触发语法。扣分点:受众与场景主要面向已使用这些编码代理的开发者,对小任务场景仅在脚注承认'差异很大',未系统说明不适用的场景。

4规范维护14 / 18 · 3.9/5

文档结构清晰:目录、安装、基准、控制、工作流、示例、FAQ、许可证齐备,FAQ 文档化到独立文件,MIT 许可证全文在库,安装/更新/卸载/检查命令完整。扣分点:仓库中没有 CHANGELOG,版本号 1.0.4 只能从徽章和 package. 推断,变更历史不可追溯;CONTRIBUTING/SECURITY/SUPPORT 仅以链接提及,维护者与更新承诺无法从所给文件核实。

5有效结果9 / 13 · 3.5/5

声称 45% 失败减少(29→16)有对应一次 OpenCode 实测数据支撑,同时坦承约 3 倍时间、2 倍 token 的代价为'规划估算而非实测',且明确 DeepSeek 分数不可直接比较——这种成本-收益披露较为诚实。扣分点:收益数据只有单次单供应商实测,无多环境复现;未保留时间与 token 日志,输出可用性(实际产出质量)无法从静态文件确认。

6证据核验5 / 8 · 3.1/5

基准方法与'证据边界'有专门文档链接,实测数字与估算数字在文中明确区分(这是显著优点,fact/inference 分离给满分);基准请求模板和审计说明提供追溯路径。扣分点:单一来源自查,无第三方复现或独立佐证,基准文档本身未在所给文件中,'45%' 的口径只能信 README 的转述,跨源佐证薄弱。

证据充分度: 评估于 2026年9月7日 审查版本 91dc6edf336a
使用前请注意
  • 安装器会写入各编码代理的本地配置与技能文件,安装前建议在隔离环境中先行检查写入内容,并确认 `autoprompt uninstall` 能完整回滚。
  • '45% 失败减少'仅来自单次 OpenCode 实测,成本约为 3 倍时间与 2 倍 token(为估算值),小任务上收益可能为负,请在自己的工作负载上小规模验证。
  • 发布者未经企业注册表核验,身份未知;请在受控环境中审计安装脚本后再在生产项目中启用。
  • 敏感数据处理(日志、令牌、遥测)在所给文件中完全未提及,处理私有代码的组织应自行评估数据流向。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Autoprompt 是一个通过 npm 分发的编码代理技能(MIT 许可,当前版本 1.0.4),仓库位于 Spielewoy/autoprompt-skill。它以子代理层级组织工作:由协调层、管理层、执行通道与独立检查组成,避免同一个代理既规划又审批和验证自己的产出。它通过安装器接入九种受支持的编码代理,包括 Claude Code、Codex、OpenCode、Kilo Code、VS Code、Prime Agent、Oh My Pi、DeepSeek Harness 和 Reasonix。在 OpenCode 1.18.7 的 Terminal-Bench 2.1 实测中,成功率从 60/89 提升到 73/89,失败数从 29 降到 16,即减少 45%、得分提升 14.61 个百分点。它运行在本地 CLI 环境,需要 Node.js 20+、Python 3.11+、Bash 4.3+,通过 `mode=`、`max_subs=` 和 `agents=` 等运行控制参数调整并发与模型路由。README 明确说明代价:时间和令牌消耗大约是普通运行的 3 倍和 2 倍,这些是基于用户报告的估算值而非实测数据。

用户通过 /autoprompt <目标>(Codex 用 $autoprompt,Oh My Pi 用 /skill:autoprompt)发起一次调用,并可用 mode=tokensaver(最多 6 个活动子代理)、mode=wide(打开所有就绪通道)或 mode=custom max_subs=N 控制并发。技能读取目标后进入规划、构建、审查、测试、签署与清扫的循环:协调层拆分任务,管理通道执行,独立检查层验证结果。在支持的宿主上,agents= 可将子代理路由到不同模型;不支持的宿主继承当前模型。它以失败修复加回归测试、端到端功能构建、代码库调研与模型迁移等任务为典型工作流。安装后可用 autoprompt doctor --strict 检查检测到的全部安装,autoprompt uninstall [PROVIDER] 卸载。

  1. 使用 Claude Code 或 OpenCode 的开发者,在代理反复产出错误代码时,用它把失败率降下来。
  2. 需要并行迁移大量模型或文件的团队,用 mode=custom max_subs=4 限制并行度,避免机器过载。
  3. 希望在提交前自动获得回归测试的工程师,让技能在修复缺陷时同时补测试。
  4. 用 Codex 做多步功能开发(如从 API 到结算页的预订流程)的用户,用 mode=wide 打开全部执行通道。
  5. 需要对比技术选型(如任务队列)并给出建议的开发者,用 /autoprompt compare ... 做代码库调研。

这个 Agent 有哪些优点和局限?

优点
  • 有实测基准:OpenCode 1.18.7 在 Terminal-Bench 2.1 上失败从 29 降到 16(减少 45%),得分提升 14.61 个百分点。
  • 支持九种编码代理(Claude Code、Codex、OpenCode、Kilo、VS Code、Prime Agent、Oh My Pi、DeepSeek Harness、Reasonix),并注明每个宿主的审计版本。
  • 分层设计把协调、管理、执行与独立判断分开,避免同一代理自我审批和自我验证。
  • 提供 autoprompt doctor、更新/修复与卸载命令,安装生命周期可校验。
局限
  • 代价显著:README 说明大约 3 倍时间和 2 倍令牌消耗,且该估算基于用户报告,未保留实测日志。
  • 对非常小的任务收益可能明显不同。
  • 需要 Node.js 20+、Python 3.11+、Bash 4.3+ 的本地运行环境,纯云端或图形界面环境无法直接使用。
  • 仅在 Claude Code 和 Codex 上支持自定义 agents= 模型路由,其余七种宿主继承当前/父模型。

如何安装或部署这个 Agent?

前置要求:Node.js 20+、Python 3.11+(以 python 暴露并安装 PyYAML)、Bash 4.3+(macOS/Linux),Git 仅用于源码安装。安装:npm install -g autoprompt-skill,然后运行 autoprompt 启动交互式安装器,选择你的编码代理并确认其路径。也可从源码安装:git clone https://github.com/Spielewoy/autoprompt-skill && cd autoprompt-skill && npm install -g . && autoprompt。安装后运行 autoprompt doctor --strict 校验所有检测到的安装。

如何使用这个 Agent?

在受支持的代理中发起显式调用:Claude Code/OpenCode 用 /autoprompt <目标>,Codex 用 $autoprompt <目标>,Oh My Pi 用 /skill:autoprompt。示例:/autoprompt fix the registration race and add a regression test/autoprompt mode=wide build the booking flow from API to checkout/autoprompt mode=custom max_subs=4 migrate every model。技能不会在后台自动启动,需要显式触发。

这个 Agent 与同类方案有什么区别?

README 将 DeepSeek 在 Terminal-Bench 2.1 上的 82.7% 官方成绩作为参考点,但指出那是 DeepSeek 自己的测试设置,不是可比的第三方运行结果。

常见问题

装了 Autoprompt 之后我还需要写提示词吗?
需要。你仍要给出清晰的目标、约束和成功标准,Autoprompt 接管的是执行循环,让你不必逐步提示。
它的自主性边界在哪?
它能对目标进行范围界定、实现、测试、审查、修复和验证,但遇到会改变结果的选择、需要你授权的操作或无法安全解决的阻塞时会停下来。
实际开销有多大?
README 给出的规划估算是约 3 倍时间和 2 倍令牌消耗,来源是用户体验报告而非保留的实测日志;小任务上可能有很大差异。
我的编码代理受支持吗?
支持 Claude Code(2.1.219+,审计 2.1.233)、Codex(0.147.0)、OpenCode(1.18.7+)、Kilo Code(7.4.22+)、VS Code(1.133+)、Prime Agent(0.7.2)、Oh My Pi(17.4.0+)、DeepSeek Harness(0.1.0-rc.7+)和 Reasonix(1.30.0+)。其他 CLI/IDE 可按自定义代理兼容指南接入。
为什么它不在后台自动运行?
因为自动启动会改变成本、时间和工作流,所以需要用 /autoprompt <目标> 显式触发。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents