Autoprompt Skill
一个面向编码代理的多智能体技能,通过协调、执行与独立审查分层,在代理式编码任务中减少约 45% 的失败。
适配器测试显示子代理派发有白名单、深度与父边校验、任务绑定哈希复验并默认失败关闭,运行控制为显式 `/autoprompt` 触发,交互式安装/卸载/doctor 提供确认与恢复路径;CI 使用 SHA 固定的 actions 且只授予最小权限。扣分点:安装器会改写各编码代理的本地配置,但源码中未见逐项变更清单或用户对具体写入内容的确认机制;敏感数据处理(遥测、日志、令牌)完全没有文件提及。
package. 声明零运行时 npm 依赖,仅要求 Node 20+/Python 3.11+/Bash 4.3+/PyYAML 并在 requirements 中列出;CI 在三档 Node 与 Windows 上跑测试,测试规模庞大且覆盖契约与生命周期。扣分点:错误信息与降级行为只能在测试夹具中间接推断(如 codex 探针超时、绑定校验失败),没有面向用户的失败信息文档,`doctor --strict` 的具体行为未展示。
支持表逐个列出 9 家供应商及审计版本号,另附自定义代理兼容指南与自定义模型指南;mode=/max_subs=/agents= 的能力边界按供应商明确标注(不支持路由的标 ✕),并说明 Codex/Oh My Pi 的不同触发语法。扣分点:受众与场景主要面向已使用这些编码代理的开发者,对小任务场景仅在脚注承认'差异很大',未系统说明不适用的场景。
文档结构清晰:目录、安装、基准、控制、工作流、示例、FAQ、许可证齐备,FAQ 文档化到独立文件,MIT 许可证全文在库,安装/更新/卸载/检查命令完整。扣分点:仓库中没有 CHANGELOG,版本号 1.0.4 只能从徽章和 package. 推断,变更历史不可追溯;CONTRIBUTING/SECURITY/SUPPORT 仅以链接提及,维护者与更新承诺无法从所给文件核实。
声称 45% 失败减少(29→16)有对应一次 OpenCode 实测数据支撑,同时坦承约 3 倍时间、2 倍 token 的代价为'规划估算而非实测',且明确 DeepSeek 分数不可直接比较——这种成本-收益披露较为诚实。扣分点:收益数据只有单次单供应商实测,无多环境复现;未保留时间与 token 日志,输出可用性(实际产出质量)无法从静态文件确认。
基准方法与'证据边界'有专门文档链接,实测数字与估算数字在文中明确区分(这是显著优点,fact/inference 分离给满分);基准请求模板和审计说明提供追溯路径。扣分点:单一来源自查,无第三方复现或独立佐证,基准文档本身未在所给文件中,'45%' 的口径只能信 README 的转述,跨源佐证薄弱。
- 安装器会写入各编码代理的本地配置与技能文件,安装前建议在隔离环境中先行检查写入内容,并确认 `autoprompt uninstall` 能完整回滚。
- '45% 失败减少'仅来自单次 OpenCode 实测,成本约为 3 倍时间与 2 倍 token(为估算值),小任务上收益可能为负,请在自己的工作负载上小规模验证。
- 发布者未经企业注册表核验,身份未知;请在受控环境中审计安装脚本后再在生产项目中启用。
- 敏感数据处理(日志、令牌、遥测)在所给文件中完全未提及,处理私有代码的组织应自行评估数据流向。
这个 Agent 能做什么,适合哪些场景?
Autoprompt 是一个通过 npm 分发的编码代理技能(MIT 许可,当前版本 1.0.4),仓库位于 Spielewoy/autoprompt-skill。它以子代理层级组织工作:由协调层、管理层、执行通道与独立检查组成,避免同一个代理既规划又审批和验证自己的产出。它通过安装器接入九种受支持的编码代理,包括 Claude Code、Codex、OpenCode、Kilo Code、VS Code、Prime Agent、Oh My Pi、DeepSeek Harness 和 Reasonix。在 OpenCode 1.18.7 的 Terminal-Bench 2.1 实测中,成功率从 60/89 提升到 73/89,失败数从 29 降到 16,即减少 45%、得分提升 14.61 个百分点。它运行在本地 CLI 环境,需要 Node.js 20+、Python 3.11+、Bash 4.3+,通过 `mode=`、`max_subs=` 和 `agents=` 等运行控制参数调整并发与模型路由。README 明确说明代价:时间和令牌消耗大约是普通运行的 3 倍和 2 倍,这些是基于用户报告的估算值而非实测数据。
用户通过 /autoprompt <目标>(Codex 用 $autoprompt,Oh My Pi 用 /skill:autoprompt)发起一次调用,并可用 mode=tokensaver(最多 6 个活动子代理)、mode=wide(打开所有就绪通道)或 mode=custom max_subs=N 控制并发。技能读取目标后进入规划、构建、审查、测试、签署与清扫的循环:协调层拆分任务,管理通道执行,独立检查层验证结果。在支持的宿主上,agents= 可将子代理路由到不同模型;不支持的宿主继承当前模型。它以失败修复加回归测试、端到端功能构建、代码库调研与模型迁移等任务为典型工作流。安装后可用 autoprompt doctor --strict 检查检测到的全部安装,autoprompt uninstall [PROVIDER] 卸载。
- 使用 Claude Code 或 OpenCode 的开发者,在代理反复产出错误代码时,用它把失败率降下来。
- 需要并行迁移大量模型或文件的团队,用
mode=custom max_subs=4限制并行度,避免机器过载。 - 希望在提交前自动获得回归测试的工程师,让技能在修复缺陷时同时补测试。
- 用 Codex 做多步功能开发(如从 API 到结算页的预订流程)的用户,用
mode=wide打开全部执行通道。 - 需要对比技术选型(如任务队列)并给出建议的开发者,用
/autoprompt compare ...做代码库调研。
这个 Agent 有哪些优点和局限?
- 有实测基准:OpenCode 1.18.7 在 Terminal-Bench 2.1 上失败从 29 降到 16(减少 45%),得分提升 14.61 个百分点。
- 支持九种编码代理(Claude Code、Codex、OpenCode、Kilo、VS Code、Prime Agent、Oh My Pi、DeepSeek Harness、Reasonix),并注明每个宿主的审计版本。
- 分层设计把协调、管理、执行与独立判断分开,避免同一代理自我审批和自我验证。
- 提供
autoprompt doctor、更新/修复与卸载命令,安装生命周期可校验。
- 代价显著:README 说明大约 3 倍时间和 2 倍令牌消耗,且该估算基于用户报告,未保留实测日志。
- 对非常小的任务收益可能明显不同。
- 需要 Node.js 20+、Python 3.11+、Bash 4.3+ 的本地运行环境,纯云端或图形界面环境无法直接使用。
- 仅在 Claude Code 和 Codex 上支持自定义
agents=模型路由,其余七种宿主继承当前/父模型。
如何安装或部署这个 Agent?
前置要求:Node.js 20+、Python 3.11+(以 python 暴露并安装 PyYAML)、Bash 4.3+(macOS/Linux),Git 仅用于源码安装。安装:npm install -g autoprompt-skill,然后运行 autoprompt 启动交互式安装器,选择你的编码代理并确认其路径。也可从源码安装:git clone https://github.com/Spielewoy/autoprompt-skill && cd autoprompt-skill && npm install -g . && autoprompt。安装后运行 autoprompt doctor --strict 校验所有检测到的安装。
如何使用这个 Agent?
在受支持的代理中发起显式调用:Claude Code/OpenCode 用 /autoprompt <目标>,Codex 用 $autoprompt <目标>,Oh My Pi 用 /skill:autoprompt。示例:/autoprompt fix the registration race and add a regression test;/autoprompt mode=wide build the booking flow from API to checkout;/autoprompt mode=custom max_subs=4 migrate every model。技能不会在后台自动启动,需要显式触发。
这个 Agent 与同类方案有什么区别?
README 将 DeepSeek 在 Terminal-Bench 2.1 上的 82.7% 官方成绩作为参考点,但指出那是 DeepSeek 自己的测试设置,不是可比的第三方运行结果。
常见问题
装了 Autoprompt 之后我还需要写提示词吗?
它的自主性边界在哪?
实际开销有多大?
我的编码代理受支持吗?
为什么它不在后台自动运行?
/autoprompt <目标> 显式触发。