Autoresearch:自主迭代改进引擎
将 Claude Code、OpenCode 或 OpenAI Codex 变成永不放弃的改进引擎:设定目标、定义指标、自动循环修改与验证。
证据显示有9个安全钩子,默认启用,可禁用,包括阻止读取.env、SSH密钥等敏感文件,阻止危险命令,以及自动回滚。但数据流透明度有限,未详细说明钩子如何记录或向用户展示数据访问。依赖安全未充分说明,未列出依赖项或漏洞扫描。外部影响有控制,如命令白名单和回滚。来源归属仅通过README中的作者和许可证,但发布者未验证。
自一致性较好,README和测试文件描述一致,多个测试脚本验证了钩子和编排器的行为。依赖可用性未明确,未列出运行时依赖或版本。失败消息在测试中有体现,如断言失败会输出FAIL,但实际运行时的错误处理未详细说明。
面向Claude Code、OpenCode和Codex,提供了多种安装方式,支持14个命令,场景覆盖广泛。能力边界通过命令和标志定义,但未明确限制或失败模式。触发精度通过命令和标志定义,但未明确限制或失败模式。环境适配良好,支持多种平台和安装方式。
信息架构清晰,有README、指南、命令文档。安装说明详细,提供多种安装方式。命名稳定,命令名称一致。示例和FAQ在README中有提及,但未提供完整FAQ内容。已知限制未明确列出。许可证为MIT,版本号在README中显示2.2.1,但未提供变更日志。维护责任未明确,发布者未验证。
输出可用性高,命令生成结构化报告和文件。边际价值高,自动化迭代和多种命令提供显著价值。成本效益好,声称减少95%的token使用,但未提供基准数据。
声明可追溯性有限,README中的性能声明未提供证据。跨来源验证有限,测试文件提供了部分验证,但未独立验证。事实与推断分离不足,README中的声明与测试结果未明确区分。
- 发布者身份未验证,需谨慎使用。
- 依赖安全未充分说明,建议检查依赖清单和漏洞。
- 数据流透明度有限,钩子可能记录数据但未明确说明。
- 性能声明(如95% token减少)缺乏基准证据。
这个 Agent 能做什么,适合哪些场景?
Autoresearch 是一个基于 Karpathy 的 autoresearch 理念构建的技能包,为 Claude Code、OpenCode 和 OpenAI Codex 提供 14 个命令和 9 个安全钩子。它把一次性的代码改进变成自动化的“修改→验证→保留/回滚”循环,每个循环只做一处修改,用机械性指标(如测试覆盖率、性能)评估是否保留,失败自动用 git 回滚。v2.2.0 引入了自主编排器模式:你只需输入一句自然语言目标,它会自动分类目标、推导成功条件并跨命令循环直到完成。架构上,v2.1.0 将原先 813 行的 SKILL.md 拆分为 41 行的路由文件和 12 个自包含命令文件,使每次调用 token 减少 95%。该技能可安装到 Claude Code(插件或 npx)、OpenCode 和 Codex,支持从代码、调试、安全审计到产品改进等广泛场景。
它提供一整套命令:核心的 /autoresearch 运行经典迭代循环(读取状态→选择一个修改→提交→运行验证→保留或回滚);/autoresearch:plan 把自然语言目标转换成可执行的配置;/autoresearch:debug 用科学方法迭代查找 bug;/autoresearch:fix 自动修复错误直到归零;/autoresearch:security 进行 STRIDE 和 OWASP 安全审计;/autoresearch:ship 通过 8 阶段流程发布;/autoresearch:scenario 生成 12 个维度的边界用例;/autoresearch:predict 模拟 5 个专家角色分析;/autoresearch:learn 自动生成文档;/autoresearch:reason 进行对抗性辩论与盲审;/autoresearch:probe 用 8 个对抗性角色探查需求;/autoresearch:improve 研究 ICP 并生成 PRD;/autoresearch:evals 分析历史结果趋势;/autoresearch:regression 进行回归门禁。每个命令都有默认迭代次数、支持 Guard 命令防止回归,结果以 TSV 记录,支持 --chain 链式调用。安装方式包括 npx、插件、脚本或手动复制。
- 前端开发者想提高测试覆盖率:在 Claude Code 中运行 /autoresearch,设置 Goal 和 Metric,让它自动迭代直到 90% 覆盖率。
- 后端团队在 CI 前发现大量测试失败,使用 /autoresearch:fix 自动修复所有错误直到通过。
- 安全工程师需要对代码库进行定期的 STRIDE/OWASP 审计,运行 /autoresearch:security 并获取带证据的漏洞报告。
- 产品经理想要为新功能生成需求文档,使用 /autoresearch:probe 和 /autoresearch:improve 探索约束和生成 PRD。
- 开发者在发布前需要验证改动不会引入回归,运行 /autoresearch:regression 获得 STABLE/UNSTABLE 判定。
- 技术作家或维护者想为现有代码库生成和更新文档,使用 /autoresearch:learn 自动生成参考文档和架构图。
这个 Agent 有哪些优点和局限?
- 大幅降低 token 消耗:v2.1.0 重构后每次调用 token 减少 95%(从约 100K 降至 5-8K)。
- 自带 9 个安全钩子,自动阻止读取敏感文件(.env、密钥)、危险命令(force-push、rm -rf)等。
- 支持三个主流 agent 平台(Claude Code、OpenCode、Codex),提供统一的安装脚本。
- 每个命令都有默认迭代次数,避免无限循环;失败自动 git 回滚,保证代码库稳定。
- 丰富的命令集覆盖开发全流程:计划、调试、修复、安全、发布、场景生成、文档生成等。
- 核心依赖 Claude Code 的 Skill 系统,虽然支持 OpenCode 和 Codex,但安装方式较为复杂,需要复制或脚本。
- 不兼容 ChatGPT 等非编码 agent 平台,无法直接使用。
- 需要用户明确提供可机械验证的指标,对于难以量化目标(如主观设计)需要额外配置(如使用 /autoresearch:reason)。
- 安装后需要重启会话才能解析命令,存在平台限制。
- 文档强调默认迭代有上限,但无限模式仍可能消耗大量时间和 token,需要用户监控。
如何安装或部署这个 Agent?
安装方式依平台不同:
Claude Code(推荐 npx):
npx skills add uditgoenka/autoresearch或通过插件:
/plugin marketplace add uditgoenka/autoresearch
/plugin install autoresearch@autoresearch或手动复制 .claude 目录到项目或全局。或运行引导安装脚本:
git clone https://github.com/uditgoenka/autoresearch.git
cd autoresearch
./scripts/install.sh --claude --globalOpenCode:
./scripts/install.sh --opencode --globalCodex:
./scripts/install.sh --codex --global如何使用这个 Agent?
安装后,在 Claude Code 会话中直接输入命令即可。例如:
/autoresearch
Goal: Increase test coverage from 72% to 90%
Scope: src/**/*.test.ts, src/**/*.ts
Metric: coverage % (higher is better)
Verify: npm test -- --coverage | grep "All files"
Iterations: 25或使用编排器模式:
/autoresearch help me fix the login bug常用子命令:
- /autoresearch:plan 将目标转换为配置
- /autoresearch:debug 迭代查找 bug
- /autoresearch:security 安全审计
- /autoresearch:ship 发布流程
在 OpenCode 中使用下划线命名(/autoresearch_debug),在 Codex 中使用 $autoresearch debug 语法。
这个 Agent 与同类方案有什么区别?
与 Karpathy 的原始 autoresearch 相比,本仓库将其从仅限 ML 模型扩展到任意领域,增加了 14 个命令和安全钩子,并支持多个 agent 平台。
常见问题
需要什么运行环境?
是否安全?会不会破坏我的代码?
无法确定用哪个指标怎么办?
可以用于非代码任务吗?
如何停止循环?
Iterations: N 限制。由于每次迭代前都会 git commit,你的最后成功状态始终保存在 git 中。