开发与工程 opencodecodexautonomous-iterationskilltestingsecurity-audit

Autoresearch:自主迭代改进引擎

将 Claude Code、OpenCode 或 OpenAI Codex 变成永不放弃的改进引擎:设定目标、定义指标、自动循环修改与验证。

FollowAgents 评估 · FARS-2.1
不推荐
58/ 100 五分制 2.9 / 5
1 2 3 4 5 6
1信任安全16 / 29 · 2.8/5

证据显示有9个安全钩子,默认启用,可禁用,包括阻止读取.env、SSH密钥等敏感文件,阻止危险命令,以及自动回滚。但数据流透明度有限,未详细说明钩子如何记录或向用户展示数据访问。依赖安全未充分说明,未列出依赖项或漏洞扫描。外部影响有控制,如命令白名单和回滚。来源归属仅通过README中的作者和许可证,但发布者未验证。

2可靠稳定8 / 14 · 2.9/5

自一致性较好,README和测试文件描述一致,多个测试脚本验证了钩子和编排器的行为。依赖可用性未明确,未列出运行时依赖或版本。失败消息在测试中有体现,如断言失败会输出FAIL,但实际运行时的错误处理未详细说明。

3适用触发12 / 18 · 3.3/5

面向Claude Code、OpenCode和Codex,提供了多种安装方式,支持14个命令,场景覆盖广泛。能力边界通过命令和标志定义,但未明确限制或失败模式。触发精度通过命令和标志定义,但未明确限制或失败模式。环境适配良好,支持多种平台和安装方式。

4规范维护10 / 18 · 2.8/5

信息架构清晰,有README、指南、命令文档。安装说明详细,提供多种安装方式。命名稳定,命令名称一致。示例和FAQ在README中有提及,但未提供完整FAQ内容。已知限制未明确列出。许可证为MIT,版本号在README中显示2.2.1,但未提供变更日志。维护责任未明确,发布者未验证。

5有效结果9 / 13 · 3.5/5

输出可用性高,命令生成结构化报告和文件。边际价值高,自动化迭代和多种命令提供显著价值。成本效益好,声称减少95%的token使用,但未提供基准数据。

6证据核验3 / 8 · 1.9/5

声明可追溯性有限,README中的性能声明未提供证据。跨来源验证有限,测试文件提供了部分验证,但未独立验证。事实与推断分离不足,README中的声明与测试结果未明确区分。

证据充分度: 评估于 2026年8月9日 审查版本 870e9b8eca4f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 发布者身份未验证,需谨慎使用。
  • 依赖安全未充分说明,建议检查依赖清单和漏洞。
  • 数据流透明度有限,钩子可能记录数据但未明确说明。
  • 性能声明(如95% token减少)缺乏基准证据。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Autoresearch 是一个基于 Karpathy 的 autoresearch 理念构建的技能包,为 Claude Code、OpenCode 和 OpenAI Codex 提供 14 个命令和 9 个安全钩子。它把一次性的代码改进变成自动化的“修改→验证→保留/回滚”循环,每个循环只做一处修改,用机械性指标(如测试覆盖率、性能)评估是否保留,失败自动用 git 回滚。v2.2.0 引入了自主编排器模式:你只需输入一句自然语言目标,它会自动分类目标、推导成功条件并跨命令循环直到完成。架构上,v2.1.0 将原先 813 行的 SKILL.md 拆分为 41 行的路由文件和 12 个自包含命令文件,使每次调用 token 减少 95%。该技能可安装到 Claude Code(插件或 npx)、OpenCode 和 Codex,支持从代码、调试、安全审计到产品改进等广泛场景。

它提供一整套命令:核心的 /autoresearch 运行经典迭代循环(读取状态→选择一个修改→提交→运行验证→保留或回滚);/autoresearch:plan 把自然语言目标转换成可执行的配置;/autoresearch:debug 用科学方法迭代查找 bug;/autoresearch:fix 自动修复错误直到归零;/autoresearch:security 进行 STRIDE 和 OWASP 安全审计;/autoresearch:ship 通过 8 阶段流程发布;/autoresearch:scenario 生成 12 个维度的边界用例;/autoresearch:predict 模拟 5 个专家角色分析;/autoresearch:learn 自动生成文档;/autoresearch:reason 进行对抗性辩论与盲审;/autoresearch:probe 用 8 个对抗性角色探查需求;/autoresearch:improve 研究 ICP 并生成 PRD;/autoresearch:evals 分析历史结果趋势;/autoresearch:regression 进行回归门禁。每个命令都有默认迭代次数、支持 Guard 命令防止回归,结果以 TSV 记录,支持 --chain 链式调用。安装方式包括 npx、插件、脚本或手动复制。

  1. 前端开发者想提高测试覆盖率:在 Claude Code 中运行 /autoresearch,设置 Goal 和 Metric,让它自动迭代直到 90% 覆盖率。
  2. 后端团队在 CI 前发现大量测试失败,使用 /autoresearch:fix 自动修复所有错误直到通过。
  3. 安全工程师需要对代码库进行定期的 STRIDE/OWASP 审计,运行 /autoresearch:security 并获取带证据的漏洞报告。
  4. 产品经理想要为新功能生成需求文档,使用 /autoresearch:probe 和 /autoresearch:improve 探索约束和生成 PRD。
  5. 开发者在发布前需要验证改动不会引入回归,运行 /autoresearch:regression 获得 STABLE/UNSTABLE 判定。
  6. 技术作家或维护者想为现有代码库生成和更新文档,使用 /autoresearch:learn 自动生成参考文档和架构图。

这个 Agent 有哪些优点和局限?

优点
  • 大幅降低 token 消耗:v2.1.0 重构后每次调用 token 减少 95%(从约 100K 降至 5-8K)。
  • 自带 9 个安全钩子,自动阻止读取敏感文件(.env、密钥)、危险命令(force-push、rm -rf)等。
  • 支持三个主流 agent 平台(Claude Code、OpenCode、Codex),提供统一的安装脚本。
  • 每个命令都有默认迭代次数,避免无限循环;失败自动 git 回滚,保证代码库稳定。
  • 丰富的命令集覆盖开发全流程:计划、调试、修复、安全、发布、场景生成、文档生成等。
局限
  • 核心依赖 Claude Code 的 Skill 系统,虽然支持 OpenCode 和 Codex,但安装方式较为复杂,需要复制或脚本。
  • 不兼容 ChatGPT 等非编码 agent 平台,无法直接使用。
  • 需要用户明确提供可机械验证的指标,对于难以量化目标(如主观设计)需要额外配置(如使用 /autoresearch:reason)。
  • 安装后需要重启会话才能解析命令,存在平台限制。
  • 文档强调默认迭代有上限,但无限模式仍可能消耗大量时间和 token,需要用户监控。

如何安装或部署这个 Agent?

安装方式依平台不同:

Claude Code(推荐 npx):

npx skills add uditgoenka/autoresearch

或通过插件:

/plugin marketplace add uditgoenka/autoresearch
/plugin install autoresearch@autoresearch

或手动复制 .claude 目录到项目或全局。或运行引导安装脚本:

git clone https://github.com/uditgoenka/autoresearch.git
cd autoresearch
./scripts/install.sh --claude --global

OpenCode

./scripts/install.sh --opencode --global

Codex

./scripts/install.sh --codex --global

如何使用这个 Agent?

安装后,在 Claude Code 会话中直接输入命令即可。例如:

/autoresearch
Goal: Increase test coverage from 72% to 90%
Scope: src/**/*.test.ts, src/**/*.ts
Metric: coverage % (higher is better)
Verify: npm test -- --coverage | grep "All files"
Iterations: 25

或使用编排器模式:

/autoresearch help me fix the login bug

常用子命令:
- /autoresearch:plan 将目标转换为配置
- /autoresearch:debug 迭代查找 bug
- /autoresearch:security 安全审计
- /autoresearch:ship 发布流程

在 OpenCode 中使用下划线命名(/autoresearch_debug),在 Codex 中使用 $autoresearch debug 语法。

这个 Agent 与同类方案有什么区别?

与 Karpathy 的原始 autoresearch 相比,本仓库将其从仅限 ML 模型扩展到任意领域,增加了 14 个命令和安全钩子,并支持多个 agent 平台。

常见问题

需要什么运行环境?
需要已安装 Claude Code、OpenCode 或 OpenAI Codex 之一。对于 Codex 还需要 Node.js。此外需要 Git 用于自动提交和回滚。
是否安全?会不会破坏我的代码?
有 9 个安全钩子默认启用,阻止访问敏感文件和危险命令。每次修改都会先提交,失败会通过 git revert 自动回滚。可以设置 Guard 命令防止回归。
无法确定用哪个指标怎么办?
使用 /autoresearch:plan 命令,它会分析代码库并建议可用的指标,并会先干跑验证命令确保有效。
可以用于非代码任务吗?
可以。文档说明适用于销售邮件、营销文案、HR 政策等任何有可测量指标的任务。
如何停止循环?
按 Ctrl+C 或添加 Iterations: N 限制。由于每次迭代前都会 git commit,你的最后成功状态始终保存在 git 中。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents