Codex Autoresearch
在代码库内运行可度量的优化循环:给出目标、基准和边界,它自动做实验、保留证据并留下可审查的补丁。
证据显示最小权限设计(数据包默认最小环境、需 --packet-env-mode inherit 才继承完整环境、CI 按 SHA 锁定 action 且权限最小化、测试运行器拒绝未列出的命令);合同须显式接受后才能运行,finalize 先做只读预览,分支仅在批准后创建;隐私文档明确本地会话记录与 Codex 外部数据路径;默认 Git 只读,keep 才提交且限于配置路径,回滚目录交换有完整故障注入测试证明各阶段可恢复;外部影响(可访问凭据、外联、花费金钱)有明示。扣分点:敏感数据处理仅是尽力而为的脱敏(作者自认非安全边界),CI 使用 --no-audit 且未展示依赖漏洞扫描或缓解策略,故敏感数据与依赖安全各记 2。
README、CI、测试三者高度一致:attestation 验证参数、checksum 清单解析、运行时目录交换的故障恢复路径均有针对性行为测试;依赖经 lockfile 固定、action 按 SHA 固定、hydration 在 gh 不可用时明确失败关闭;测试大量断言可操作错误信息(如陈旧回滚目录、npm 解析失败的具体指引)。未见明显扣分点。
适用/不适用场景界定清晰(可重复测量的有界实验 vs 一次性修改、品味类工作);3.0 的直接模式与测量模式的分流规则明确;触发以 fit -> contract 流程控制精确;扣分点:环境要求较高(Node 24+、Codex 宿主、仪表盘测试需 Chrome),文档虽写明但未提供降级或最小环境路径,故 environment_fit 记 2。
文档结构完整(start/walkthrough/operate/finish/troubleshooting/architecture 索引),安装、更新、卸载含市场与工作区差异的告诫;命名一致;Apache-2.0 全文与版权声明齐备;CHANGELOG 与自动发布流程强制 package./package-lock/plugin. 版本同步并拒绝非严格递增版本;限制声明诚实(合成截图标注、无对比实验声明)。扣分点:无独立 FAQ(由 troubleshooting 部分替代),维护责任指向单人(Albert Najjar,邮箱披露但发布者未经验证),故 examples_and_faq 与 maintenance_responsibility 记 2。
产出可用性强:证据回执、可审查补丁、只读仪表盘、审计追踪均有文档与测试支撑。扣分点:README 明确承认 3.0 未经模型对比实验,不声称优于普通 Codex 或 2.9.0,故相对增益未经证实(marginal_value 记 2);成本收益仅在合同内通过预算/时间上限控制,且外联服务可能产生费用,无成本实测数据(cost_benefit 记 2)。
声明可溯源:明确区分'工程验证'与未做的对比实验;提案要求引用来源文件;仓库自身验证体系(attestation 固定到签名工作流、checksum 校验、release provenance 策略测试)非常完整;README、CI 工作流、测试代码相互印证;合成数据被明确标注,事实与推断分离良好。未发现扣分点。
- 发布者未经企业注册表验证,身份为未知;使用前自行核对 TheGreenCedar/codex-autoresearch 与签名 attestation 的对应关系。
- 脱敏为尽力而为,非安全边界:不要在基准脚本、输出或实验记录中暴露密钥;仪表盘导出与账本可能含路径与命令摘录。
- 已批准的命令以本地权限运行,可访问凭据、联系外部服务并产生费用;敏感仓库或高成本工作负载前先阅读 trust/privacy/terms 文档。
- 3.0 无对比实验数据,相对普通 Codex 的收益未经证实,评估其边际价值需自行做小规模试验。
- 移除市场注册不等于卸载工作区插件,需用插件 UI 完成卸载。
这个 Agent 能做什么,适合哪些场景?
Codex Autoresearch 是一个 Codex 插件,用于在本地代码库中针对可重复基准运行受约束的优化循环。使用者提供工作负载、正确性检查、允许修改的范围和时间预算,插件先记录基线,再逐个评估候选改动,最终交付一个附证据的可审查补丁。它适用于测试耗时、构建速度、包体积、模型损失、内存占用、查询延迟等一切能由脚本打印的指标。会话记录存储在目标项目中:Git 仓库内临时状态放在 .git/autoresearch/,非 Git 环境回退到本地工作区文件。可选的只读仪表盘展示改进、通过、阻塞与下一步操作,命令仍通过 Codex 与 CLI 执行。3.0 版基于工程验证发布,未做过模型对比实验,也未宣称优于普通 Codex 或 2.9.0 版本。
安装后通过 /goal 命令给出契约:目标、基准命令、指标、检查命令、范围与预算,Codex 先提交契约供审批。接受契约后流程为 setup -> accept contract -> state -> next -> log -> state -> finalize-preview:setup 准备含目标、指标语义、评估器、检查、范围、噪声、保留与停止规则及预算的实验契约;state 将当前文件与 Git 状态编译为一个决策;next 只运行契约允许的评估器和检查;log 记录结果属于基线、保留、丢弃或失败;finalize-preview 输出只读的证据回执。基准须打印形如 METRIC seconds=12.34 的行,主指标决定方向,检查保护正确性,次要指标捕捉已知权衡。保留结果可在配置路径上创建受限提交;单纯测量不会暂存、提交或回退任何内容。
- 后端工程师想缩短慢测试套件的运行时间,且已有可重复的基准脚本与测试
- 前端开发者希望降低构建时间或包体积,同时保持功能正确
- ML 研究者在固定数据集上尝试多个小改动以降低模型损失
- 性能工程师优化查询延迟或内存占用,需要防止运行时降低带来内存暴涨等权衡
- 团队只有模糊的改进目标(如索引器更快更省内存),请插件先帮助设计可信基准再执行
- 维护者希望在受保护的编辑边界内做多次小实验,而不是一次大规模重写
这个 Agent 有哪些优点和局限?
- 每个保留的改动都附带可审查的证据回执,基线、保留、丢弃与失败都有记录
- 契约机制强制明确目标、指标语义、范围、噪声、保留与停止规则和预算后再执行
- 次要指标可捕捉已知权衡,如运行时降低但内存暴涨
- 状态与仪表盘共用同一快照,读取期间源变更会自动重试,状态一致性好
- 受 karpathy/autoresearch 和 pi-autoresearch 启发,专为本地仓库与可审查的 Git 工作流设计
- 强依赖 Codex 生态:通过 /plugins 安装、由 Codex 会话运行,无法直接用于其他 Agent 运行时
- 只适合可重复测量、基准相对稳定、能命名允许改动范围的任务;一次性修改或主观性任务不适用
- 批准的基准命令以本地权限运行,可能读取文件、启动进程、使用凭据并联系外部付费服务
- 3.0 版基于工程验证发布,没有模型对比数据支撑其优于普通 Codex 的说法
- 若基准太慢或噪声太大,额外测量几乎不带来信息,循环收益有限
如何安装或部署这个 Agent?
在 Codex 中打开插件选择器:输入 /plugins,选择 TheGreenCedar -> codex-autoresearch -> Install plugin,然后在新仓库中启动 Codex 任务。若你的 Codex 构建支持终端市场管理,可先注册源市场:codex plugin marketplace add TheGreenCedar/AgentPluginMarketplace --ref main。本仓库是插件源码,市场位于 TheGreenCedar/AgentPluginMarketplace。源码开发需要 Node.js 24 或更新版本、npm 和 Git。
如何使用这个 Agent?
在目标仓库中用 /goal @Codex Autoresearch 给出契约,例如:run a measured loop to reduce parser runtime;Benchmark: node bench/parser.mjs;Metric: seconds (s), lower is better;Checks: node --test tests/parser.test.mjs;Scope: src/parser.mjs;Protect bench/parser.mjs 和 tests/parser.test.mjs;测量两个基线并在保留前重复每个候选;5 个 packet 或 30 分钟后停止。Codex 会先呈现完整契约供审批,接受后 Autoresearch 先测量基线再评估候选改动。若无现成基准,可要求 Codex 以直接审查方式先提出可信基准方案,批准完整契约前不会创建会话。适合架构审查、文档等场景的任务会直接进入普通 Codex 直通模式,不创建会话文件。