Codex 动态工作流(Claude Code 技能)
让 Claude Code 编写动态工作流脚本,把任务交给本地 Codex/GPT 智能体舰队执行,并实时渲染执行地图。
- Star 数
- ★ 325
- 最近更新
- 3 个月前
- License
- MIT
- 主语言
- JavaScript
- FA 评分
- 53/100 · 缺口较多
30 秒速览
- 可在哪里用
- 平台专用Codex · Claude Code
- 开始前需要
- 典型场景
- 要对 src/ 下所有路由做缺失鉴权审计,希望先并行扫描、再由独立 skeptic 逐个反驳,只留下能给出 file:line 证据的结论。
- 主要局限
- 核心执行依赖本地 codex CLI 的 app-server,且官方构建与验证基线是 codex 0.144.0,版本差异可能需要重新生成绑定。
- 源码审查
- 53/100 · 缺口较多
这个 Agent 能做什么,适合哪些场景?
这是一个面向 Claude Code 的技能插件与独立运行器,核心思路是把 Claude Code 的动态工作流 DSL(agent / parallel / pipeline / phase / budget)重新托管到本地 Codex(GPT)后端执行:Claude 负责把一句粗略需求编译成工作流脚本,Codex 的 app-server 负责真正跑这些智能体。项目包含运行器 runner/(零 npm 依赖)、HTML 执行地图查看器、终端 ASCII 地图、成本报告器 summarize-run,以及 fleet 监督协议。相比原生 DSL,它额外提供有状态的长生命周期 worker——agent.start 启动、session.steer 续问、agent.waitAny 竞争取先、session.cancel 取消落败者,并支持 --resume 热恢复线程。交付形态既可以是 Claude Code 里的 /codex-workflows 技能,也可以是脱离 Claude Code 的命令行工具。
技能被手动调用后,Claude 先做 Codex 预检,再把用户的一两句需求编译成具体的 workflow 脚本(agent / parallel / pipeline / phase / budget),写入项目目录,随后在本地 codex app-server 上以 thread/start + turn/start 执行,全部智能体固定到当前前沿模型(如 gpt-5.6-sol),思考强度按层宽自动缩放(--effort / --auto-effort)。运行过程中进度写入项目下的 .workflow-journal/<name>.jsonl,并通过 view-run.js 生成单文件 HTML 执行地图(--watch 可实时刷新、不重载页面),或由 map-run.js 输出终端 ASCII 地图;summarize-run.js 读取日志与 sidecar,输出按阶段、按 worker、按最贵智能体拆分的 token 与耗时报告。遇到 human() 决策点时运行暂停,--gui 模式下浏览器里出现可点击的“答案卡片”,无人值守时超时回退到默认值。--multi 模式会并行启动多个 variant workflow,由 Claude 用 fleet status / fleet answer 轮询、回答门禁、取消死路、复制赢家日志再 --resume(已完成的轮次零 token 重放)。
- 要对 src/ 下所有路由做缺失鉴权审计,希望先并行扫描、再由独立 skeptic 逐个反驳,只留下能给出 file:line 证据的结论。
- 要把 packages/core 或一整个数据房间加载进一个 worker,然后连续追问十几个问题,不想每次都重新读一遍语料。
- 生产环境 p99 延迟突然飙升 12 倍,想同时抛出 N+1 查询、连接池耗尽、缓存击穿三种假设竞争,只保留最先命中并继续追问确认的那一个。
- 要批量调用 legacyFetch() 迁移到新客户端,但希望脚本先给计划,并在触碰 payments/ 目录前由人在浏览器里点确认。
- 要在把严格的 /goal 交给 Codex 之前先做 GoalLint 硬化,或者在文档/PR 写完后做 ClaimCheck 逐条核对声明是否有仓库证据支撑。
- 要同时从几个不同角度排查一个顽固问题,并在总预算 5M token 内由 Claude 自己监督多个并行 workflow 的进度与门禁。
如何安装或部署这个 Agent?
推荐以 Claude Code 插件形式安装,随后按需独立运行:
/plugin marketplace add scasella/claude-dynamic-workflows-codex
/plugin install codex-workflows@codex-workflows或者克隆到技能目录:
git clone https://github.com/scasella/claude-dynamic-workflows-codex ~/.claude/skills/codex-workflows前置条件:Node ≥ 18(零 npm 依赖),以及已登录的 codex CLI:
codex login安装后验证 Codex 可达:
npx github:scasella/claude-dynamic-workflows-codex doctor # → state: ready如何使用这个 Agent?
在 Claude Code 里手动输入技能并描述需求即可(不会自动触发):
/codex-workflows Audit every route under src/ for missing auth checks
/codex-workflows Research the current state of on-device LLM inference and verify each claim, then watch it live
/codex-workflows --multi Find the cause of the checkout p99 regression — attack it from a few different angles at once不装 Claude Code 也能直接用 CLI 跑工作流:
node runner/bin/run-workflow.js examples/review.workflow.js --frontier --auto-effort \
--sandbox read-only --args '{"files":["runner/src/codexAgent.js"],"focus":"error handling"}'
node runner/bin/run-workflow.js examples/incident-demo/checkout-incident.workflow.js \
--frontier --auto-effort --sandbox read-only --gui不跑任何 Codex 就能先看打包好的示例运行(离线、自包含):
git clone https://github.com/scasella/claude-dynamic-workflows-codex
cd claude-dynamic-workflows-codex
node runner/bin/view-run.js examples/incident-demo --open查看任意历史运行、终端地图与成本报告:
node runner/bin/view-run.js <project-dir> --open # 加 --watch 实时刷新
node runner/bin/map-run.js <project-dir> --watch
node runner/bin/summarize-run.js <project-dir> --markdown --out reports/summary.md常用参数:--frontier、--auto-effort、--plan(零 token 预估)、--budget N、--sandbox read-only|workspace-write、--tui/--gui/--monitor、--resume。
这个 Agent 有哪些优点和局限?
- 在原生一次性 DSL 之上补上可续问的 sessionful worker:agent.start + session.steer 复用同一热线程,仓库自带基准显示后续追问约 69k token/6s,而冷启动重读约 219k token/97s。
- agent.waitAny 竞速取先 + session.cancel 取消落败者,避免 parallel() 屏障等待并计费最慢的那一个,示例中两个落败 worker 被标记 cancelled 而非失败。
- 零 npm 依赖、Node ≥ 18 即可运行,且执行地图是离线自包含的单文件 HTML,可分享、可 file:// 打开、可键盘导航并可切换 Dark/Light。
- 运行全程写入 .workflow-journal jsonl,summarize-run 能按阶段/worker/最贵智能体给出 token、耗时、cache 命中与风险标记,--resume 免费重放已完成轮次。
- fleet 监督是文档化的文件契约(references/fleet-protocol.md),并提供 supervise 外壳,可把任意长任务命令接入同一套门禁与状态面板。
- 核心执行依赖本地 codex CLI 的 app-server,且官方构建与验证基线是 codex 0.144.0,版本差异可能需要重新生成绑定。
- 它不是 Claude Code 原生体验:没有会话内后台任务、没有 /workflows 进度 UI、不能另存为 /command。
- 智能体默认以 approvalPolicy: "never" 在沙箱内自主读写并执行 shell,未加 --sandbox read-only 时无人值守运行风险较高。
- session 热恢复依赖已持久化的 rollout,若 rollout 被删或 codex 版本过旧,该 worker 只能诚实重跑;且轮次重放是按位置匹配,改动会话调用顺序会导致重放前缀失效。
- 预算按进程计量(--budget-meter 选择 total 或原生 output-token 池),与原生语义不完全 1:1;地图对 pipeline 形状运行也是近似建模。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| Codex 动态工作流(Claude Code 技能) 当前 | 53 · 缺口较多 | — | ★ 325 | 3 个月前 | JavaScript | Codex · Claude Code |
| Ordewell | 67 · 存在缺口 | 命令行工具免费 + 模型费 | ★ 199 | 今天 | TypeScript | Codex · Claude Code · OpenAI API · Claude API |
| MCO | 73 · 存在缺口 | 命令行工具免费 + 模型费 | ★ 532 | 4 天前 | Python | Codex · Claude Code |
| NTM(Named Tmux Manager) | 73 · 存在缺口 | 命令行工具免费 + 模型费 | ★ 456 | 4 天前 | Go | Codex · Claude Code |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:默认 --sandbox workspace-write 允许写文件,但提供 --sandbox read-only 只读选项;human() 门控与超时安全默认值、journal 记录答案、--resume 不重复询问,体现用户确认与回滚能力;CI 权限仅 contents: read,零 npm 依赖降低供应链风险。扣分点:README 未说明运行数据(代码、提示、结果)如何流向本地 codex app-server 或是否外发,数据流透明度仅部分;敏感数据处理无专门说明(无 PII/密钥处理指引);作者身份未经验证,来源归属仅由 package.json 与 LICENSE 声明,属未知而非可疑。
证据显示:codex-session.test.js 覆盖超时、传输中断、中断竞态、监听器泄漏等失败路径,失败信息具体(如 'Timed out waiting'、'Transport is not connected'),且 completion 从不 reject,自洽性较好。扣分点:依赖可用性仅声明 Node ≥18 与外部 codex CLI,未固定版本、未提供离线回退或版本兼容矩阵,属薄。
证据显示:README 明确面向 Claude Code 用户,给出审计/研究/迁移/分诊等多场景示例,能力边界清晰(明确不路由模型、只用一个前沿模型、只读是安全而非省钱手段),触发精确(手动 /codex-workflows,不自动触发)。扣分点:环境适配仅覆盖 Node 18+ 与 codex CLI,未说明 Windows/无 GUI/无网络等环境差异,属薄。
证据显示:README 结构清晰、安装说明完整(插件与克隆两种方式、doctor 校验)、示例丰富、MIT 许可证完整。扣分点:无 CHANGELOG,版本仅 package.json 0.2.0;命名稳定性未说明(模型名 gpt-5.6-sol 等随外部变化);已知限制分散在正文而非独立章节;维护责任仅由未验证作者承担,更新路径依赖 GitHub 推送。
证据显示:输出可用性高(内联执行图、viewer、summarize/compare 报告、journal 可复现),相对单 agent 有明确边际价值(并行、竞态取消、会话热线程、监督舰队)。扣分点:成本收益仅以 README 自述的基准(~3× 便宜、~16× 快)支撑,无独立验证,且默认使用前沿模型与高 effort,成本可能较高,属薄。
证据显示:README 大量具体声明(token 数、耗时、基准、dogfood 结果)但多为自述,未提供可独立核对的原始数据;测试文件与 CI 提供部分交叉印证(协议契约、离线套件)。扣分点:声明溯源弱(无逐条引用或数据文件),跨源印证有限(仅仓库内自证),事实与推断分离不足(营销性表述与可验证事实混排)。
- 默认 --sandbox workspace-write 允许 agent 写文件;在不受信任的仓库或提示上运行前应显式使用 --sandbox read-only。
- README 未说明运行数据(代码、提示、结果)如何流向本地 codex app-server 或是否外发,处理敏感代码库前需自行核实数据流。
- 依赖外部 codex CLI 与特定前沿模型名(如 gpt-5.6-sol),版本漂移可能导致行为变化;未固定版本。
- 成本声明(~3× 便宜、~16× 快)为自述基准,未经独立验证;默认使用前沿模型与高 effort,实际花费可能较高。
- 发布者身份未经验证,维护与更新路径依赖单一未验证作者。