Codex 动态工作流(Claude Code 技能)

让 Claude Code 编写动态工作流脚本,把任务交给本地 Codex/GPT 智能体舰队执行,并实时渲染执行地图。

Star 数
★ 325
最近更新
3 个月前
License
MIT
主语言
JavaScript

30 秒速览

可在哪里用
平台专用Codex · Claude Code
开始前需要
Node.js >= 18codex CLI(已登录,含 app-server 子命令)codex login 凭据Shell / 命令行网络访问本地文件系统
典型场景
要对 src/ 下所有路由做缺失鉴权审计,希望先并行扫描、再由独立 skeptic 逐个反驳,只留下能给出 file:line 证据的结论。
主要局限
核心执行依赖本地 codex CLI 的 app-server,且官方构建与验证基线是 codex 0.144.0,版本差异可能需要重新生成绑定。

这个 Agent 能做什么,适合哪些场景?

这是一个面向 Claude Code 的技能插件与独立运行器,核心思路是把 Claude Code 的动态工作流 DSL(agent / parallel / pipeline / phase / budget)重新托管到本地 Codex(GPT)后端执行:Claude 负责把一句粗略需求编译成工作流脚本,Codex 的 app-server 负责真正跑这些智能体。项目包含运行器 runner/(零 npm 依赖)、HTML 执行地图查看器、终端 ASCII 地图、成本报告器 summarize-run,以及 fleet 监督协议。相比原生 DSL,它额外提供有状态的长生命周期 worker——agent.start 启动、session.steer 续问、agent.waitAny 竞争取先、session.cancel 取消落败者,并支持 --resume 热恢复线程。交付形态既可以是 Claude Code 里的 /codex-workflows 技能,也可以是脱离 Claude Code 的命令行工具。

技能被手动调用后,Claude 先做 Codex 预检,再把用户的一两句需求编译成具体的 workflow 脚本(agent / parallel / pipeline / phase / budget),写入项目目录,随后在本地 codex app-server 上以 thread/start + turn/start 执行,全部智能体固定到当前前沿模型(如 gpt-5.6-sol),思考强度按层宽自动缩放(--effort / --auto-effort)。运行过程中进度写入项目下的 .workflow-journal/<name>.jsonl,并通过 view-run.js 生成单文件 HTML 执行地图(--watch 可实时刷新、不重载页面),或由 map-run.js 输出终端 ASCII 地图;summarize-run.js 读取日志与 sidecar,输出按阶段、按 worker、按最贵智能体拆分的 token 与耗时报告。遇到 human() 决策点时运行暂停,--gui 模式下浏览器里出现可点击的“答案卡片”,无人值守时超时回退到默认值。--multi 模式会并行启动多个 variant workflow,由 Claude 用 fleet status / fleet answer 轮询、回答门禁、取消死路、复制赢家日志再 --resume(已完成的轮次零 token 重放)。

  1. 要对 src/ 下所有路由做缺失鉴权审计,希望先并行扫描、再由独立 skeptic 逐个反驳,只留下能给出 file:line 证据的结论。
  2. 要把 packages/core 或一整个数据房间加载进一个 worker,然后连续追问十几个问题,不想每次都重新读一遍语料。
  3. 生产环境 p99 延迟突然飙升 12 倍,想同时抛出 N+1 查询、连接池耗尽、缓存击穿三种假设竞争,只保留最先命中并继续追问确认的那一个。
  4. 要批量调用 legacyFetch() 迁移到新客户端,但希望脚本先给计划,并在触碰 payments/ 目录前由人在浏览器里点确认。
  5. 要在把严格的 /goal 交给 Codex 之前先做 GoalLint 硬化,或者在文档/PR 写完后做 ClaimCheck 逐条核对声明是否有仓库证据支撑。
  6. 要同时从几个不同角度排查一个顽固问题,并在总预算 5M token 内由 Claude 自己监督多个并行 workflow 的进度与门禁。

如何安装或部署这个 Agent?

推荐以 Claude Code 插件形式安装,随后按需独立运行:

/plugin marketplace add scasella/claude-dynamic-workflows-codex
/plugin install codex-workflows@codex-workflows

或者克隆到技能目录:

git clone https://github.com/scasella/claude-dynamic-workflows-codex ~/.claude/skills/codex-workflows

前置条件:Node ≥ 18(零 npm 依赖),以及已登录的 codex CLI:

codex login

安装后验证 Codex 可达:

npx github:scasella/claude-dynamic-workflows-codex doctor   # → state: ready

如何使用这个 Agent?

在 Claude Code 里手动输入技能并描述需求即可(不会自动触发):

/codex-workflows  Audit every route under src/ for missing auth checks
/codex-workflows  Research the current state of on-device LLM inference and verify each claim, then watch it live
/codex-workflows --multi  Find the cause of the checkout p99 regression — attack it from a few different angles at once

不装 Claude Code 也能直接用 CLI 跑工作流:

node runner/bin/run-workflow.js examples/review.workflow.js --frontier --auto-effort \
  --sandbox read-only --args '{"files":["runner/src/codexAgent.js"],"focus":"error handling"}'
node runner/bin/run-workflow.js examples/incident-demo/checkout-incident.workflow.js \
  --frontier --auto-effort --sandbox read-only --gui

不跑任何 Codex 就能先看打包好的示例运行(离线、自包含):

git clone https://github.com/scasella/claude-dynamic-workflows-codex
cd claude-dynamic-workflows-codex
node runner/bin/view-run.js examples/incident-demo --open

查看任意历史运行、终端地图与成本报告:

node runner/bin/view-run.js <project-dir> --open   # 加 --watch 实时刷新
node runner/bin/map-run.js  <project-dir> --watch
node runner/bin/summarize-run.js <project-dir> --markdown --out reports/summary.md

常用参数:--frontier、--auto-effort、--plan(零 token 预估)、--budget N、--sandbox read-only|workspace-write、--tui/--gui/--monitor、--resume。

这个 Agent 有哪些优点和局限?

优点
  • 在原生一次性 DSL 之上补上可续问的 sessionful worker:agent.start + session.steer 复用同一热线程,仓库自带基准显示后续追问约 69k token/6s,而冷启动重读约 219k token/97s。
  • agent.waitAny 竞速取先 + session.cancel 取消落败者,避免 parallel() 屏障等待并计费最慢的那一个,示例中两个落败 worker 被标记 cancelled 而非失败。
  • 零 npm 依赖、Node ≥ 18 即可运行,且执行地图是离线自包含的单文件 HTML,可分享、可 file:// 打开、可键盘导航并可切换 Dark/Light。
  • 运行全程写入 .workflow-journal jsonl,summarize-run 能按阶段/worker/最贵智能体给出 token、耗时、cache 命中与风险标记,--resume 免费重放已完成轮次。
  • fleet 监督是文档化的文件契约(references/fleet-protocol.md),并提供 supervise 外壳,可把任意长任务命令接入同一套门禁与状态面板。
局限
  • 核心执行依赖本地 codex CLI 的 app-server,且官方构建与验证基线是 codex 0.144.0,版本差异可能需要重新生成绑定。
  • 它不是 Claude Code 原生体验:没有会话内后台任务、没有 /workflows 进度 UI、不能另存为 /command。
  • 智能体默认以 approvalPolicy: "never" 在沙箱内自主读写并执行 shell,未加 --sandbox read-only 时无人值守运行风险较高。
  • session 热恢复依赖已持久化的 rollout,若 rollout 被删或 codex 版本过旧,该 worker 只能诚实重跑;且轮次重放是按位置匹配,改动会话调用顺序会导致重放前缀失效。
  • 预算按进程计量(--budget-meter 选择 total 或原生 output-token 池),与原生语义不完全 1:1;地图对 pipeline 形状运行也是近似建模。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 形态 / 费用 Star 最近更新 主语言 完整支持的平台
Codex 动态工作流(Claude Code 技能) 当前 53 · 缺口较多 — ★ 325 3 个月前 JavaScript Codex · Claude Code
Ordewell 67 · 存在缺口 命令行工具免费 + 模型费 ★ 199 今天 TypeScript Codex · Claude Code · OpenAI API · Claude API
MCO 73 · 存在缺口 命令行工具免费 + 模型费 ★ 532 4 天前 Python Codex · Claude Code
NTM(Named Tmux Manager) 73 · 存在缺口 命令行工具免费 + 模型费 ★ 456 4 天前 Go Codex · Claude Code

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
53/ 100 五分制 2.7 / 5
信任安全 16/29
可靠稳定 8/14
适用触发 10/18
规范维护 9/18
有效结果 7/13
证据核验 3/8
查看各维度的扣分理由
信任安全16 / 29 · 2.8/5

证据显示:默认 --sandbox workspace-write 允许写文件,但提供 --sandbox read-only 只读选项;human() 门控与超时安全默认值、journal 记录答案、--resume 不重复询问,体现用户确认与回滚能力;CI 权限仅 contents: read,零 npm 依赖降低供应链风险。扣分点:README 未说明运行数据(代码、提示、结果)如何流向本地 codex app-server 或是否外发,数据流透明度仅部分;敏感数据处理无专门说明(无 PII/密钥处理指引);作者身份未经验证,来源归属仅由 package.json 与 LICENSE 声明,属未知而非可疑。

可靠稳定8 / 14 · 2.9/5

证据显示:codex-session.test.js 覆盖超时、传输中断、中断竞态、监听器泄漏等失败路径,失败信息具体(如 'Timed out waiting'、'Transport is not connected'),且 completion 从不 reject,自洽性较好。扣分点:依赖可用性仅声明 Node ≥18 与外部 codex CLI,未固定版本、未提供离线回退或版本兼容矩阵,属薄。

适用触发10 / 18 · 2.8/5

证据显示:README 明确面向 Claude Code 用户,给出审计/研究/迁移/分诊等多场景示例,能力边界清晰(明确不路由模型、只用一个前沿模型、只读是安全而非省钱手段),触发精确(手动 /codex-workflows,不自动触发)。扣分点:环境适配仅覆盖 Node 18+ 与 codex CLI,未说明 Windows/无 GUI/无网络等环境差异,属薄。

规范维护9 / 18 · 2.5/5

证据显示:README 结构清晰、安装说明完整(插件与克隆两种方式、doctor 校验)、示例丰富、MIT 许可证完整。扣分点:无 CHANGELOG,版本仅 package.json 0.2.0;命名稳定性未说明(模型名 gpt-5.6-sol 等随外部变化);已知限制分散在正文而非独立章节;维护责任仅由未验证作者承担,更新路径依赖 GitHub 推送。

有效结果7 / 13 · 2.7/5

证据显示:输出可用性高(内联执行图、viewer、summarize/compare 报告、journal 可复现),相对单 agent 有明确边际价值(并行、竞态取消、会话热线程、监督舰队)。扣分点:成本收益仅以 README 自述的基准(~3× 便宜、~16× 快)支撑,无独立验证,且默认使用前沿模型与高 effort,成本可能较高,属薄。

证据核验3 / 8 · 1.9/5

证据显示:README 大量具体声明(token 数、耗时、基准、dogfood 结果)但多为自述,未提供可独立核对的原始数据;测试文件与 CI 提供部分交叉印证(协议契约、离线套件)。扣分点:声明溯源弱(无逐条引用或数据文件),跨源印证有限(仅仓库内自证),事实与推断分离不足(营销性表述与可验证事实混排)。

风险与缓解建议
  • 默认 --sandbox workspace-write 允许 agent 写文件;在不受信任的仓库或提示上运行前应显式使用 --sandbox read-only。
  • README 未说明运行数据(代码、提示、结果)如何流向本地 codex app-server 或是否外发,处理敏感代码库前需自行核实数据流。
  • 依赖外部 codex CLI 与特定前沿模型名(如 gpt-5.6-sol),版本漂移可能导致行为变化;未固定版本。
  • 成本声明(~3× 便宜、~16× 快)为自述基准,未经独立验证;默认使用前沿模型与高 effort,实际花费可能较高。
  • 发布者身份未经验证,维护与更新路径依赖单一未验证作者。
证据充分度:低 评估于 2026年10月11日 审查版本 16524bea870a
查看完整评分方法 →
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents