Babysitter

用代码定义并强制执行多智能体工作流,加入审批、质量门禁与可回放审计记录。

Star 数
★ 1.8k
最近更新
23 天前
License
MIT
主语言
JavaScript

30 秒速览

可在哪里用
通用 · 跨平台Claude CodeCodex · Claude.ai(部分支持)
开始前需要
Node.js 20.0.0+A supported AI coding harnessShell / 命令行网络访问本地文件系统MCP Server
典型场景
技术负责人需要把“先规划、人工批准、实现、测试、质量评分不足则返工”的交付流程写成 JavaScript 并强制执行时。
主要局限
主 CLI 需要 Node.js 20.0.0+,adapters CLI 的最低版本更高,为 20.9.0+。

这个 Agent 能做什么,适合哪些场景?

Babysitter 是面向 AI 编码工具的工作流编排项目,核心交互包括 babysitter、genty 和 adapters 命令行,以及各宿主工具的插件。工作流以 JavaScript 进程定义,进程可调用 ctx.task 和 ctx.breakpoint;运行时据此决定后续允许执行的任务。它将任务、门禁和决策写入事件式 journal,并支持从中断处恢复运行。v6 通过 Adapters 运行时支持跨多个编码宿主执行同一流程,另有无需外部编码代理的 internal harness,可用于脚本、测试和 CI/CD。仓库还提供蓝图、进程库、压缩配置、MCP 服务启动命令,以及面向运行管理的 genty 平台包。

用户通过 /babysitter:call、/babysitter:yolo、/babysitter:plan 等会话命令,或 genty call --harness <harness> --prompt <prompt> --workspace <path> 启动流程。JavaScript process 中的 await ctx.task(...) 分派工作,await ctx.breakpoint(...) 创建必须通过的人类审批点,代码中的条件判断可将质量检查结果作为后续步骤的门禁。运行时在每一步后检查流程允许的下一项,并把任务、门禁和决策记录到默认的 ~/.a5c/runs/;同时兼容读取仓库内 .a5c/runs/。genty 支持 resume、doctor、retrospect、cleanup 和 start-server,internal harness 可直接执行进程或提示词,并可将子任务委派给运行时发现的已安装宿主。插件会自动注册四层压缩钩子;可通过 BABYSITTER_COMPRESSION_ENABLED、babysitter compression:toggle 和 .a5c/compression.config.json 调整。

  1. 技术负责人需要把“先规划、人工批准、实现、测试、质量评分不足则返工”的交付流程写成 JavaScript 并强制执行时。
  2. CI/CD 维护者希望在没有外部 AI 编码 CLI 的环境中,用 genty call --harness internal 运行 lint 与测试流程时。
  3. 使用 Claude Code 的团队需要在长任务中设置结构化审批点,并在会话中断后通过 /babysitter:resume 继续时。
  4. 同时使用 Claude Code、Codex CLI 或其他已支持宿主的工程团队,希望以 Adapters 复用同一套流程时。
  5. 需要审计并复盘自动化运行的团队,希望使用 journal、genty doctor 和 genty retrospect 查看任务与决策记录时。

如何安装或部署这个 Agent?

前置条件为 Node.js 20.0.0+(adapters CLI 要求 20.9.0+)及一个受支持的 AI 编码宿主。安装主 CLI:

npm install -g @a5c-ai/babysitter

如需从 shell 直接驱动宿主,安装:

npm install -g @a5c-ai/adapters-cli
adapters doctor

如需运行编排命令,安装:

npm install -g @a5c-ai/genty-platform

Claude Code 可通过 claude plugin marketplace add a5c-ai/babysitter 后安装 [email protected];Codex CLI(Beta)可执行 codex plugin marketplace add a5c-ai/babysitter。所给资料未说明额外凭据配置步骤。

如何使用这个 Agent?

在 Claude Code 会话中可运行:

/babysitter:user-install
/babysitter:project-install
/babysitter:doctor
/babysitter:call implement user authentication with TDD

使用运行时 CLI 的最小调用示例:
genty call --harness claude-code --prompt "implement user authentication with TDD" --workspace .

无外部编码代理的自动化示例:

genty call --harness internal --process .a5c/processes/lint-and-test.js#process --workspace . --no-interactive --json

中断后可用 genty resume --run-id <runId> --harness claude-code --workspace . 恢复。

这个 Agent 有哪些优点和局限?

优点
  • 流程是可执行的 JavaScript,而非仅靠提示词约定;ctx.task、ctx.breakpoint 与代码条件可直接限定后续步骤。
  • 任务、门禁和决策会写入 journal,支持确定性回放与从中断点恢复。
  • 同时提供会话内插件、host-side adapters CLI、genty 运行时 CLI 和 internal harness,覆盖交互式与无头自动化调用。
  • 支持结构化人工审批、并行分派和质量门禁,适合需要治理而非一次性提示的流程。
局限
  • 主 CLI 需要 Node.js 20.0.0+,adapters CLI 的最低版本更高,为 20.9.0+。
  • 除 internal harness 外,典型使用依赖已安装且受支持的 AI 编码宿主;不同宿主的安装方式不同。
  • Codex CLI 集成标为 Beta,Cursor、Gemini CLI、GitHub Copilot、Pi、Hermes、Oh-My-Pi、OpenCode 与 OpenClaw 集成标为 Experimental。
  • 采用完整编排能力通常要理解多个包的边界:@a5c-ai/babysitter、@a5c-ai/adapters-cli、@a5c-ai/genty-platform 与宿主插件并非同一安装物。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
Babysitter 当前 52 · 缺口较多 ★ 1.8k 23 天前 JavaScript Claude Code
Agency Orchestrator:一句话组队 AI 专家团队 61 · 存在缺口 ★ 2.3k 1 天前 TypeScript Codex · Claude Code · OpenAI API · Claude API
Dagu 工作流编排器 74 · 存在缺口 ★ 4.1k 1 天前 Go Codex · Claude Code · Claude API
DuraGraph 45 · 缺口较多 ★ 163 12 天前 Go

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
52/ 100 五分制 2.6 / 5
信任安全 11/29
可靠稳定 8/14
适用触发 12/18
规范维护 10/18
有效结果 7/13
证据核验 4/8
查看各维度的扣分理由
信任安全11 / 29 · 1.9/5

证据显示:README 强调强制停止、断点(人类审批)和不可变日志,表明有用户确认机制;但未提供权限最小化、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的具体实现细节。扣分原因:这些方面仅有断言或部分证据,未达到充分处理。

可靠稳定8 / 14 · 2.9/5

证据显示:README 和测试文件(如 bridge-hooks.test.ts)表明有错误处理和回退逻辑,但依赖可用性未验证,失败消息在测试中有部分覆盖。扣分原因:依赖可用性未证实,失败消息覆盖有限。

适用触发12 / 18 · 3.3/5

证据显示:README 描述了多种使用场景(交互式、自主、规划、持续)和多种 harness 支持,能力边界通过进程代码定义,触发命令明确,环境适配有安装矩阵。扣分原因:能力边界和触发精度有文档但未充分验证,环境适配依赖外部 harness。

规范维护10 / 18 · 2.8/5

证据显示:README 结构清晰,安装说明详细,命名稳定(包名和命令),有示例和 FAQ 部分,MIT 许可证明确。扣分原因:已知限制未明确列出,版本变更日志未提供,维护责任未明确。

有效结果7 / 13 · 2.7/5

证据显示:输出可用性有 JSON 输出和 CLI 命令,边际价值有独特功能(进程强制、确定性重放),但成本效益未量化。扣分原因:成本效益缺乏数据支持。

证据核验4 / 8 · 2.5/5

证据显示:README 中的声明部分有文档和测试支持,但跨来源验证不足,事实与推断未明确分离。扣分原因:跨来源验证有限,事实与推断混合。

风险与缓解建议
  • 该仓库是大型 monorepo,包含多个包,静态审查可能无法覆盖所有代码路径。
  • README 中的声明(如“确定性、无幻觉”)需要实际运行验证,但静态审查无法确认。
  • 依赖安全未充分评估,建议检查依赖漏洞。
  • 发布者身份未验证,应谨慎对待。
证据充分度: 评估于 2026年8月9日 审查版本 ca6e2eaa04a6 评估后仓库已有新提交,评分可能未覆盖最新改动
查看完整评分方法 →

常见问题

是否必须使用 Claude Code?
不是。资料称 v6 的 Adapters 运行时可跨 12 个受支持的 AI 编码宿主运行同一流程;此外 internal harness 不需要外部 AI 编码代理。
流程能否在人工审批前自行继续?
由流程代码决定。ctx.breakpoint(...) 是结构化门禁,运行说明将其描述为阻止流程继续直到门禁满足;yolo 模式则标为无断点的全自动运行。
运行中断后会丢失状态吗?
项目将任务、门禁和决策写入事件式 journal,文档说明可确定性回放,并可通过 /babysitter:resume 或 genty resume 继续运行。
是否需要付费或额外凭据?
所给资料列出 npm 安装和宿主插件安装,但未说明 Babysitter 的定价、订阅要求或额外凭据配置;所选宿主自身的要求不在资料中展开。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents