Babysitter
用代码定义并强制执行多智能体工作流,加入审批、质量门禁与可回放审计记录。
- Star 数
- ★ 1.8k
- 最近更新
- 23 天前
- License
- MIT
- 主语言
- JavaScript
- FA 评分
- 52/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台Claude CodeCodex · Claude.ai(部分支持)
- 开始前需要
- 典型场景
- 技术负责人需要把“先规划、人工批准、实现、测试、质量评分不足则返工”的交付流程写成 JavaScript 并强制执行时。
- 主要局限
- 主 CLI 需要 Node.js 20.0.0+,adapters CLI 的最低版本更高,为 20.9.0+。
- 源码审查
- 52/100 · 缺口较多
这个 Agent 能做什么,适合哪些场景?
Babysitter 是面向 AI 编码工具的工作流编排项目,核心交互包括 babysitter、genty 和 adapters 命令行,以及各宿主工具的插件。工作流以 JavaScript 进程定义,进程可调用 ctx.task 和 ctx.breakpoint;运行时据此决定后续允许执行的任务。它将任务、门禁和决策写入事件式 journal,并支持从中断处恢复运行。v6 通过 Adapters 运行时支持跨多个编码宿主执行同一流程,另有无需外部编码代理的 internal harness,可用于脚本、测试和 CI/CD。仓库还提供蓝图、进程库、压缩配置、MCP 服务启动命令,以及面向运行管理的 genty 平台包。
用户通过 /babysitter:call、/babysitter:yolo、/babysitter:plan 等会话命令,或 genty call --harness <harness> --prompt <prompt> --workspace <path> 启动流程。JavaScript process 中的 await ctx.task(...) 分派工作,await ctx.breakpoint(...) 创建必须通过的人类审批点,代码中的条件判断可将质量检查结果作为后续步骤的门禁。运行时在每一步后检查流程允许的下一项,并把任务、门禁和决策记录到默认的 ~/.a5c/runs/;同时兼容读取仓库内 .a5c/runs/。genty 支持 resume、doctor、retrospect、cleanup 和 start-server,internal harness 可直接执行进程或提示词,并可将子任务委派给运行时发现的已安装宿主。插件会自动注册四层压缩钩子;可通过 BABYSITTER_COMPRESSION_ENABLED、babysitter compression:toggle 和 .a5c/compression.config.json 调整。
- 技术负责人需要把“先规划、人工批准、实现、测试、质量评分不足则返工”的交付流程写成 JavaScript 并强制执行时。
- CI/CD 维护者希望在没有外部 AI 编码 CLI 的环境中,用 genty call --harness internal 运行 lint 与测试流程时。
- 使用 Claude Code 的团队需要在长任务中设置结构化审批点,并在会话中断后通过 /babysitter:resume 继续时。
- 同时使用 Claude Code、Codex CLI 或其他已支持宿主的工程团队,希望以 Adapters 复用同一套流程时。
- 需要审计并复盘自动化运行的团队,希望使用 journal、genty doctor 和 genty retrospect 查看任务与决策记录时。
如何安装或部署这个 Agent?
前置条件为 Node.js 20.0.0+(adapters CLI 要求 20.9.0+)及一个受支持的 AI 编码宿主。安装主 CLI:
npm install -g @a5c-ai/babysitter如需从 shell 直接驱动宿主,安装:
npm install -g @a5c-ai/adapters-cli
adapters doctor如需运行编排命令,安装:
npm install -g @a5c-ai/genty-platformClaude Code 可通过 claude plugin marketplace add a5c-ai/babysitter 后安装 [email protected];Codex CLI(Beta)可执行 codex plugin marketplace add a5c-ai/babysitter。所给资料未说明额外凭据配置步骤。
如何使用这个 Agent?
在 Claude Code 会话中可运行:
/babysitter:user-install
/babysitter:project-install
/babysitter:doctor
/babysitter:call implement user authentication with TDD使用运行时 CLI 的最小调用示例:
genty call --harness claude-code --prompt "implement user authentication with TDD" --workspace .
无外部编码代理的自动化示例:
genty call --harness internal --process .a5c/processes/lint-and-test.js#process --workspace . --no-interactive --json中断后可用 genty resume --run-id <runId> --harness claude-code --workspace . 恢复。
这个 Agent 有哪些优点和局限?
- 流程是可执行的 JavaScript,而非仅靠提示词约定;ctx.task、ctx.breakpoint 与代码条件可直接限定后续步骤。
- 任务、门禁和决策会写入 journal,支持确定性回放与从中断点恢复。
- 同时提供会话内插件、host-side adapters CLI、genty 运行时 CLI 和 internal harness,覆盖交互式与无头自动化调用。
- 支持结构化人工审批、并行分派和质量门禁,适合需要治理而非一次性提示的流程。
- 主 CLI 需要 Node.js 20.0.0+,adapters CLI 的最低版本更高,为 20.9.0+。
- 除 internal harness 外,典型使用依赖已安装且受支持的 AI 编码宿主;不同宿主的安装方式不同。
- Codex CLI 集成标为 Beta,Cursor、Gemini CLI、GitHub Copilot、Pi、Hermes、Oh-My-Pi、OpenCode 与 OpenClaw 集成标为 Experimental。
- 采用完整编排能力通常要理解多个包的边界:@a5c-ai/babysitter、@a5c-ai/adapters-cli、@a5c-ai/genty-platform 与宿主插件并非同一安装物。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| Babysitter 当前 | 52 · 缺口较多 | ★ 1.8k | 23 天前 | JavaScript | Claude Code |
| Agency Orchestrator:一句话组队 AI 专家团队 | 61 · 存在缺口 | ★ 2.3k | 1 天前 | TypeScript | Codex · Claude Code · OpenAI API · Claude API |
| Dagu 工作流编排器 | 74 · 存在缺口 | ★ 4.1k | 1 天前 | Go | Codex · Claude Code · Claude API |
| DuraGraph | 45 · 缺口较多 | ★ 163 | 12 天前 | Go | — |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示:README 强调强制停止、断点(人类审批)和不可变日志,表明有用户确认机制;但未提供权限最小化、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的具体实现细节。扣分原因:这些方面仅有断言或部分证据,未达到充分处理。
证据显示:README 和测试文件(如 bridge-hooks.test.ts)表明有错误处理和回退逻辑,但依赖可用性未验证,失败消息在测试中有部分覆盖。扣分原因:依赖可用性未证实,失败消息覆盖有限。
证据显示:README 描述了多种使用场景(交互式、自主、规划、持续)和多种 harness 支持,能力边界通过进程代码定义,触发命令明确,环境适配有安装矩阵。扣分原因:能力边界和触发精度有文档但未充分验证,环境适配依赖外部 harness。
证据显示:README 结构清晰,安装说明详细,命名稳定(包名和命令),有示例和 FAQ 部分,MIT 许可证明确。扣分原因:已知限制未明确列出,版本变更日志未提供,维护责任未明确。
证据显示:输出可用性有 JSON 输出和 CLI 命令,边际价值有独特功能(进程强制、确定性重放),但成本效益未量化。扣分原因:成本效益缺乏数据支持。
证据显示:README 中的声明部分有文档和测试支持,但跨来源验证不足,事实与推断未明确分离。扣分原因:跨来源验证有限,事实与推断混合。
- 该仓库是大型 monorepo,包含多个包,静态审查可能无法覆盖所有代码路径。
- README 中的声明(如“确定性、无幻觉”)需要实际运行验证,但静态审查无法确认。
- 依赖安全未充分评估,建议检查依赖漏洞。
- 发布者身份未验证,应谨慎对待。