Cohort
本地优先的证据驱动 Agent Runtime:录制可校验的执行轨迹,分叉历史运行做反事实实验,并治理上下文、成本与工具风险。
证据显示分层权限模型(R1 可逆/R2 外部副作用需一次性确认 token/R3 高风险拒绝)、本地默认存储、可选 Langfuse 需显式启用、记忆写入需证据引用与回读确认;扣分点:以上均为 README/SECURITY.md 的自述断言,本次仅提供少数源文件,未能审阅工具层实现代码验证 R1/R2/R3 的实际执行与 confirmation token 机制;来源署名仅『Cohort contributors』,无维护者身份,publisher 未验证。
go.mod 依赖极少且为知名库,CI 会运行 go test;doctor 命令提供故障排查与失败排查步骤(如浏览器桥连接失败的排查清单);扣分点:未提供测试文件本身,无法评估测试覆盖;README 自述『当前已验证版本为 v1.0.0』而 SECURITY.md 写『0.1.x』,版本口径不一致。
受众与场景描述详细(终端 Agent、Control Center、浏览器/桌面自动化、多 Agent 交付),『当前边界』一节明确列出 macOS-only、不支持 Gemini/Bedrock/Vertex、Fork 后缀非确定性等限制;扣分点:环境适配主要覆盖 macOS,跨平台与部分 LLM 平台尚不可用,触发精度仅有路由数据的自述(81→15 工具)无独立佐证。
README 结构完整(快速开始、架构、能力矩阵、安全模型、文档链接),多语言 README、MIT LICENSE、安装步骤带验收命令;扣分点:无 CHANGELOG,SECURITY.md 支持版本表与 README 声称的 v1.0.0 不一致,无明确维护者/更新承诺(SECURITY.md 自称 best-effort)。
产品定位(可验证回放、运行时治理)有明确的差异化价值主张,CLI 输出形态、示例任务和验收命令清晰;扣分点:核心差异化声明(SHA-256 proof、路由压缩率、交付闭环)依赖自述与未附源码的设计文档,成本收益未给出量化对比或第三方评估。
事实与推断总体分离较好(如明确区分 Provider 回执与本地估算、区分确定性前缀与统计后缀、标注 unavailable 数据);扣分点:关键声明(hash 校验、隔离 worktree、token 成本治理)指向文档而非本次提供的源码文件,无法交叉印证;无外部评测或第三方来源可佐证。
- 发布者身份未经验证,安装脚本为 curl | sh 模式,建议先审查 scripts/install.sh 再执行。
- 安全模型(R1/R2/R3、确认 token、脱敏)目前仅见于文档自述,静态审查未能核验实现,敏感环境使用前应自行审计 internal/tools 与 internal/desktop 代码。
- 桌面自动化需要授予终端 Accessibility 与 Screen Recording 权限,权限面较大,建议在专用工作区运行。
- SECURITY.md 支持版本(0.1.x)与 README 声称的 v1.0.0 不一致,注意版本与补丁承诺的错配。
- 启用 Langfuse 前确认数据边界,截图与 AX 快照可能泄露本地敏感状态。
这个 Agent 能做什么,适合哪些场景?
Cohort 是一个用 Go 编写、通过 npm 分发的本地优先 Agent Runtime,定位是介于大模型与真实执行环境之间的运行时层。它通过 Chrome Bridge 控制真实浏览器、基于 macOS Accessibility 做受控桌面操作、通过 MCP 接入外部系统,并由受控工具层执行文件、Shell 与记忆操作。核心差异化在于 Time Machine:每次运行录制为带 SHA-256 证明的 Replay Bundle,可离线做 Exact Replay 校验,也可在隔离 Git Worktree 中从指定 Turn 分叉,切换模型或 System Prompt 重复实验。Runtime Governor 基于不可变的 run.log.l 证据流治理 Provider 回执、上下文容量、成本与重复失败,并重建因果 DAG 供下钻分析。模型层按协议接入 OpenAI-compatible Chat Completions 和 Anthropic Messages API,支持本地模型(Ollama/LM Studio)与多 profile fallback;长期记忆必须引用工具证据、写入后回读确认并记录审计。当前为公开预览阶段,桌面能力聚焦 macOS,高风险动作(支付、审批、删除等)直接拒绝执行。
用户通过 cohort 进入交互 REPL 或 cohort ask "任务" 执行一次性任务。Agent Runner 读取 session 历史、memory.md 与 compact.md,按层构造受控上下文,调用当前激活的 LLM provider(openai 或 anthropic 协议)做工具决策,再在受控工具层执行:file_read/file_write/file_patch、code_run、60 余个 browser_* 工具(经 ws://127.0.0.1:18777/browser 的 Chrome Bridge 扩展操作 DOM)、desktop_* 工具(macOS AX 控件树、键盘、OCR)、MCP 工具和 memory_propose_update/memory_apply_update。每次运行把请求、响应、工具观察、Prompt 与工作区快照录制为 Replay Bundle:cohort trace replay exact <session_id> --run <run_id> 离线校验帧级哈希并在首个分歧点停止;cohort trace replay fork ... 在分叉点前复用录制证据,之后切到实时模型,在独立 Worktree 中重复 Trial 并输出成功率、Token、延迟和 Proof Hash 报告。Runtime Governor 维护 Provider Receipt Ledger、Context Capacity Waterfall、可执行 Policy Engine 和 Causal DAG(cohort trace graph last --open 生成离线 HTML)。Evidence Delivery 流程用 cohort deliver plan/run/review/accept 在隔离 worktree 中构建候选、经独立 Verifier 审查后事务合并。所有证据默认写入本地 temp/sessions/<session_id>/ 目录,可选上报 Langfuse。
- 接手陌生仓库的工程师:让 Cohort 通过受控文件工具读取 README、go.mod 和源码目录,产出带依据文件的架构总结和改进建议,而不是只凭 README 表面总结。
- 前端验收测试者:通过 Chrome Bridge 完成登录表单的 DOM 检查、真实 CDP 输入和动作后验证,用 open -> wait -> dom_summary -> act -> verify 的闭环替代截图脚本。
- 需要在改动模型或 Prompt 前做对比实验的团队:用 Fork Replay 在隔离 Worktree 中从指定 Turn 切换候选模型,重复 Trial 并比较成功率、Token 与首个行为分歧点。
- macOS 重度用户的日常自动化:用 AX 控件树定位窗口和控件起草消息,外部副作用动作需显式确认,支付/删除类高风险动作被拒绝。
- 需要审计与合规的技术负责人:依赖不可变 run.log.l、Provider 回执区分、因果 DAG 和记忆审计日志回答“发生了什么、有没有被篡改”。
- 多 Agent 软件交付:用 Acceptance Contract、隔离 Builder 和独立 Verifier 生成带 Evidence hash 的候选变更,人工批准后事务合并。
这个 Agent 有哪些优点和局限?
- Time Machine 是核心差异化能力:Exact Replay 完全离线校验帧级与聚合哈希,Fork Replay 在隔离 Worktree 中做可重复的反事实实验并输出 Proof Hash,普通 Agent 框架没有这种可验证因果回放。
- 模型层按协议而非厂商硬编码,OpenAI-compatible 与 Anthropic 双协议原生支持,本地 Ollama/LM Studio 即可运行,支持多 profile fallback,无云端控制面依赖。
- 治理与安全边界清晰:R1/R2/R3 风险分级,外部副作用需 ask_user 确认令牌,支付/审批/删除类动作直接拒绝;长期记忆必须引用工具证据、回读确认并写审计日志。
- 自适应工具路由有实测数据:代码任务 81→15 个工具、schema payload 减少 82.6%,避免全量 schema 塞进每轮请求。
- 桌面 Computer Use 仅支持 macOS,跨 OS driver 还在路线图;Linux/Windows 用户无法使用桌面自动化能力。
- 浏览器自动化依赖手动加载 unpacked Chrome Bridge 扩展并授权系统权限,安装和验收成本高于纯 API 类工具。
- Gemini 原生 API、Bedrock、Vertex、Azure OpenAI 特殊路径/鉴权没有内置 adapter,只能通过 OpenAI-compatible 网关间接接入。
- 处于公开预览阶段(v1.0.0 已验证),Fork Replay 的实时后缀不宣称确定性,需要重复 Trial 才能得出统计结论;项目尚无第三方审计或生产规模采用证据。
如何安装或部署这个 Agent?
推荐 npm 全局安装(npm 包会从 GitHub Release 下载匹配 macOS 架构的二进制并校验 SHA256,当前已验证版本 v1.0.0):
bash
npm install -g @cohort-ai/cohort@latest
cohort --version或使用 GitHub installer:
bash
curl -fsSL https://raw.githubusercontent.com/congchuanling-dot/Cohort/master/scripts/install.sh | sh -s -- --repo https://github.com/congchuanling-dot/Cohort.git
export PATH="$HOME/.cohort/bin:$PATH"源码开发需 Go 1.21:
bash
git clone https://github.com/congchuanling-dot/Cohort.git
cd Cohort
./scripts/install.sh之后运行 cohort init --provider deepseek(或 local / anthropic)配置模型,设置对应 API key 环境变量,并用 cohort doctor 做启动前诊断。
如何使用这个 Agent?
- 配置模型 API 并注入 key,例如 DeepSeek:
cohort init --provider deepseek && export DEEPSEEK_API_KEY="sk-xxx";本地模型用--provider local配 Ollama/LM Studio 的 OpenAI-compatible 端点;Claude 用--provider anthropic。 - 浏览器自动化:
cohort extension open打开 chrome://extensions,开启 Developer mode 后 Load unpacked 选择cohort extension path输出的目录,再运行cohort doctor computer确认 browser.bridge.connection: connected。 - 桌面自动化:在 macOS 系统设置中给运行 Cohort 的终端授予 Accessibility 和 Screen Recording 权限。
- 启动:运行
cohort进入交互模式直接输入任务,或cohort ask "读取 README.md 并总结核心能力"。常用命令包括cohort tools、cohort config、cohort session list/resume、cohort mcp add/list/status、cohort skill list、cohort trace graph last --open、cohort trace replay exact/fork、cohort deliver plan/run/review/accept、cohort ui(本地 Control Center)。可选 Langfuse tracing 通过 COHORT_LANGFUSE_ENABLED 等环境变量开启。
这个 Agent 与同类方案有什么区别?
README 将自己与“普通 Agent Demo / 聊天框”对比,并把 Skill 系统类比为“像 Claude Code 一样安装、校验、锁定版本”,但没有对具体竞品做系统对比。