开发与工程 local-firstmcp-clientchrome-bridgemacos-automationreplay-verificationmemory-audittool-routingobservability

Cohort

本地优先的证据驱动 Agent Runtime:录制可校验的执行轨迹,分叉历史运行做反事实实验,并治理上下文、成本与工具风险。

FollowAgents 评估 · FARS-2.1
谨慎使用
68/ 100 五分制 3.4 / 5
1 2 3 4 5 6
1信任安全18 / 29 · 3.1/5

证据显示分层权限模型(R1 可逆/R2 外部副作用需一次性确认 token/R3 高风险拒绝)、本地默认存储、可选 Langfuse 需显式启用、记忆写入需证据引用与回读确认;扣分点:以上均为 README/SECURITY.md 的自述断言,本次仅提供少数源文件,未能审阅工具层实现代码验证 R1/R2/R3 的实际执行与 confirmation token 机制;来源署名仅『Cohort contributors』,无维护者身份,publisher 未验证。

2可靠稳定8 / 14 · 2.9/5

go.mod 依赖极少且为知名库,CI 会运行 go test;doctor 命令提供故障排查与失败排查步骤(如浏览器桥连接失败的排查清单);扣分点:未提供测试文件本身,无法评估测试覆盖;README 自述『当前已验证版本为 v1.0.0』而 SECURITY.md 写『0.1.x』,版本口径不一致。

3适用触发15 / 18 · 4.2/5

受众与场景描述详细(终端 Agent、Control Center、浏览器/桌面自动化、多 Agent 交付),『当前边界』一节明确列出 macOS-only、不支持 Gemini/Bedrock/Vertex、Fork 后缀非确定性等限制;扣分点:环境适配主要覆盖 macOS,跨平台与部分 LLM 平台尚不可用,触发精度仅有路由数据的自述(81→15 工具)无独立佐证。

4规范维护14 / 18 · 3.9/5

README 结构完整(快速开始、架构、能力矩阵、安全模型、文档链接),多语言 README、MIT LICENSE、安装步骤带验收命令;扣分点:无 CHANGELOG,SECURITY.md 支持版本表与 README 声称的 v1.0.0 不一致,无明确维护者/更新承诺(SECURITY.md 自称 best-effort)。

5有效结果9 / 13 · 3.5/5

产品定位(可验证回放、运行时治理)有明确的差异化价值主张,CLI 输出形态、示例任务和验收命令清晰;扣分点:核心差异化声明(SHA-256 proof、路由压缩率、交付闭环)依赖自述与未附源码的设计文档,成本收益未给出量化对比或第三方评估。

6证据核验4 / 8 · 2.5/5

事实与推断总体分离较好(如明确区分 Provider 回执与本地估算、区分确定性前缀与统计后缀、标注 unavailable 数据);扣分点:关键声明(hash 校验、隔离 worktree、token 成本治理)指向文档而非本次提供的源码文件,无法交叉印证;无外部评测或第三方来源可佐证。

证据充分度: 评估于 2026年9月10日 审查版本 a0479a6e62e1
使用前请注意
  • 发布者身份未经验证,安装脚本为 curl | sh 模式,建议先审查 scripts/install.sh 再执行。
  • 安全模型(R1/R2/R3、确认 token、脱敏)目前仅见于文档自述,静态审查未能核验实现,敏感环境使用前应自行审计 internal/tools 与 internal/desktop 代码。
  • 桌面自动化需要授予终端 Accessibility 与 Screen Recording 权限,权限面较大,建议在专用工作区运行。
  • SECURITY.md 支持版本(0.1.x)与 README 声称的 v1.0.0 不一致,注意版本与补丁承诺的错配。
  • 启用 Langfuse 前确认数据边界,截图与 AX 快照可能泄露本地敏感状态。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Cohort 是一个用 Go 编写、通过 npm 分发的本地优先 Agent Runtime,定位是介于大模型与真实执行环境之间的运行时层。它通过 Chrome Bridge 控制真实浏览器、基于 macOS Accessibility 做受控桌面操作、通过 MCP 接入外部系统,并由受控工具层执行文件、Shell 与记忆操作。核心差异化在于 Time Machine:每次运行录制为带 SHA-256 证明的 Replay Bundle,可离线做 Exact Replay 校验,也可在隔离 Git Worktree 中从指定 Turn 分叉,切换模型或 System Prompt 重复实验。Runtime Governor 基于不可变的 run.log.l 证据流治理 Provider 回执、上下文容量、成本与重复失败,并重建因果 DAG 供下钻分析。模型层按协议接入 OpenAI-compatible Chat Completions 和 Anthropic Messages API,支持本地模型(Ollama/LM Studio)与多 profile fallback;长期记忆必须引用工具证据、写入后回读确认并记录审计。当前为公开预览阶段,桌面能力聚焦 macOS,高风险动作(支付、审批、删除等)直接拒绝执行。

用户通过 cohort 进入交互 REPL 或 cohort ask "任务" 执行一次性任务。Agent Runner 读取 session 历史、memory.md 与 compact.md,按层构造受控上下文,调用当前激活的 LLM provider(openai 或 anthropic 协议)做工具决策,再在受控工具层执行:file_read/file_write/file_patch、code_run、60 余个 browser_* 工具(经 ws://127.0.0.1:18777/browser 的 Chrome Bridge 扩展操作 DOM)、desktop_* 工具(macOS AX 控件树、键盘、OCR)、MCP 工具和 memory_propose_update/memory_apply_update。每次运行把请求、响应、工具观察、Prompt 与工作区快照录制为 Replay Bundle:cohort trace replay exact <session_id> --run <run_id> 离线校验帧级哈希并在首个分歧点停止;cohort trace replay fork ... 在分叉点前复用录制证据,之后切到实时模型,在独立 Worktree 中重复 Trial 并输出成功率、Token、延迟和 Proof Hash 报告。Runtime Governor 维护 Provider Receipt Ledger、Context Capacity Waterfall、可执行 Policy Engine 和 Causal DAG(cohort trace graph last --open 生成离线 HTML)。Evidence Delivery 流程用 cohort deliver plan/run/review/accept 在隔离 worktree 中构建候选、经独立 Verifier 审查后事务合并。所有证据默认写入本地 temp/sessions/<session_id>/ 目录,可选上报 Langfuse。

  1. 接手陌生仓库的工程师:让 Cohort 通过受控文件工具读取 README、go.mod 和源码目录,产出带依据文件的架构总结和改进建议,而不是只凭 README 表面总结。
  2. 前端验收测试者:通过 Chrome Bridge 完成登录表单的 DOM 检查、真实 CDP 输入和动作后验证,用 open -> wait -> dom_summary -> act -> verify 的闭环替代截图脚本。
  3. 需要在改动模型或 Prompt 前做对比实验的团队:用 Fork Replay 在隔离 Worktree 中从指定 Turn 切换候选模型,重复 Trial 并比较成功率、Token 与首个行为分歧点。
  4. macOS 重度用户的日常自动化:用 AX 控件树定位窗口和控件起草消息,外部副作用动作需显式确认,支付/删除类高风险动作被拒绝。
  5. 需要审计与合规的技术负责人:依赖不可变 run.log.l、Provider 回执区分、因果 DAG 和记忆审计日志回答“发生了什么、有没有被篡改”。
  6. 多 Agent 软件交付:用 Acceptance Contract、隔离 Builder 和独立 Verifier 生成带 Evidence hash 的候选变更,人工批准后事务合并。

这个 Agent 有哪些优点和局限?

优点
  • Time Machine 是核心差异化能力:Exact Replay 完全离线校验帧级与聚合哈希,Fork Replay 在隔离 Worktree 中做可重复的反事实实验并输出 Proof Hash,普通 Agent 框架没有这种可验证因果回放。
  • 模型层按协议而非厂商硬编码,OpenAI-compatible 与 Anthropic 双协议原生支持,本地 Ollama/LM Studio 即可运行,支持多 profile fallback,无云端控制面依赖。
  • 治理与安全边界清晰:R1/R2/R3 风险分级,外部副作用需 ask_user 确认令牌,支付/审批/删除类动作直接拒绝;长期记忆必须引用工具证据、回读确认并写审计日志。
  • 自适应工具路由有实测数据:代码任务 81→15 个工具、schema payload 减少 82.6%,避免全量 schema 塞进每轮请求。
局限
  • 桌面 Computer Use 仅支持 macOS,跨 OS driver 还在路线图;Linux/Windows 用户无法使用桌面自动化能力。
  • 浏览器自动化依赖手动加载 unpacked Chrome Bridge 扩展并授权系统权限,安装和验收成本高于纯 API 类工具。
  • Gemini 原生 API、Bedrock、Vertex、Azure OpenAI 特殊路径/鉴权没有内置 adapter,只能通过 OpenAI-compatible 网关间接接入。
  • 处于公开预览阶段(v1.0.0 已验证),Fork Replay 的实时后缀不宣称确定性,需要重复 Trial 才能得出统计结论;项目尚无第三方审计或生产规模采用证据。

如何安装或部署这个 Agent?

推荐 npm 全局安装(npm 包会从 GitHub Release 下载匹配 macOS 架构的二进制并校验 SHA256,当前已验证版本 v1.0.0):

bash

npm install -g @cohort-ai/cohort@latest
cohort --version

或使用 GitHub installer:

bash

curl -fsSL https://raw.githubusercontent.com/congchuanling-dot/Cohort/master/scripts/install.sh | sh -s -- --repo https://github.com/congchuanling-dot/Cohort.git
export PATH="$HOME/.cohort/bin:$PATH"

源码开发需 Go 1.21:

bash

git clone https://github.com/congchuanling-dot/Cohort.git
cd Cohort
./scripts/install.sh

之后运行 cohort init --provider deepseek(或 local / anthropic)配置模型,设置对应 API key 环境变量,并用 cohort doctor 做启动前诊断。

如何使用这个 Agent?

  1. 配置模型 API 并注入 key,例如 DeepSeek:cohort init --provider deepseek && export DEEPSEEK_API_KEY="sk-xxx";本地模型用 --provider local 配 Ollama/LM Studio 的 OpenAI-compatible 端点;Claude 用 --provider anthropic
  2. 浏览器自动化:cohort extension open 打开 chrome://extensions,开启 Developer mode 后 Load unpacked 选择 cohort extension path 输出的目录,再运行 cohort doctor computer 确认 browser.bridge.connection: connected。
  3. 桌面自动化:在 macOS 系统设置中给运行 Cohort 的终端授予 Accessibility 和 Screen Recording 权限。
  4. 启动:运行 cohort 进入交互模式直接输入任务,或 cohort ask "读取 README.md 并总结核心能力"。常用命令包括 cohort toolscohort configcohort session list/resumecohort mcp add/list/statuscohort skill listcohort trace graph last --opencohort trace replay exact/forkcohort deliver plan/run/review/acceptcohort ui(本地 Control Center)。可选 Langfuse tracing 通过 COHORT_LANGFUSE_ENABLED 等环境变量开启。

这个 Agent 与同类方案有什么区别?

README 将自己与“普通 Agent Demo / 聊天框”对比,并把 Skill 系统类比为“像 Claude Code 一样安装、校验、锁定版本”,但没有对具体竞品做系统对比。

常见问题

必须付费使用某个模型厂商吗?
不需要绑定单一厂商。任何兼容 OpenAI Chat Completions 的服务(DeepSeek、OpenAI、OpenRouter、Ollama、LM Studio 等)或 Anthropic 原生 API 都可接入,可用本地模型将推理成本降为零,但需自备对应 API key(本地服务可用占位 key)。
会把我或我的数据上传到云端吗?
默认不会。session、日志、截图、记忆默认本地存储;只有显式设置 LANGFUSE 相关环境变量才会上报 trace,且敏感字段会脱敏,截图和大段工具输出不进入 trace。
如果 Agent 执行了危险操作怎么办?
Cohort 用 R1/R2/R3 分级:可恢复动作直接执行,发送/提交/上传等外部副作用动作必须经 ask_user 获得一次性确认令牌,支付、审批、授权、删除、登录验证等高风险动作直接拒绝。
在 Linux 或 Windows 上能用吗?
浏览器和本地文件/Shell/MCP 能力不依赖 macOS,但桌面 Computer Use 当前聚焦 macOS(依赖 Accessibility/AX),跨 OS driver 还在路线图。
Replay 能保证完全复现历史行为吗?
Exact Replay 是确定性的,完全离线校验录制的请求、响应和工具观察,不调用模型或网络;Fork Replay 在分叉点后切换到实时模型,属于统计实验,需要重复 Trial 评估。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents