建在 Jev 上的 Agent 对比

12 个已完成评审的 agent

Jev 是 TypeSafe AI 在 2026 年 9 月发布的 System One 模型,下面是目录里已评审、并且用到它的 agent:编码 agent 外壳、MCP 服务器、权限闸门、浏览器自动化等。它们大多只有几天或几周的历史,所以 star 数不高,请把每个分数旁边的 FARS 置信度一起看。新出现的项目会被自动收进来。如果你还不了解 Jev 本身,先读专题指南。

刚接触 Jev?先读专题指南 →

# Agent FARS 信任 Star 许可证 语言 最近提交
1 jev-axi 安全判断 CLI 90 23/25 17 MIT TypeScript 2026-09-19
2 Jev Review 81 23/25 177 MIT TypeScript 2026-09-17
3 Pi Jev 语义路由器 80 19/25 19 MIT TypeScript 2026-09-18
4 Jev Guard 79 19/25 12 MIT JavaScript 2026-09-17
5 Supercov 75 16/25 70 MIT Rust 2026-09-19
6 Jev Browser 75 16/25 39 MIT JavaScript 2026-09-18
7 Pi Jev 自动模式 73 18/25 17 MIT TypeScript 2026-09-17
8 Jev Social 71 17/25 16 MIT JavaScript 2026-09-20
9 TypeSafe Evaluate 70 16/25 128 MIT Go 2026-09-20
10 Jevbridge 决策桥 62 14/25 26 MIT TypeScript 2026-09-20
11 Jev 无人机 60 13/25 83 MIT Python 2026-09-17
12 Distill 终端编程助手 47 10/25 678 Apache-2.0 Rust 2026-09-20
这个排序是怎么来的

排序依据是 FARS 总分,Star 只用来打平手——热度衡量的是关注度,不是这东西撑不撑得住。看排序之前有两点要知道:这些都是静态评审(只看源码、文档与仓库元数据,没有做运行复测),可靠性、有效性、可验证三项因此被压了上限,实际可得满分是 77 而不是 100;而且几分之差落在这套方法的噪声范围内。请把这张表当成值得进一步考察的短名单,而不是结论。每个分数都链到完整的维度拆解和背后的证据。 评分方法 →

1. jev-axi 安全判断 CLI

差异在哪

与 foreman 在智能体之上运行监督器不同,jev-axi 不负责启动智能体,而是把类似的进度和卡顿判断接入 Claude Code 或 Codex 自身的钩子。它也不同于会生成文本的编码模型:Jev 只回答类型化问题并给出概率,因此定位是快速判断层,而不是代码生成或代码理解替代品。

完整评审 → GitHub →

2. Jev Review

完整评审 → GitHub →

3. Pi Jev 语义路由器

差异在哪

与 Pi 的常规压缩相比,Jev 压缩会额外评估工具历史,力求保留重要路径、错误、约束和结果;如果 Jev 未配置、调用失败或结果不可用,它会回退到 Pi 的内置摘要。对于工作流中的快速分类,agent: "jev" 被定位为无需启动重量级 LLM 进程的类型化判断节点,而非完整执行型子智能体。

完整评审 → GitHub →

4. Jev Guard

差异在哪

Claude Code 的 auto mode 使用独立分类模型审查操作;Jev Guard 用 risk、user_requested 和 from_untrusted 等类型化 Jev 问题实现相近的允许、询问和拒绝流程。它的主要差异是同一策略还能用于 Codex、Copilot CLI、Gemini CLI、Cursor、pi、OpenCode 和 ACP,并可在 Claude Code 内作为第二层判断;代价是依赖外部 Jev 服务,且部分宿主无法提供原生 ask 流程。

完整评审 → GitHub →

5. Supercov

差异在哪

与需要智能体加载大型 HTML 报告的传统覆盖率流程相比,Supercov 用可分页的 gaps 查询返回较小的具体测试目标,并用 diff 验证增益。与托管式覆盖服务相比,其覆盖运行保留在本地 .supercov/ 目录且不联系 Supercov 服务;但质量评分是另一条路径,依赖 TypeSafe AI 的 Jev API。它也不是测试运行器或智能体平台,而是包裹现有测试命令、生成质量与覆盖证据的 CLI。

完整评审 → GitHub →

6. Jev Browser

差异在哪

项目将其页面上下文用量与 Playwright-MCP 风格的循环作了估算比较:在同一组任务上,Jev Browser 报告每任务中位数约少 5 倍,总量约 8,000 对 557,000 个 token。该差异主要来自把页面阅读交给 Jev;大型页面贡献了大部分节省,而很小的页面没有明显节省。资料没有提供两者在成功率、成本或完整功能范围上的全面对照。

完整评审 → GitHub →

7. Pi Jev 自动模式

差异在哪

其确定性模式目录改编自 @nilskluewer/pi-auto-permission-gate,并沿用类似的“快速通道、硬规则、分类器”三层思路;README 也指出这一结构与 Qwen Code Auto Mode 相近。该项目的具体区别是把 TypeSafe Jev 作为判断层,并强调失败关闭、双侧阈值、每次判断一个请求以及逐条件概率记录。

完整评审 → GitHub →

8. Jev Social

差异在哪

与直接调用 socai CLI 相比,Jev Social 在每次观测后由 Jev 从动态候选操作中决定下一步,并自动整理卡片、表格及证据报告;直接使用 socai 更适合已经知道确切平台与命令、只需执行单次搜索或读取操作的用户。Jev Social 明确不把任务转交给另一研究代理,也不依赖 socai research。

完整评审 → GitHub →

9. TypeSafe Evaluate

差异在哪

相较于让通用语言模型生成自由文本后再解析,Evaluate 直接返回带概率的类型化判断,减少提示格式和解析逻辑,但把核心决策能力绑定到 Jev。接入可选择 TypeSafe API 或 OpenRouter Decisions:前者在两个密钥同时存在时优先,后者由 OpenRouter 账户计费,但其接口路径仍处于 alpha。

完整评审 → GitHub →

10. Jevbridge 决策桥

差异在哪

与直接让生成式大模型同时负责文本生成和动作判断相比,Jevbridge 把判断结果限制为 noul、choice 和 score,并增加独立置信度门。原生 Jev 是首选后端;没有 TypeSafe 密钥时,可用 Codex、Claude、Grok、OpenCode 或通用 OpenAI 兼容模型充当 System One。启发式后端可以离线运行,但只适合测试,不应替代涉及安全的模型判断。

完整评审 → GitHub →

11. Jev 无人机

差异在哪

仓库将 Jev 方案与禁用 Jev 后的贪心基线直接比较。基线只会朝更宽的一侧转向,三次都安全停在第二站,最远到 17.7 米且无碰撞;它无法表达“从低梁上方飞过”。报告中的单次 Jev 运行完成 77.5 米全程,目标可见率为 82%,安全反射占用时间为 9%,同样零碰撞。不过这不是种子匹配的统计结论,早期较简单场地的三种子对照没有显示 Jev 优势。

完整评审 → GitHub →

12. Distill 终端编程助手

差异在哪

与只使用单个主模型的终端编程流程相比,Distill 可配置同会话 Worker,并让 Utility model 处理受限的提取、摘要和压缩任务。与完全依赖云端提供商的方案相比,它也支持本地 OpenAI 兼容服务器;但本地模型的部署、容量与上下文限制需要用户自行承担。

完整评审 → GitHub →