建在 Jev 上的 Agent 对比
Jev 是 TypeSafe AI 在 2026 年 9 月发布的 System One 模型,下面是目录里已评审、并且用到它的 agent:编码 agent 外壳、MCP 服务器、权限闸门、浏览器自动化等。它们大多只有几天或几周的历史,所以 star 数不高,请把每个分数旁边的 FARS 置信度一起看。新出现的项目会被自动收进来。如果你还不了解 Jev 本身,先读专题指南。
| # | Agent | FARS | 信任 | Star | 许可证 | 语言 | 最近提交 |
|---|---|---|---|---|---|---|---|
| 1 | jev-axi 安全判断 CLI | 90 | 23/25 | 17 | MIT | TypeScript | 2026-09-19 |
| 2 | Jev Review | 81 | 23/25 | 177 | MIT | TypeScript | 2026-09-17 |
| 3 | Pi Jev 语义路由器 | 80 | 19/25 | 19 | MIT | TypeScript | 2026-09-18 |
| 4 | Jev Guard | 79 | 19/25 | 12 | MIT | JavaScript | 2026-09-17 |
| 5 | Supercov | 75 | 16/25 | 70 | MIT | Rust | 2026-09-19 |
| 6 | Jev Browser | 75 | 16/25 | 39 | MIT | JavaScript | 2026-09-18 |
| 7 | Pi Jev 自动模式 | 73 | 18/25 | 17 | MIT | TypeScript | 2026-09-17 |
| 8 | Jev Social | 71 | 17/25 | 16 | MIT | JavaScript | 2026-09-20 |
| 9 | TypeSafe Evaluate | 70 | 16/25 | 128 | MIT | Go | 2026-09-20 |
| 10 | Jevbridge 决策桥 | 62 | 14/25 | 26 | MIT | TypeScript | 2026-09-20 |
| 11 | Jev 无人机 | 60 | 13/25 | 83 | MIT | Python | 2026-09-17 |
| 12 | Distill 终端编程助手 | 47 | 10/25 | 678 | Apache-2.0 | Rust | 2026-09-20 |
排序依据是 FARS 总分,Star 只用来打平手——热度衡量的是关注度,不是这东西撑不撑得住。看排序之前有两点要知道:这些都是静态评审(只看源码、文档与仓库元数据,没有做运行复测),可靠性、有效性、可验证三项因此被压了上限,实际可得满分是 77 而不是 100;而且几分之差落在这套方法的噪声范围内。请把这张表当成值得进一步考察的短名单,而不是结论。每个分数都链到完整的维度拆解和背后的证据。 评分方法 →
1. jev-axi 安全判断 CLI
为编码智能体快速评估命令、文本、差异和任务进度。
差异在哪
与 foreman 在智能体之上运行监督器不同,jev-axi 不负责启动智能体,而是把类似的进度和卡顿判断接入 Claude Code 或 Codex 自身的钩子。它也不同于会生成文本的编码模型:Jev 只回答类型化问题并给出概率,因此定位是快速判断层,而不是代码生成或代码理解替代品。
2. Jev Review
为编码智能体提供持续、结构化的软件质量评分。
3. Pi Jev 语义路由器
为 Pi 按需选择工具、技能和模型,并执行快速类型化判断。
差异在哪
与 Pi 的常规压缩相比,Jev 压缩会额外评估工具历史,力求保留重要路径、错误、约束和结果;如果 Jev 未配置、调用失败或结果不可用,它会回退到 Pi 的内置摘要。对于工作流中的快速分类,agent: "jev" 被定位为无需启动重量级 LLM 进程的类型化判断节点,而非完整执行型子智能体。
4. Jev Guard
为多种编码代理逐次评估工具调用,并拦截危险操作与提示注入。
差异在哪
Claude Code 的 auto mode 使用独立分类模型审查操作;Jev Guard 用 risk、user_requested 和 from_untrusted 等类型化 Jev 问题实现相近的允许、询问和拒绝流程。它的主要差异是同一策略还能用于 Codex、Copilot CLI、Gemini CLI、Cursor、pi、OpenCode 和 ACP,并可在 Claude Code 内作为第二层判断;代价是依赖外部 Jev 服务,且部分宿主无法提供原生 ask 流程。
5. Supercov
用可验证的质量评分和覆盖率缺口指导编码智能体逐步改进代码。
差异在哪
与需要智能体加载大型 HTML 报告的传统覆盖率流程相比,Supercov 用可分页的 gaps 查询返回较小的具体测试目标,并用 diff 验证增益。与托管式覆盖服务相比,其覆盖运行保留在本地 .supercov/ 目录且不联系 Supercov 服务;但质量评分是另一条路径,依赖 TypeSafe AI 的 Jev API。它也不是测试运行器或智能体平台,而是包裹现有测试命令、生成质量与覆盖证据的 CLI。
6. Jev Browser
让大模型设定目标、Jev判断动作的浏览器自动化工具。
差异在哪
项目将其页面上下文用量与 Playwright-MCP 风格的循环作了估算比较:在同一组任务上,Jev Browser 报告每任务中位数约少 5 倍,总量约 8,000 对 557,000 个 token。该差异主要来自把页面阅读交给 Jev;大型页面贡献了大部分节省,而很小的页面没有明显节省。资料没有提供两者在成功率、成本或完整功能范围上的全面对照。
7. Pi Jev 自动模式
为 Pi 的命令与文件操作提供默认拒绝的自动权限判断。
差异在哪
其确定性模式目录改编自 @nilskluewer/pi-auto-permission-gate,并沿用类似的“快速通道、硬规则、分类器”三层思路;README 也指出这一结构与 Qwen Code Auto Mode 相近。该项目的具体区别是把 TypeSafe Jev 作为判断层,并强调失败关闭、双侧阈值、每次判断一个请求以及逐条件概率记录。
8. Jev Social
让 Jev 在真实浏览器中研究 Instagram、TikTok 与 LinkedIn。
差异在哪
与直接调用 socai CLI 相比,Jev Social 在每次观测后由 Jev 从动态候选操作中决定下一步,并自动整理卡片、表格及证据报告;直接使用 socai 更适合已经知道确切平台与命令、只需执行单次搜索或读取操作的用户。Jev Social 明确不把任务转交给另一研究代理,也不依赖 socai research。
9. TypeSafe Evaluate
让 AI 客户端获得可供程序分支的类型化判断与概率。
差异在哪
相较于让通用语言模型生成自由文本后再解析,Evaluate 直接返回带概率的类型化判断,减少提示格式和解析逻辑,但把核心决策能力绑定到 Jev。接入可选择 TypeSafe API 或 OpenRouter Decisions:前者在两个密钥同时存在时优先,后者由 OpenRouter 账户计费,但其接口路径仍处于 alpha。
10. Jevbridge 决策桥
为现有大模型加入类型化决策、置信度门控与计算机操作选择。
差异在哪
与直接让生成式大模型同时负责文本生成和动作判断相比,Jevbridge 把判断结果限制为 noul、choice 和 score,并增加独立置信度门。原生 Jev 是首选后端;没有 TypeSafe 密钥时,可用 Codex、Claude、Grok、OpenCode 或通用 OpenAI 兼容模型充当 System One。启发式后端可以离线运行,但只适合测试,不应替代涉及安全的模型判断。
11. Jev 无人机
用机载相机、传统控制与低频判断模型完成仿真无人机自主避障。
差异在哪
仓库将 Jev 方案与禁用 Jev 后的贪心基线直接比较。基线只会朝更宽的一侧转向,三次都安全停在第二站,最远到 17.7 米且无碰撞;它无法表达“从低梁上方飞过”。报告中的单次 Jev 运行完成 77.5 米全程,目标可见率为 82%,安全反射占用时间为 9%,同样零碰撞。不过这不是种子匹配的统计结论,早期较简单场地的三种子对照没有显示 Jev 优势。
12. Distill 终端编程助手
在终端中读代码、改文件并执行命令,同时通过模型分层减少令牌消耗。
差异在哪
与只使用单个主模型的终端编程流程相比,Distill 可配置同会话 Worker,并让 Utility model 处理受限的提取、摘要和压缩任务。与完全依赖云端提供商的方案相比,它也支持本地 OpenAI 兼容服务器;但本地模型的部署、容量与上下文限制需要用户自行承担。