专题指南

Jev 是什么:TypeSafe AI 的 System One 模型

Jev 是一个不生成文字、而是返回带置信度的类型化决策的模型。这一页用最短的篇幅讲清它是什么、怎么调用、能做什么和不能做什么、发布时的数字该怎么看,以及已经有哪些 agent 建在它之上。

最近更新2026 年 9 月 21 日

先看结论

  • Jev 是 TypeSafe AI 提出的 “System One 模型” 品类里的第一个模型,2026 年 9 月 15 日发布,目前处于早期访问阶段。
  • 你给它一段状态和一组带类型的问题,它对每个问题返回一个答案:答案必须来自你事先声明的选项,并附带概率。它不写任何文字。
  • TypeSafe 公布的数据是端到端延迟 70–500 毫秒、输入每百万 token 0.042 美元、输出免费。这些都是厂商自己的数据,写作时还没有大规模的独立复现。
  • 它适合快速、重复、答案范围有限的决策:路由、分类、安全闸门、校验、实时循环。不适合聊天、写代码、写文章、算术,以及任何需要解释理由的场景。
  • 放进 agent 里,最合适的用法是当作快速决策层,把没把握的情况交给更慢的模型或真人。

Jev 是什么

Jev 来自 TypeSafe AI,一家由前 OpenAI 研究员 Diogo Almeida 联合创立的创业公司。它不是一个 token 接一个 token 地预测,而是并行处理一次请求里的所有问题,每个问题输出一个值。这个值来自调用方事先声明好的选项,并带一个概率。

TypeSafe 把这类模型叫做 System One 模型,借用了卡尼曼“快思考 / 慢思考”里快思考的那一半。这个品类名是 TypeSafe 自己起的,并非行业标准。Jev 这个名字取自经济学家杰文斯:赌的是模型调用便宜很多之后,人们会调用得多得多。

怎么调用

Jev 通过 HTTP API 调用(向 api.typesafe.ai 的 System One 端点发 POST),另有 Python 和 JavaScript SDK。一次请求包含三样东西:模型名、`state`(要判断的文字或结构化数据)和一组命名的 `questions`。响应按问题名返回答案,并附带 token 用量。

TypeSafe 的文档里有三种问题类型,每个答案都属于其中之一:

  • noul:是非题,答案是一个概率。
  • choice:从你命名的一组选项里选一个,每个选项写一句描述。TypeSafe 表示最多支持 255 个选项。答案是选中的选项和它的概率。
  • score:在你逐级描述的有序刻度上给输入定位,比如严重程度 0 到 3 级。

下面的请求只是为了说明结构,并非照抄 TypeSafe 文档。早期访问阶段字段名可能变化,动手之前请以官方最新文档为准。

{
  "model": "jev-latest",
  "state": "Customer message: I was charged twice for my plan this month, please fix it today.",
  "questions": {
    "wants_refund": {
      "type": "noul",
      "instructions": "Does the customer ask for money back?"
    },
    "team": {
      "type": "choice",
      "instructions": "Which team should handle this message?",
      "criteria": {
        "billing": "Charges, invoices, refunds",
        "support": "Bugs, outages, how-to questions",
        "sales": "Plans, pricing, upgrades"
      }
    },
    "urgency": {
      "type": "score",
      "instructions": "How urgent is this message?",
      "criteria": ["Can wait", "Needs a reply today", "Blocking the customer now"]
    }
  }
}

适合做什么

共同点是:决策经常发生、可能的答案是已知的一组、并且要求又快又便宜。TypeSafe 和早期的评测文章提到的用法有:

  • 路由与分类:交给哪个团队、哪个处理器,属于哪一类,优先级多高。
  • 安全闸门:在 agent 执行之前,把一条 shell 命令或工具调用判成只读、可回滚或破坏性。
  • 校验:检查 LLM 回答里的说法有没有原文依据,或者一次改动的风险有多大。
  • 实时循环:游戏逻辑、仿真和机器人这些慢模型跟不上的场合。目前公开的演示都跑在模拟器里,包括 Doom。
  • 批量打标:给海量数据打分或打标签,这时单次调用的成本决定这件事值不值得做。

不能做什么

这些限制来自它的工作方式,其中大部分 TypeSafe 自己也明确说了:

  • 不能生成文字:没有回复、摘要、解释,也没有代码。
  • 不能回答开放式问题。每个答案都必须是你声明过的选项,所以你得事先知道答案空间。
  • 不给推理过程。决策没有理由说明,如果你在受监管的场合需要审计线索,这一点很关键。
  • 目前的演示用的是结构化或文本状态,不是图片。有一篇独立评测文章还列出它在算术和日期比较上有弱点,依赖之前请先自己测试。
  • 它能否推广到短时程、结构清晰的决策之外,目前还没有定论。

这些数字该怎么看

最醒目的数字都是 TypeSafe 自己给的:端到端 70–500 毫秒,而前沿 LLM 在类似任务上要几秒到几分钟;输入每百万 token 0.042 美元(约每十亿 42 美元),输出免费。发布文章声称,在它测试的工作流上,同等智能水平下速度快 40–200 倍,而每个 token 的价格也远低于前沿 LLM。

TypeSafe 自己补充了三点保留意见。评测工作流是它自己的模型团队设计的,可能有偏差;用来对比的 LLM 数据来自 OpenRouter,它说这一侧同样可能有偏差;而它标出的 0% 幻觉率,它自己说“并非实测”:这是结构性的说法,因为输出被限制在你给的选项里,但一个看起来合法的选项仍然可能是错的。

所以请把这些倍数当作上限。对你有意义的数字,是在你自己数据上每“正确解决一个任务”的成本,这只能靠测试得出。

价格与获取方式

截至 2026 年 9 月 21 日,Jev 处于早期访问,需要排队等候名单。输入按每百万 token 0.042 美元计费,输出免费,价格和限额在开放访问的过程中可能变化。

除模型之外,TypeSafe 还提供 Python 和 JavaScript SDK,以及一个 Claude Code 插件;LangChain 发布了一个 alpha 阶段的集成包 `langchain-typesafe`。

在 agent 里安全地用 Jev

最贴合 Jev 长处的模式,是前面放一层快的、后面放一层慢的:Jev 负责频繁的小决策,它拿不准的交给更强的模型或真人。

  • 先跑影子模式:让 Jev 给真实流量打标,同时仍由真人或现有逻辑做决定,再对比结果。
  • 用你自己的标注数据来定置信度阈值。文章里常见的示例值(高于 0.9 自动执行、0.5 到 0.9 请求确认、更低则交给真人)只是举例,不是默认值。
  • 已经正确的确定性代码就保留。永远正确的规则不需要模型。
  • 每个决策都必须给出解释的场景不要用它,除非另有东西来产生解释。
  • 凡是有风险的操作都要失败即关闭:调用失败或置信度低时,就走原来那条安全的路径。

Jev 与 LLM 一图对照

  • 输出:Jev 返回你声明的选项里的类型化值;LLM 返回可能还得解析的生成文本。
  • 速度与成本:按 TypeSafe 的说法,Jev 每个决策快得多也便宜得多;LLM 更慢更贵,但通用得多。
  • 置信度:Jev 被训练成给出校准的概率;LLM 自述的把握往往不可靠。
  • 解释:LLM 能解释自己;Jev 不能。
  • 范围:LLM 能处理开放式任务;Jev 只处理答案空间固定的问题。
  • 配合:Jev 负责判断、分类和路由,LLM 负责剩下困难或开放的部分。

已经建在 Jev 上的 agent 与工具

发布后的几天里,就陆续出现了建在 Jev 上的开源项目:把它当决策层的编码 agent 外壳、把它暴露给 Claude Code 和 Codex 的 MCP 服务器、给工具调用加的权限闸门、浏览器自动化等等。通过我们收录规则的项目,会用和其他 agent 一样的 FARS 方法评审,下面的导览会随新收录的项目自动更新。

也有一些 Jev 项目不在目录里,原因是没有通过 agent 的结构性规则,或者规模太小。这是规则使然,并不代表它们不好。