开发与工程 mcp-servertyped-decisionsprobability-scoringdecision-routingbatch-evaluationopenrouterstatic-binary

TypeSafe Evaluate

让 AI 客户端获得可供程序分支的类型化判断与概率。

FollowAgents 评估 · FARS-2.1
谨慎使用
70/ 100 五分制 3.5 / 5
1 2 3 4 5 6
按维度查看评分与理由
1信任安全16 / 29 · 2.8/5

README 清楚展示状态和问题会被发送到 TypeSafe API 或 OpenRouter,并披露安装、客户端配置、pi 扩展及自更新产生的写入;工具本身被描述为只读,因此最小权限和外部影响处理较好,但并非完整。用户必须主动运行 setup,然而没有远程评估逐次确认机制。密钥来自环境变量且优先级明确,但 setup 会携带所有 TYPESAFE_* 变量,材料未说明配置文件权限、日志脱敏、密钥轮换或服务端数据保留。依赖和 GitHub Actions 均固定版本,Actions 使用提交哈希,发布资产有 SHA-256 校验;未见漏洞扫描、SBOM 或依赖更新政策。没有卸载、配置恢复或更新回退说明。项目、TypeSafe 服务及许可证有明确署名,但发布者未经企业注册验证,且仓库维护者与服务运营方之间的责任关系未完全交代。

2可靠稳定9 / 14 · 3.2/5

README、模块清单和发布工作流在 Go 单二进制、发布资产及校验和流程上基本一致,但提供的材料不包含实现代码或测试结果,无法给予彻底一致性分数。直接和间接依赖均固定版本,发布平台和架构也有说明;同时运行依赖外部 TypeSafe/OpenRouter 服务,OpenRouter Decisions 端点明确处于 alpha 路径。材料说明了 429/529 指数退避、60 秒超时、16 MiB 上限、本地字段路径校验和可读 API 错误,但没有错误分类表、重试上限细节或恢复建议。

3适用触发15 / 18 · 4.2/5

目标用户、支持的 Claude Code、Claude Desktop、Codex 和 pi 客户端,以及紧急度、路由和评分场景均描述具体。能力边界较明确:只有一个 evaluate 工具、三种问题类型、结构化判断而非文本生成,并区分 MCP 与 pi 扩展。触发和提问指导有所描述,但关键客户端指导位于未提供的 CLAUDE.md,无法核验其精度。环境说明覆盖 macOS/Linux、amd64/arm64、PATH、Go 安装及多个客户端,不过没有 Windows 支持、代理配置或离线行为说明。

4规范维护13 / 18 · 3.6/5

README 按动机、快速开始、能力、参考和贡献组织,整体易读,但更详细规范被转交给未提供文件。安装、替代安装、注册、更新和 pi 重载步骤充分。命令与工具名总体稳定,但 evaluate 同时作为程序和工具名称,jev-latest 是可变别名,OpenRouter 路径也可能迁移。示例完整展示输入结构,但没有专门 FAQ 或更多边界案例。已披露只读性质、响应上限、超时、平台范围和 alpha 端点,尚未集中说明隐私、配额、网络故障及精度限制。MIT 正文完整且与元数据一致。Release Please 工作流和发布徽章证明存在版本发布机制,但未提供 changelog 内容。贡献入口和版权人可见,仍缺少明确维护团队、支持渠道、响应承诺及弃用政策。

5有效结果12 / 13 · 4.6/5

输出按调用方提供的标识返回结构化 JSON、类型化答案和概率,适合程序分支,批量问题也提升可用性。相较让通用模型生成并解析自由文本,其减少格式解析并提供置信概率的边际价值阐述具体。单一静态二进制、并行批处理和自动重试降低使用负担,但外部服务计费、延迟、配额、判断质量和数据传输成本未量化,因此成本收益不能给满分。

6证据核验5 / 8 · 3.1/5

部分主张可在不同材料间追踪:MIT 声明与许可证一致,Go 单二进制和依赖可由 go.mod 支撑,发布校验和与固定 Actions 可由工作流支撑。README 中关于运行时校验、重试、超时、响应限制、客户端注册和数据处理的主张缺少所提供实现代码或测试佐证。跨文件印证存在但有限,且没有独立来源。文档将问题、方案和已知 alpha 风险区分开来,但若干效果与安全表述仍是未经所给源码验证的产品主张。

证据充分度: 评估于 2026年9月20日 审查版本 d4c110c7edd8
源码中未见的安全控制:回滚或恢复路径
使用前请注意
  • 评估请求会把用户提供的 state 和 questions 发送给 TypeSafe 或 OpenRouter;在缺少数据保留、日志和隐私条款证据时,不应提交秘密、个人数据或受监管信息。
  • setup 会修改客户端配置,并携带所有 TYPESAFE_* 环境变量;运行前应检查变量范围、目标配置及生成文件的访问权限。
  • 未提供卸载、配置备份或回退流程;注册和自更新前应自行保存现有配置与二进制。
  • OpenRouter Decisions 使用可能迁移的 alpha 路径,且外部服务的可用性、费用、配额和输出质量均未由这些静态文件验证。
  • README 中多项运行时与安全主张无法由所给实现或测试文件交叉核验;本结论不代表执行测试或独立安全审计。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

TypeSafe Evaluate 是一个 Go 静态二进制文件及 MCP 服务器,把 TypeSafe 的 Jev 模型作为名为 `evaluate` 的只读工具提供给 Claude Code、Claude Desktop 和 Codex;pi 则通过随附扩展接入。它接收待判断的文本或 JSON 状态,以及一组 `noul`、`choice` 或 `score` 类型的问题。服务器通过 TypeSafe 的 `/v1/systemone` 接口或 OpenRouter 的 Decisions 接口发送请求,并返回保留问题 ID 的结构化 JSON 答案及概率。多个独立问题可在一次调用中提交并行处理,HTTP 429 和 529 会按指数退避重试。产品边界是本地运行的连接器加远程 Jev 推理服务:模型并不在本地执行,使用时需要 TypeSafe 或 OpenRouter 凭据及网络连接。

evaluate mcp 通过标准输入输出运行 MCP 服务器并暴露一个 evaluate 工具。工具读取 state 字段中的纯文本、JSON 对象或数组,再读取 questions 映射;每个问题包含 typeinstructions,并可按类型提供 criteria。它在本地拒绝格式错误的 criteria,并返回具体字段路径;有效请求会发送到 TypeSafe API 的 POST /v1/systemone,或在使用 OPENROUTER_API_KEY 时发送到 OpenRouter 的 POST /decisions。独立问题在一次请求中并行执行,结果以原问题 ID 组织为原始 JSON,供调用方根据概率、选项或有序评分直接分支。响应上限为 16 MiB,请求超时为 60 秒;429 和 529 会重试,其他 API 错误则作为工具错误返回给客户端。

  1. 客服自动化开发者需要根据工单正文同时判断紧急程度,并在 billing、technical、sales 等团队之间选择归属。
  2. 工作流工程师希望把自然语言状态转换为带概率的 yes/no 条件,避免解析模型生成的自由文本。
  3. Claude Code、Claude Desktop 或 Codex 用户需要在现有 MCP 工作流中加入类型化的路由或严重度判断。
  4. 使用 pi 的开发者需要同样的判断能力,但因 pi 没有 MCP 客户端而改用仓库提供的原生扩展。
  5. 应用开发者需要针对同一份状态批量提出多个相互独立的问题,并在一次调用中得到结构化答案。

这个 Agent 有哪些优点和局限?

优点
  • 输出包含概率的类型化 JSON,调用代码无需解析自由文本即可进行条件分支。
  • 同时支持 noulchoicescore 三种问题类型,并能在同一状态上批量并行处理多个独立问题。
  • evaluate setup mcp 可一次配置检测到的 Claude Code、Claude Desktop 和 Codex,另有专门的 pi 扩展。
  • 以无 Node.js 或 Python 运行时依赖的单一静态二进制交付,并提供校验和验证的原地升级。
  • 内置 429、529 指数退避重试、60 秒超时、16 MiB 响应限制以及本地 criteria 校验。
局限
  • 核心判断依赖 TypeSafe 的 Jev 模型;即使经 OpenRouter 调用,也没有文档证明可替换为其他模型。
  • 推理需要远程网络服务及 TypeSafe 或 OpenRouter API 密钥,不能从所给资料确认可离线或完全自托管。
  • 预构建安装仅明确支持 macOS、Linux 以及 amd64、arm64,未记录 Windows 支持。
  • OpenRouter Decisions 接口仍位于 /api/alpha/ 路径,资料明确提示该路径可能变更。
  • 单次请求有 60 秒超时和 16 MiB 响应上限,超出上限的结果会被拒绝而非截断。

如何安装或部署这个 Agent?

支持 macOS 和 Linux 的 amd64、arm64。安装预构建二进制:

curl -fsSL https://raw.githubusercontent.com/itsmostafa/typesafe-mcp/main/install.sh | sh

程序会安装到 ~/.local/bin。若该目录不在 PATH 中,运行:

export PATH="$HOME/.local/bin:$PATH"

也可在已安装 Go 的环境中运行:

go install github.com/itsmostafa/typesafe-mcp/cmd/evaluate@latest

https://console.typesafe.ai/ 获取密钥后,注册 MCP 客户端:

TYPESAFE_API_KEY=your-key evaluate setup mcp

若通过 OpenRouter 使用 ~typesafe/jev-latest,则运行:

OPENROUTER_API_KEY=your-key evaluate setup mcp

两种变量同时存在时优先使用 TYPESAFE_API_KEYevaluate setup mcp 会注册检测到的 Claude Code、Claude Desktop 和 Codex;升级可运行 evaluate update

如何使用这个 Agent?

完成注册后,让客户端调用 evaluate,例如使用以下参数判断工单是否紧急以及应由哪个团队处理:

{
"state": "Help! My payouts have been failing for 3 days.",
"questions": {
"is_urgent": {
"type": "noul",
"instructions": "Does this convey urgency?"
},
"department": {
"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {
"billing": "Payments, refunds",
"technical": "Bugs, outages",
"sales": "Pricing"
}
}
}
}

model 可省略,TypeSafe 路径默认使用 jev-latest,OpenRouter 路径默认使用 ~typesafe/jev-latest。pi 用户运行 evaluate setup pi,该命令写入 ~/.pi/agent/extensions/evaluate.ts;随后在 pi 中执行 /reload。pi 扩展从启动 pi 的 shell 读取密钥。

这个 Agent 与同类方案有什么区别?

相较于让通用语言模型生成自由文本后再解析,Evaluate 直接返回带概率的类型化判断,减少提示格式和解析逻辑,但把核心决策能力绑定到 Jev。接入可选择 TypeSafe API 或 OpenRouter Decisions:前者在两个密钥同时存在时优先,后者由 OpenRouter 账户计费,但其接口路径仍处于 alpha。

常见问题

是否必须使用 TypeSafe API 密钥?
不必须。可使用 TYPESAFE_API_KEY 直接访问 TypeSafe,也可使用 OPENROUTER_API_KEY 经 OpenRouter Decisions 接口访问 Jev;两者同时设置时 TypeSafe 密钥优先。
它会在本地运行 Jev 模型吗?
不会。仓库提供本地静态连接器和 MCP 服务器,判断请求发送到 TypeSafe API 或 OpenRouter,因而需要网络连接。
工具会修改被评估的数据或外部系统吗?
资料将 evaluate 描述为只读工具。它读取状态和问题、调用远程判断接口并返回 JSON;安装和 setup 命令会写入本地二进制、客户端配置或 pi 扩展。
遇到限流或服务错误时会怎样?
HTTP 429 和 529 会使用指数退避重试;其他 API 错误作为工具错误返回,供调用它的客户端读取和处理。
使用 OpenRouter 是否有额外风险?
OpenRouter Decisions 接口仍使用 /api/alpha/ 路径,文档提示它可能迁移;费用计入用户自己的 OpenRouter 账户。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents