AI 评测技能集

帮助编码代理为具体产品构建评测,减少常见评测错误。

Star 数
★ 1.5k
最近更新
13 天前
License
Apache-2.0

30 秒速览

运行形态
Agent 插件 / 技能
可在哪里用
通用 · 跨平台
上手难度
低 · 几分钟可跑通
开始前需要
npx skillsPython 标准库Shell / 命令行网络访问本地文件系统
典型场景
已有产品评测流水线、希望找出设置问题并按严重程度安排改进的工程团队。
不适合
  • 需要直接运行托管评测服务的团队
  • 只想做基础模型基准测试的团队

这个 Agent 能做什么,适合哪些场景?

Eval Skills 是一组供 AI 编码代理使用的技能,面向产品特定的 AI 评测,而非基础模型基准测试。入口技能 `evals-start` 会根据现状将用户引导到合适的工作流程。已有评测流水线的团队可使用 `eval-audit` 检查设置并获取分级建议;已有 traces 但尚未分析的团队可用 `error-discovery` 进行错误分析。其他技能涵盖合成测试数据、代码检查、LLM-as-Judge、评估器校准、RAG 质量评估和人工审阅界面。错误发现流程可读取 JSONL、CSV 或 JSON 数据,生成由 Python 标准库服务器提供的单文件 HTML 审阅应用;部署和模型提供商支持范围未在说明中明确。

evals-start 根据用户的评测状况路由到相应技能。eval-audit 检查现有评测流水线并提出带优先级的改进建议;error-discovery 读取 LLM 输出或 traces 的 JSONL、CSV 或 JSON 文件,判断内容类型,设计可视化编码,聚类并抽取多样样本,再生成由 Python 标准库服务器提供的单文件 HTML 审阅应用。用户可在应用中留下自由文本注释,代理据此整理失败模式、跟踪覆盖情况并建议后续样本。其余技能分别生成合成输入、编写客观代码检查、设计主观评估器提示、用数据切分及 TPR/TNR 和偏差校正校准评估器、评估 RAG 检索与生成质量,以及构建人工 trace 标注界面。

  1. 已有产品评测流水线、希望找出设置问题并按严重程度安排改进的工程团队。
  2. 积累了 LLM 输出或 agent traces、需要先发现失败模式再编写评测的产品团队。
  3. 需要按多个维度组合生成多样合成测试输入的评测工程师。
  4. 希望将明确的失败条件实现为代码检查的开发者。
  5. 需要为主观质量标准设计 LLM-as-Judge 提示并用人工标签校准的评测团队。
  6. 需要分别检查 RAG 检索质量和生成质量,或为 trace 审阅构建标注界面的团队。

如何安装或部署这个 Agent?

README 通过 npx skills 安装技能集,并展示了安装全部技能和只安装 error-discovery 的命令。使用该安装方式需要可运行 npx 的环境;README 未说明具体 Node.js 版本、模型凭据要求或各编码代理的适配范围。

如何使用这个 Agent?

安装后,将数据集交给支持这些技能的 AI 编码代理,并请求进行错误分析。README 给出的首个任务示例为:

这个 Agent 有哪些优点和局限?

优点
  • 从 evals-start 入口按现状路由,区分已有评测流水线和待分析 traces 的工作流。
  • error-discovery 覆盖抽样、聚类、人工注释、失败模式归纳和后续样本建议的分析循环。
  • 技能覆盖代码检查、LLM-as-Judge 校准和 RAG 评估等不同评测任务。
  • 错误发现流程使用单文件 HTML 审阅应用和 Python 标准库服务器,README 明确说明无需额外依赖。
局限
  • 这是供 AI 编码代理使用的技能集,不是独立托管评测服务;具体代理产品的兼容性未说明。
  • README 未注明模型提供商、凭据、费用或网络数据处理要求。
  • Python 标准库服务器只在错误发现流程中有说明,其他技能的运行时和部署方式未详述。
  • 除安装与更新命令外,README 未给出逐项技能的完整参数、配置或输出格式。

这个 Agent 与同类方案有什么区别?

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 形态 / 费用 Star 最近更新 主语言 完整支持的平台
AI 评测技能集 当前 52 · 缺口较多 Agent 插件 / 技能 ★ 1.5k 13 天前 — —
Giskard 47 · 缺口较多 代码库 / SDK免费 + 模型费 ★ 5.9k 1 天前 Python OpenAI API · Claude API
Oumi 端到端基础模型平台 58 · 缺口较多 命令行工具免费 + 模型费 ★ 9.4k 今天 Python Claude Code · OpenAI API
Voice Lab 27 · 缺口较多 命令行工具免费 + 模型费 ★ 175 1 年前 Python OpenAI API

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
52/ 100 五分制 2.6 / 5
信任安全 12/29
可靠稳定 6/14
适用触发 10/18
规范维护 11/18
有效结果 9/13
证据核验 4/8
查看各维度的扣分理由
信任安全12 / 29 · 2.1/5

README说明 error-discovery 会读取 JSONL/CSV/JSON 数据、构建本地 HTML 审阅应用并通过 Python 标准库服务器提供,但没有交代权限边界或数据存储、传输细节;因此最小权限和敏感数据处理仅部分覆盖。没有明确的确认机制、外部副作用说明或回滚指引。README 提及课程与相关材料,但发布者身份未验证,也没有明确维护责任人,故来源归属有限。

可靠稳定6 / 14 · 2.1/5

README 对技能入口、常见路径和所述工作流的描述基本一致;其提到本地审阅应用不依赖额外运行时依赖,但安装仍依赖 npx。未提供错误处理或故障提示说明,无法给失败消息能力分。

适用触发10 / 18 · 2.8/5

材料面向已有 eval pipeline、待分析 traces、合成数据、代码评估、judge prompt、RAG 和人工审阅等场景,也区分产品评估与基础模型基准。evals-start 被描述为路由入口,但具体触发规则在所给材料中不完整。环境说明主要是 npx 与 Python 标准库,兼容性细节有限。

规范维护11 / 18 · 3.1/5

README 有清晰的技能目录、用途表和安装/更新命令,并提供 error-discovery 示例;名称可辨认,但没有 FAQ、完整限制说明或变更记录。LICENSE 文件提供 Apache 2.0 条款。更新命令存在,但未说明维护责任人或维护流程。

有效结果9 / 13 · 3.5/5

文档描述了从样本抽取、聚类、标注到归纳 failure modes 的可用工作流,且声称本地审阅应用无额外依赖,显示出实际价值。扣分原因是具体输出、适用边界和节省成本的证据较少,主要是 README 中的功能陈述。

证据核验4 / 8 · 2.5/5

README 对技能用途和工作流给出具体陈述并提供指向技能文件的相对链接,但本次材料没有包含这些技能文件,也没有独立佐证。可将文档中明确写出的内容与其未展示的实现区分开;由于证据来源少,交叉核验能力有限。

风险与缓解建议
  • 所给材料仅包含 README 和 LICENSE,具体技能指令未提供;数据处理、确认步骤与错误处理细节因此无法核实。
  • README 描述会分析用户提供的 traces 并生成审阅界面;处理敏感或受监管数据前,应先检查实际技能指令及其数据流。
证据充分度:低 评估于 2026年10月8日 审查版本 80d5f7b0127c
评估证据 README.mdLICENSE
查看完整评分方法 →

常见问题

它能用于基础模型基准测试吗?
README 将其范围明确限定为产品特定 AI 评测,并说明这不是基础模型基准测试。
我应该先运行哪项技能?
从 evals-start 开始;它会根据现状路由。如果已有评测流水线,可使用 eval-audit;如果有 traces 但尚未分析,可使用 error-discovery。
错误发现支持哪些输入数据?
README 指出可处理 JSONL、CSV 或 JSON 文件中的 LLM 输出或 traces,并会判断内容类型。
审阅界面需要安装额外依赖吗?
README 说明错误发现会构建由 Python 标准库服务器提供的单文件 HTML 审阅应用,无需依赖;未列出其他技能的运行时要求。
使用是否需要付费模型或 API 密钥?
README 未说明模型提供商、API 密钥或费用,无法据此判断。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents