AI 评测技能集
帮助编码代理为具体产品构建评测,减少常见评测错误。
- Star 数
- ★ 1.5k
- 最近更新
- 13 天前
- License
- Apache-2.0
- FA 评分
- 52/100 · 缺口较多
30 秒速览
- 运行形态
- 可在哪里用
- 通用 · 跨平台
- 上手难度
- 低 · 几分钟可跑通
- 开始前需要
- 典型场景
- 已有产品评测流水线、希望找出设置问题并按严重程度安排改进的工程团队。
- 不适合
- 需要直接运行托管评测服务的团队
- 只想做基础模型基准测试的团队
- 源码审查
- 52/100 · 缺口较多
这个 Agent 能做什么,适合哪些场景?
Eval Skills 是一组供 AI 编码代理使用的技能,面向产品特定的 AI 评测,而非基础模型基准测试。入口技能 `evals-start` 会根据现状将用户引导到合适的工作流程。已有评测流水线的团队可使用 `eval-audit` 检查设置并获取分级建议;已有 traces 但尚未分析的团队可用 `error-discovery` 进行错误分析。其他技能涵盖合成测试数据、代码检查、LLM-as-Judge、评估器校准、RAG 质量评估和人工审阅界面。错误发现流程可读取 JSONL、CSV 或 JSON 数据,生成由 Python 标准库服务器提供的单文件 HTML 审阅应用;部署和模型提供商支持范围未在说明中明确。
evals-start 根据用户的评测状况路由到相应技能。eval-audit 检查现有评测流水线并提出带优先级的改进建议;error-discovery 读取 LLM 输出或 traces 的 JSONL、CSV 或 JSON 文件,判断内容类型,设计可视化编码,聚类并抽取多样样本,再生成由 Python 标准库服务器提供的单文件 HTML 审阅应用。用户可在应用中留下自由文本注释,代理据此整理失败模式、跟踪覆盖情况并建议后续样本。其余技能分别生成合成输入、编写客观代码检查、设计主观评估器提示、用数据切分及 TPR/TNR 和偏差校正校准评估器、评估 RAG 检索与生成质量,以及构建人工 trace 标注界面。
- 已有产品评测流水线、希望找出设置问题并按严重程度安排改进的工程团队。
- 积累了 LLM 输出或 agent traces、需要先发现失败模式再编写评测的产品团队。
- 需要按多个维度组合生成多样合成测试输入的评测工程师。
- 希望将明确的失败条件实现为代码检查的开发者。
- 需要为主观质量标准设计 LLM-as-Judge 提示并用人工标签校准的评测团队。
- 需要分别检查 RAG 检索质量和生成质量,或为 trace 审阅构建标注界面的团队。
如何安装或部署这个 Agent?
README 通过 npx skills 安装技能集,并展示了安装全部技能和只安装 error-discovery 的命令。使用该安装方式需要可运行 npx 的环境;README 未说明具体 Node.js 版本、模型凭据要求或各编码代理的适配范围。
如何使用这个 Agent?
安装后,将数据集交给支持这些技能的 AI 编码代理,并请求进行错误分析。README 给出的首个任务示例为:
这个 Agent 有哪些优点和局限?
- 从
evals-start入口按现状路由,区分已有评测流水线和待分析 traces 的工作流。 error-discovery覆盖抽样、聚类、人工注释、失败模式归纳和后续样本建议的分析循环。- 技能覆盖代码检查、LLM-as-Judge 校准和 RAG 评估等不同评测任务。
- 错误发现流程使用单文件 HTML 审阅应用和 Python 标准库服务器,README 明确说明无需额外依赖。
- 这是供 AI 编码代理使用的技能集,不是独立托管评测服务;具体代理产品的兼容性未说明。
- README 未注明模型提供商、凭据、费用或网络数据处理要求。
- Python 标准库服务器只在错误发现流程中有说明,其他技能的运行时和部署方式未详述。
- 除安装与更新命令外,README 未给出逐项技能的完整参数、配置或输出格式。
这个 Agent 与同类方案有什么区别?
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | 形态 / 费用 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|---|
| AI 评测技能集 当前 | 52 · 缺口较多 | Agent 插件 / 技能 | ★ 1.5k | 13 天前 | — | — |
| Giskard | 47 · 缺口较多 | 代码库 / SDK免费 + 模型费 | ★ 5.9k | 1 天前 | Python | OpenAI API · Claude API |
| Oumi 端到端基础模型平台 | 58 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 9.4k | 今天 | Python | Claude Code · OpenAI API |
| Voice Lab | 27 · 缺口较多 | 命令行工具免费 + 模型费 | ★ 175 | 1 年前 | Python | OpenAI API |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
README说明 error-discovery 会读取 JSONL/CSV/JSON 数据、构建本地 HTML 审阅应用并通过 Python 标准库服务器提供,但没有交代权限边界或数据存储、传输细节;因此最小权限和敏感数据处理仅部分覆盖。没有明确的确认机制、外部副作用说明或回滚指引。README 提及课程与相关材料,但发布者身份未验证,也没有明确维护责任人,故来源归属有限。
README 对技能入口、常见路径和所述工作流的描述基本一致;其提到本地审阅应用不依赖额外运行时依赖,但安装仍依赖 npx。未提供错误处理或故障提示说明,无法给失败消息能力分。
材料面向已有 eval pipeline、待分析 traces、合成数据、代码评估、judge prompt、RAG 和人工审阅等场景,也区分产品评估与基础模型基准。evals-start 被描述为路由入口,但具体触发规则在所给材料中不完整。环境说明主要是 npx 与 Python 标准库,兼容性细节有限。
README 有清晰的技能目录、用途表和安装/更新命令,并提供 error-discovery 示例;名称可辨认,但没有 FAQ、完整限制说明或变更记录。LICENSE 文件提供 Apache 2.0 条款。更新命令存在,但未说明维护责任人或维护流程。
文档描述了从样本抽取、聚类、标注到归纳 failure modes 的可用工作流,且声称本地审阅应用无额外依赖,显示出实际价值。扣分原因是具体输出、适用边界和节省成本的证据较少,主要是 README 中的功能陈述。
README 对技能用途和工作流给出具体陈述并提供指向技能文件的相对链接,但本次材料没有包含这些技能文件,也没有独立佐证。可将文档中明确写出的内容与其未展示的实现区分开;由于证据来源少,交叉核验能力有限。
- 所给材料仅包含 README 和 LICENSE,具体技能指令未提供;数据处理、确认步骤与错误处理细节因此无法核实。
- README 描述会分析用户提供的 traces 并生成审阅界面;处理敏感或受监管数据前,应先检查实际技能指令及其数据流。
常见问题
它能用于基础模型基准测试吗?
我应该先运行哪项技能?
evals-start 开始;它会根据现状路由。如果已有评测流水线,可使用 eval-audit;如果有 traces 但尚未分析,可使用 error-discovery。