一套不把热度当质量的 Agent 评估方法
FARS 将可观察事实、可复现测试与编辑判断分开记录。总分帮助排序,维度分解释原因,证据充分度告诉你这个结论有多稳。
五条基本原则
证据优先
Star、未经验证的声誉和文档精美度只能作为线索。可验证的大厂官方来源属于治理证据,但不能替代代码、权限与任务复测。
风险不做平均
恶意行为、隐蔽数据外传、默认破坏性操作等红线不会被其他维度的高分抵消;信任与安全维度还须单独达标,弱安全不能被其他高分掩盖。
推荐不超过证据
推荐强度受证据充分度约束:静态或有限证据最多到「谨慎使用」,「推荐」需部分运行复测,「高度推荐」需完整复现与交叉验证。
未知就是未知
资料或测试不足时标记“证据不足”,不把缺失信息自动算成安全,也不制造精确分数。
评分有时效
分数对应被评估的版本与日期;仓库、依赖或平台发生重大变化后需要重新评估。
大厂官方发布如何影响评分
OpenAI、Anthropic、Microsoft、Google 等可验证官方组织能增强归属、维护责任与更新路径的可信度,只作为信任与安全、规范与可维护中的来源证据,不设固定品牌加分。它不能推导出 Agent 一定可靠、安全或实用,也不能覆盖红线。未验证或个人发布同样不会自动扣分。
六个评分维度(TRACE + V),共 100 分
六个维度构成一条链路:信任解决「能不能放心用」,可靠解决「能不能稳定用」,适用解决「该不该在这个场景用」,规范解决「能不能被理解和复用」,有效回到「问题是否真的被解决」,证据回答「以上结论有多少支撑」。每一维均按 0、约半分、满分三个锚点校准,评估者必须写下扣分依据;信任与安全权重最高。
01T · 信任与安全25
最小权限、用户确认、数据流透明度、敏感信息处理、依赖安全、外部影响、回滚能力,以及来源归属的可核验性。
- 0:存在未消除的红线风险、刻意隐瞒或严重越权
- 12:主要风险可见,但权限、确认、隔离或恢复措施不完整
- 25:最小权限、明确确认、可回滚、数据流披露和来源归属均完整
02R · 可靠与稳定20
指令与脚本自洽、依赖可用、关键路径可复现、行为确定,以及异常输入下的失败反馈质量——失败时说明原因,而不是把调试成本转移给用户。
- 0:明显失效、矛盾或无法在声明环境运行
- 10:主流程可用,但测试、边界、错误处理或失败反馈不足
- 20:关键流程经复测,失败模式清楚、可诊断且可控
03A · 适用与触发15
目标用户与场景是否清晰、能力边界与不适用范围是否明确、Agent 语义调用的触发精度,以及运行环境适配(含中文语境与国内网络可用性)。
- 0:适用范围模糊、与实际能力不符或目标环境基本不可用
- 7:有清晰场景,但边界、触发条件或环境适配证据有限
- 15:适用输入、输出预期、不适用边界和触发条件均清楚
04C · 规范与可维护15
信息架构与渐进式披露、安装与依赖说明、参数与命名稳定性、示例与限制披露、许可、版本与变更记录、维护责任和更新路径。
- 0:名称描述与实际能力对不上,或来源、许可不清、明显失维护
- 7:基本可读可用,但隐含前提、排错障碍或治理信息较多缺口
- 15:文档层次分明、示例与限制充分,归属、许可、版本、变更均清楚
05E · 有效与结果15
结果正确性与完整性、输出是否符合预期格式并可直接使用、相对自行完成或替代方案的边际价值,以及成本与收益是否相称。
- 0:价值主张无法证实,或输出仍需大量返工、边际价值接近零
- 7:能完成核心任务,但完整度、可直接使用度或相对收益证据有限
- 15:目标、收益、替代方案对比清楚,代表性输出经复测可直接使用
06V · 证据与可验证10
关键主张的可追溯性、测试可复现性、跨来源互证和事实/推断分离;前五个维度的关键结论都应能在证据链接中找到出处。
- 0:只有作者主张、营销文本或无法核验的演示
- 5:有可审计的一手材料或有限复测,但覆盖范围不足
- 10:多类证据互证,独立评估者可重现关键结论
总分如何解读
高度推荐
证据充分且没有未控制的重大风险;仍需核对你的环境与数据敏感度。
推荐
整体可靠,存在已披露的局限;按说明试用并保留回滚路径。
谨慎使用
价值存在,但可靠性、证据或控制措施仍有明显缺口。
不推荐
当前收益不足以覆盖风险或不确定性。
以上区间只是分数的初判。最终推荐等级还要过两道门槛:① 证据上限——证据充分度为「低」最高只到「谨慎使用」,「中」最高「推荐」,「高」才可「高度推荐」;② 安全门槛——「推荐」要求信任与安全 ≥15/25,「高度推荐」要求 ≥20/25。任一未过即相应下调,详情页会标明下调原因。总分本身不变,被约束的是对外的推荐结论。
分数旁边为什么还有“证据充分度”
同样是 82 分,完整复测与只读文档所得结论不应被同等信赖。充分度描述本次评审覆盖了多少(与「V·证据与可验证」维度评价 Agent 自身是否可核验不同);它不抬高总分,但会为推荐等级设置上限。
检查了 agent 内容和关键脚本,关键路径可复现,并有至少一种独立或跨来源证据。
检查了一手材料并完成部分复测,但平台、边界情况或第三方证据覆盖不全。
主要依赖静态检查、作者材料或有限演示;适合发现线索,不适合做高风险决策。
证据阶梯
我们优先采用更接近实际行为、也更容易独立复核的证据。多种证据互证比单一来源更可靠。
可复现行为
隔离环境中的任务复测、安全测试、失败与回滚验证。
可审计的一手材料
AGENTS.md、脚本、依赖清单、提交记录、发行说明与许可证。
独立使用证据
可核验的问题报告、第三方复测、维护者对缺陷的响应。
弱信号
README 声明、演示、Star、下载量和社交讨论,只用于辅助判断。
红线与覆盖规则
出现下列任一项且无法合理消除时,状态直接标为“不推荐 / 已阻断”,无论数字总分多高:
- 恶意代码、凭据窃取、隐蔽追踪或未披露的数据外传;
- 默认执行不可逆或高影响操作,且没有明确确认、范围限制与恢复方案;
- 伪造来源、测试结果、兼容性或安全声明;
- 依赖已知严重漏洞且没有可行缓解,或要求与任务明显不相称的权限。
一次评估如何完成
界定主张
确认目标用户、核心任务、声明的平台、输入输出和权限边界。
收集证据
固定仓库版本,阅读 agent、脚本与依赖,记录证据链接和未知项。
风险筛查
优先检查数据流、外部写入、命令执行、密钥处理、权限与红线。
任务复测
在隔离环境跑代表性主流程、一个失败场景,并验证退出或回滚。
独立评分
按锚点逐维打分、记录扣分原因,再计算总分和证据充分度。
发布与复核
由第二评估者复核安全分、红线和证据充分度;公开版本、日期、维度分与风险。
这个分数不代表什么
FARS 不是安全认证、学术同行评审或效果保证。它是对特定版本、特定测试范围内证据的结构化判断。高分不意味着适合所有用户,低风险场景的选择也可能与企业生产环境不同。最终采用前,请结合权限、数据敏感度、成本与可回滚性做自己的判断。
标准如何演进
版本号随评分维度、权重或覆盖规则的实质变化而更新。文字澄清记录为小修订。我们保留历史版本,使旧评分可解释;新版本发布后,旧评分会明确标记并进入复核队列。