数据与分析 llm-evaluationbenchmarkingdefect-analysischinese-languageagent-tool-callingleaderboard

ReLE中文大模型能力评测与缺陷库

持续更新的中文AI大模型能力评测,覆盖7大领域300+细分维度,提供排行榜和超200万缺陷样本库。

FollowAgents 评估 · FARS-2.1
不推荐
14/ 100 五分制 0.7 / 5
1 2 3 4 5 6
1信任安全0 / 29 · 0.0/5

证据显示仓库仅提供评测数据和排行榜,未包含任何代码或可执行组件,因此不存在权限、用户确认、数据流、敏感数据处理、依赖安全、外部影响、回滚或来源归属等信任相关机制。所有信任标准均得0分,因为没有证据表明存在这些机制。

2可靠稳定2 / 14 · 0.7/5

自一致性:仓库内部结构一致,README中列出的排行榜文件与目录结构相符,但未提供任何测试或验证数据,因此仅得1分。依赖可用性:未提及任何依赖,得0分。失败消息:未提供任何错误处理或失败消息,得0分。

3适用触发4 / 18 · 1.1/5

受众与场景:明确面向中文AI大模型评测,覆盖多学科教育场景,得2分。能力边界:仅说明评测范围,未明确模型能力边界,得1分。触发精度:未提供任何触发机制,得0分。环境适配:未说明运行环境或平台,得0分。

4规范维护3 / 18 · 0.8/5

信息架构:目录结构清晰,有分类和链接,得2分。安装说明:无安装说明,得0分。命名稳定性:排行榜文件命名一致,但未说明版本稳定性,得1分。示例与FAQ:提供示例图片和链接,但无FAQ,得1分。已知限制:未提及,得0分。许可证:未提供,得0分。版本与变更日志:无,得0分。维护责任:未说明,得0分。

5有效结果4 / 13 · 1.5/5

输出可用性:提供排行榜和缺陷库,但格式未明确,得1分。边际价值:提供大规模缺陷库和排行榜,对社区有参考价值,得2分。成本效益:未提供任何成本或效益分析,得0分。

6证据核验1 / 8 · 0.6/5

声明可追溯性:排行榜数据有链接,但未提供原始数据或方法,得1分。跨源佐证:未提供其他来源验证,得0分。事实与推断分离:未区分事实和推断,得0分。

证据充分度: 评估于 2026年8月9日 审查版本 cbb2352346cb
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 仓库仅提供评测数据和排行榜,未包含任何代码或可执行组件,无法验证其评测方法的准确性和公正性。
  • 未提供许可证信息,使用和分发存在法律风险。
  • 未提供数据来源和评测方法,排行榜的可信度有限。
评估证据 [1]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

ReLE(Really Reliable Live Evaluation for LLM)是NoneLinear团队维护的中文大模型能力评测项目,原名CLiB。项目已评测395个大模型,涵盖GPT、Gemini、Claude、文心、Qwen、DeepSeek等商用与开源模型,提供综合能力、推理、教育、医疗、金融、法律、Agent工具调用等7大领域排行榜。同时提供规模超200万的缺陷库(badcase),支持按维度浏览分析。项目还提供大模型统一网关,聚合多家供应商API,实现智能负载均衡和自动故障切换。对于私有模型,团队提供免费评测服务,并支持用户上传专属测试数据实现模型选型降本。

ReLE执行端到端的大模型评测流程:1)从GitHub仓库的leaderboard目录获取各模型在300+维度上的准确率、耗时、token消耗等指标;2)通过badcase链接展示各维度失败案例;3)提供在线评测服务,支持用户上传数据并自定义筛选排行榜(nonelinear.com/static/benchmarking.html);4)集成大模型统一网关(api.nonelinear.com/v1),通过OpenAI兼容SDK调用模型,实现负载均衡和故障切换;5)提供模型选型工具,基于用户专属测试数据对比模型效果与成本,目标降本90%。项目还整合了LMArena和Artificial Analysis的英文评测数据,便于跨语言比较。

  1. 大模型选型者:在综合、教育、医疗等榜单中对比模型,选择适合自身场景的模型
  2. 模型开发者:利用超200万缺陷库分析模型弱点,定位改进方向
  3. 研究人员:参考ReLE技术报告,进行中文大模型能力各向异性研究
  4. 企业用户:通过统一网关调用多模型,享受智能负载均衡与高可用保障
  5. 需要降本的企业:上传专属测试数据,利用模型选型工具找出性价比最高的方案

这个 Agent 有哪些优点和局限?

优点
  • 覆盖模型数量多(395个),且持续更新(周更)
  • 评测维度细化,涵盖7大领域300+细分,如牙科、高中语文等专业考试
  • 提供超200万缺陷库,便于深度分析模型弱点
  • 具有在线评测和模型选型工具,支持降低90%成本
  • 整合国际榜单(LMArena、AA),便于中英文对比
局限
  • 商业化平台依赖,评测结果和网关服务关联非线智能官网
  • 评测方法未完全透明,未开源具体评测代码或标准答案
  • 部分领域标注TODO(如中考、初中奥数),覆盖不完整
  • 模型调用和选型服务需付费,价格不透明
  • 数据规模巨但可能仅限研究报告,社区利用需许可

如何安装或部署这个 Agent?

项目以GitHub仓库形式提供,无需安装客户端。使用在线服务需注册并获取API密钥:在nonelinear.com获取API key,然后通过OpenAI SDK调用统一网关。

如何使用这个 Agent?

1)访问仓库查看排行榜:如leaderboard/总分.md、leaderboard/教育.md等;2)通过badcase链接查看具体错误案例;3)使用在线评测:访问nonelinear.com/static/benchmarking.html自定义筛选榜单或上传数据;4)调用API:使用OpenAI SDK,设置base_url为https://api.nonelinear.com/v1,认证后调用模型;5)使用模型选型工具:上传专属测试数据,获取推荐模型。

这个 Agent 与同类方案有什么区别?

与LM Arena相比,ReLE专注于中文能力和专业领域(如医疗考试),提供更细分的维度;与OpenCompass相比,ReLE更侧重商业化服务与缺陷库;与SuperCLUE类似,ReLE也是中文评测,但ReLE提供更多模型和更细的维度,并集成了统一网关。

常见问题

ReLE评测的费用如何?
排行榜公开免费查看,但调用API或使用模型选型工具需注册并可能付费,具体价格见nonelinear.com/static/models.html。
如何获得缺陷库的访问权限?
缺陷库通过badcase链接公开访问,无需特殊权限,但大规模下载可能需联系团队。
评测结果多久更新一次?
项目几乎每周更新(如v5.10.17版本更新),但具体节奏随模型发布而定。
ReLE评测能覆盖英文模型吗?
评测主要面向中文场景,但整合了英文榜单(LMArena)供参考。
是否支持私有模型评测?
是,团队提供免费评测服务,需联系微信获取帮助。

相关 Agents