ReLE中文大模型能力评测与缺陷库
持续更新的中文AI大模型能力评测,覆盖7大领域300+细分维度,提供排行榜和超200万缺陷样本库。
证据显示仓库仅提供评测数据和排行榜,未包含任何代码或可执行组件,因此不存在权限、用户确认、数据流、敏感数据处理、依赖安全、外部影响、回滚或来源归属等信任相关机制。所有信任标准均得0分,因为没有证据表明存在这些机制。
自一致性:仓库内部结构一致,README中列出的排行榜文件与目录结构相符,但未提供任何测试或验证数据,因此仅得1分。依赖可用性:未提及任何依赖,得0分。失败消息:未提供任何错误处理或失败消息,得0分。
受众与场景:明确面向中文AI大模型评测,覆盖多学科教育场景,得2分。能力边界:仅说明评测范围,未明确模型能力边界,得1分。触发精度:未提供任何触发机制,得0分。环境适配:未说明运行环境或平台,得0分。
信息架构:目录结构清晰,有分类和链接,得2分。安装说明:无安装说明,得0分。命名稳定性:排行榜文件命名一致,但未说明版本稳定性,得1分。示例与FAQ:提供示例图片和链接,但无FAQ,得1分。已知限制:未提及,得0分。许可证:未提供,得0分。版本与变更日志:无,得0分。维护责任:未说明,得0分。
输出可用性:提供排行榜和缺陷库,但格式未明确,得1分。边际价值:提供大规模缺陷库和排行榜,对社区有参考价值,得2分。成本效益:未提供任何成本或效益分析,得0分。
声明可追溯性:排行榜数据有链接,但未提供原始数据或方法,得1分。跨源佐证:未提供其他来源验证,得0分。事实与推断分离:未区分事实和推断,得0分。
- 仓库仅提供评测数据和排行榜,未包含任何代码或可执行组件,无法验证其评测方法的准确性和公正性。
- 未提供许可证信息,使用和分发存在法律风险。
- 未提供数据来源和评测方法,排行榜的可信度有限。
这个 Agent 能做什么,适合哪些场景?
ReLE(Really Reliable Live Evaluation for LLM)是NoneLinear团队维护的中文大模型能力评测项目,原名CLiB。项目已评测395个大模型,涵盖GPT、Gemini、Claude、文心、Qwen、DeepSeek等商用与开源模型,提供综合能力、推理、教育、医疗、金融、法律、Agent工具调用等7大领域排行榜。同时提供规模超200万的缺陷库(badcase),支持按维度浏览分析。项目还提供大模型统一网关,聚合多家供应商API,实现智能负载均衡和自动故障切换。对于私有模型,团队提供免费评测服务,并支持用户上传专属测试数据实现模型选型降本。
ReLE执行端到端的大模型评测流程:1)从GitHub仓库的leaderboard目录获取各模型在300+维度上的准确率、耗时、token消耗等指标;2)通过badcase链接展示各维度失败案例;3)提供在线评测服务,支持用户上传数据并自定义筛选排行榜(nonelinear.com/static/benchmarking.html);4)集成大模型统一网关(api.nonelinear.com/v1),通过OpenAI兼容SDK调用模型,实现负载均衡和故障切换;5)提供模型选型工具,基于用户专属测试数据对比模型效果与成本,目标降本90%。项目还整合了LMArena和Artificial Analysis的英文评测数据,便于跨语言比较。
- 大模型选型者:在综合、教育、医疗等榜单中对比模型,选择适合自身场景的模型
- 模型开发者:利用超200万缺陷库分析模型弱点,定位改进方向
- 研究人员:参考ReLE技术报告,进行中文大模型能力各向异性研究
- 企业用户:通过统一网关调用多模型,享受智能负载均衡与高可用保障
- 需要降本的企业:上传专属测试数据,利用模型选型工具找出性价比最高的方案
这个 Agent 有哪些优点和局限?
- 覆盖模型数量多(395个),且持续更新(周更)
- 评测维度细化,涵盖7大领域300+细分,如牙科、高中语文等专业考试
- 提供超200万缺陷库,便于深度分析模型弱点
- 具有在线评测和模型选型工具,支持降低90%成本
- 整合国际榜单(LMArena、AA),便于中英文对比
- 商业化平台依赖,评测结果和网关服务关联非线智能官网
- 评测方法未完全透明,未开源具体评测代码或标准答案
- 部分领域标注TODO(如中考、初中奥数),覆盖不完整
- 模型调用和选型服务需付费,价格不透明
- 数据规模巨但可能仅限研究报告,社区利用需许可
如何安装或部署这个 Agent?
项目以GitHub仓库形式提供,无需安装客户端。使用在线服务需注册并获取API密钥:在nonelinear.com获取API key,然后通过OpenAI SDK调用统一网关。
如何使用这个 Agent?
1)访问仓库查看排行榜:如leaderboard/总分.md、leaderboard/教育.md等;2)通过badcase链接查看具体错误案例;3)使用在线评测:访问nonelinear.com/static/benchmarking.html自定义筛选榜单或上传数据;4)调用API:使用OpenAI SDK,设置base_url为https://api.nonelinear.com/v1,认证后调用模型;5)使用模型选型工具:上传专属测试数据,获取推荐模型。
这个 Agent 与同类方案有什么区别?
与LM Arena相比,ReLE专注于中文能力和专业领域(如医疗考试),提供更细分的维度;与OpenCompass相比,ReLE更侧重商业化服务与缺陷库;与SuperCLUE类似,ReLE也是中文评测,但ReLE提供更多模型和更细的维度,并集成了统一网关。