生态与新兴热词

校准置信度(Calibrated Confidence)

也叫: 模型校准 · 概率校准 · 校准 · calibration

模型的置信度是校准的,指它所给的概率与现实相符:在它标注 80% 把握的所有答案里,大约八成应该是对的。

校准讲的是“诚实”,不是“准确”。一个模型如果每次都说 70%,而实际也只有 70% 的时候是对的,它就是完美校准的;一个高准确率的模型如果实际对 85% 却总说 99%,校准就很差。

只要软件开始根据置信度行动,这一点就变得重要:高于阈值就自动批准、低于阈值就交给真人,前提是这些数字有意义(见 confidence-threshold-routing)。语言模型用文字表达把握时,校准往往不好:不论对错,语气都很笃定,这也是产生自信的 hallucination(幻觉)的成因之一。

有些决策类模型,比如 jev,专门被训练成输出经过校准的概率(rlcd)。

怎么运作

检验校准需要有标注的样本。对每个样本,收集模型给出的预测概率,以及它实际上对不对;把预测按置信度分段(比如 0.5–0.6、0.6–0.7……),再比较每一段的平均声明置信度和实际命中率。把这个画成图叫可靠性图(reliability diagram),也常用期望校准误差(ECE)或 Brier 分数这样的单一数字来概括。校准应该在与你线上流量相似的数据上检验,因为输入分布变了,校准也可能漂移。

举个例子

某团队用自动分类器给客服工单分流,并允许它在置信度高于 0.9 时自行处理。在信任这一点之前,他们标注了 500 张历史工单,发现 0.9 以上的预测里分类器对了 97%,而 0.6–0.7 区间里只对了 41%。高置信度这一段可以放心自动化,低的那一段应当交给真人。

常见误解

常被以为: 模型很自信就说明它是对的。
实际上: 置信度和正确性是两回事。校准衡量的是前者对后者的预测有多准,而很多模型是过度自信的。
常被以为: 厂商说它的概率是校准过的,你就不用自己测了。
实际上: 校准是在特定数据分布上测出来的。设置阈值之前,请用你自己的标注样本确认一遍。

常见问题

校准置信度是什么意思?
模型给出的概率与它实际答对的频率相符,比如标注 80% 把握的答案,大约有 80% 是对的。
怎么衡量模型的校准?
在标注数据上按置信度给预测分组,比较每组的平均置信度和实际准确率,常用可靠性图展示,或用期望校准误差、Brier 分数来概括。
大语言模型的校准好吗?
用文字表达把握时往往不好,容易过度自信。专门为校准概率训练的模型力求做得更好,但仍应在你自己的数据上检验。

属于 Jev 专题——阅读完整讲解 →

最近核实: 2026-09-21

相关术语