生态与新兴热词

置信度分流(Confidence-Threshold Routing)

也叫: 置信度路由 · 升级路由 · 模型级联 · 快慢分流

置信度分流是一种模式:快速模型处理它有把握的情况,把拿不准的交给更慢更强的模型或真人。

自动化系统里的大部分流量都很简单,少数是难题。把所有情况都交给最强的模型,既浪费时间又浪费钱;全交给便宜的模型,难的那一小部分又会出错。置信度分流把工作拆开:快模型先回答并报告自己有几分把握,再由阈值决定采用这个答案,还是把这个情况升级。

这个思路并不新(分类器级联早就有了),但随着 jev 这类天生就返回概率的快速决策模型出现,它成了 agent 里的一种标准模式。它与 human-in-the-loop 天然配合:模型都拿不准的部分,最后由人来兜底。

这个模式的好坏取决于置信度数字本身。只有当模型是校准过的(calibrated-confidence),并且阈值是在接近真实流量的数据上定的,阈值才有意义。

怎么运作

通常分成两到三个区间。高于较高阈值,直接采用快模型的答案;在中间区间,交给更强的模型,或者先挂起等待确认;低于较低阈值,交给真人。阈值的设定,要在有标注的样本上测出快模型在各个置信度上的准确率,再权衡自动做错一次的代价。稳妥的上线方式从影子模式开始:快模型给真实流量打标,仍由现有流程做决定,对比之后再让它真正行动。

举个例子

某个客服收件箱用快速分类器分流。置信度不低于 0.9 时自动指派团队;在 0.5 到 0.9 之间,请一个更大的模型来决定;低于 0.5 就交给真人分拣。0.9 和 0.5 只是示例数字,具体取值要由团队根据标注数据和误分流的代价来定。

常见误解

常被以为: 阈值设成 0.9,系统就有 90% 的准确率。
实际上: 只有当模型的置信度在你的数据上是校准过的,这才成立。对一个过度自信的模型设 0.9 的阈值,仍可能放过很多错误。
常被以为: 按置信度分流之后就不需要护栏了。
实际上: 对有风险的操作,要保留不依赖任何模型置信度的硬性限制,并且在调用出错或分数低时失败即关闭(见 deterministic-guardrails)。

常见问题

置信度分流是什么?
快速模型在置信度高于阈值时直接行动,低于阈值时升级给更强的模型或真人。
置信度阈值怎么定?
在接近真实流量的标注数据上,测出快模型在各个置信度上的准确率,权衡自动做错的代价,并先用影子模式跑一段再让它行动。
0.9 是个好的默认阈值吗?
没有通用的默认值。0.9 常出现在示例里,但合适的取值取决于校准程度和你所在领域出错的代价。

属于 Jev 专题——阅读完整讲解 →

最近核实: 2026-09-21

相关术语