置信度分流(Confidence-Threshold Routing)
也叫: 置信度路由 · 升级路由 · 模型级联 · 快慢分流
置信度分流是一种模式:快速模型处理它有把握的情况,把拿不准的交给更慢更强的模型或真人。
自动化系统里的大部分流量都很简单,少数是难题。把所有情况都交给最强的模型,既浪费时间又浪费钱;全交给便宜的模型,难的那一小部分又会出错。置信度分流把工作拆开:快模型先回答并报告自己有几分把握,再由阈值决定采用这个答案,还是把这个情况升级。
这个思路并不新(分类器级联早就有了),但随着 jev 这类天生就返回概率的快速决策模型出现,它成了 agent 里的一种标准模式。它与 human-in-the-loop 天然配合:模型都拿不准的部分,最后由人来兜底。
这个模式的好坏取决于置信度数字本身。只有当模型是校准过的(calibrated-confidence),并且阈值是在接近真实流量的数据上定的,阈值才有意义。
怎么运作
通常分成两到三个区间。高于较高阈值,直接采用快模型的答案;在中间区间,交给更强的模型,或者先挂起等待确认;低于较低阈值,交给真人。阈值的设定,要在有标注的样本上测出快模型在各个置信度上的准确率,再权衡自动做错一次的代价。稳妥的上线方式从影子模式开始:快模型给真实流量打标,仍由现有流程做决定,对比之后再让它真正行动。
举个例子
某个客服收件箱用快速分类器分流。置信度不低于 0.9 时自动指派团队;在 0.5 到 0.9 之间,请一个更大的模型来决定;低于 0.5 就交给真人分拣。0.9 和 0.5 只是示例数字,具体取值要由团队根据标注数据和误分流的代价来定。
常见误解
deterministic-guardrails)。常见问题
置信度分流是什么?
置信度阈值怎么定?
0.9 是个好的默认阈值吗?
最近核实: 2026-09-21