RLCD(面向校准决策的强化学习)
也叫: RLCD · Reinforcement Learning for Calibrated Decisions · 校准决策强化学习
RLCD 是 TypeSafe AI 给训练 Jev 所用强化学习方法起的名字,目标是让模型输出的概率如实反映它到底有几成把握。
大多数语言模型的强化学习奖励的是“好结果”:人更喜欢的回答(RLHF),或者程序能检验的正确答案(rlvr)。这两者都没有直接教模型如何说明自己有几分把握。按 TypeSafe 的描述,RLCD 针对决策类任务优化“对认知诚实的概率”,也就是当 Jev 报出 80% 时,它应该大约有八成的情况是对的(见 calibrated-confidence)。
这对 Jev 很重要,因为它的答案是以概率形式交给软件去执行的。像“高于 0.9 就自动执行”这样的阈值,只有当 0.9 真的意味着十次里大约对九次时才有意义。
RLCD 是 TypeSafe 自己的叫法。在我们看过的发布材料里,具体的奖励设计和训练数据都没有公开,所以超出其公开目标的部分并不是公开信息。
和相关概念的区别
RLCD 与 rlvr:RLVR 奖励的是程序能验证的正确最终答案;RLCD 按 TypeSafe 的说法,奖励的是所给概率的质量,所以自信地答错,比犹豫地答错受到更重的惩罚。两者优化的对象不同,原则上可以结合。
常见误解
常见问题
RLCD 是什么的缩写?
RLCD 和 RLHF 有什么区别?
RLCD 是行业标准吗?
最近核实: 2026-09-21