生态与新兴热词

RLCD(面向校准决策的强化学习)

也叫: RLCD · Reinforcement Learning for Calibrated Decisions · 校准决策强化学习

RLCD 是 TypeSafe AI 给训练 Jev 所用强化学习方法起的名字,目标是让模型输出的概率如实反映它到底有几成把握。

大多数语言模型的强化学习奖励的是“好结果”:人更喜欢的回答(RLHF),或者程序能检验的正确答案(rlvr)。这两者都没有直接教模型如何说明自己有几分把握。按 TypeSafe 的描述,RLCD 针对决策类任务优化“对认知诚实的概率”,也就是当 Jev 报出 80% 时,它应该大约有八成的情况是对的(见 calibrated-confidence)。

这对 Jev 很重要,因为它的答案是以概率形式交给软件去执行的。像“高于 0.9 就自动执行”这样的阈值,只有当 0.9 真的意味着十次里大约对九次时才有意义。

RLCD 是 TypeSafe 自己的叫法。在我们看过的发布材料里,具体的奖励设计和训练数据都没有公开,所以超出其公开目标的部分并不是公开信息。

和相关概念的区别

RLCD 与 rlvr:RLVR 奖励的是程序能验证的正确最终答案;RLCD 按 TypeSafe 的说法,奖励的是所给概率的质量,所以自信地答错,比犹豫地答错受到更重的惩罚。两者优化的对象不同,原则上可以结合。

常见误解

常被以为: RLCD 保证 Jev 给出的概率是准确的。
实际上: 这是一个训练目标,不是保证。遇到与训练数据差异很大的输入时,校准可能变差,请用你自己的标注样本检查。

常见问题

RLCD 是什么的缩写?
Reinforcement Learning for Calibrated Decisions,即面向校准决策的强化学习,是 TypeSafe AI 给 Jev 所用训练方法起的名字。
RLCD 和 RLHF 有什么区别?
RLHF 奖励人更喜欢的回答;RLCD 按 TypeSafe 的说法,奖励的是在决策任务上与实际答对频率相符的概率。
RLCD 是行业标准吗?
不是。它是 TypeSafe 自己的术语,在我们看过的发布材料里训练细节也没有公开。

属于 Jev 专题——阅读完整讲解 →

最近核实: 2026-09-21

相关术语