生态与新兴热词

RLVR(可验证奖励的强化学习)

也叫: RLVR · Reinforcement Learning with Verifiable Rewards · 可验证奖励 · 可验证奖励强化学习

RLVR 是一种强化学习:奖励来自对结果的自动检查,比如代码是否通过测试、数学答案是否与标准答案一致。

RLVR 与 RLHF(基于人类反馈的强化学习)相对:RLHF 的奖励信号来自一个用人类偏好打分训练出来的模型;RLVR 的奖励则由程序算出——跑单元测试、比对最终答案与标准答案、检查形式化证明能否通过编译。奖励便宜、客观、无可争辩。

所以它天然适合答案可检验的领域,主要是数学、编程和逻辑题,并且被普遍认为与近来推理模型学会输出长而带自我检查的思维链有关(见 large-reasoning-model)。

它的局限也出在同一处:没有自动验证器的地方,比如文笔、是否有帮助、品味,RLVR 无法直接使用,实验室仍会把它与基于偏好的方法结合。

怎么运作

模型对一个任务反复尝试;验证器给每次尝试打分(比如测试全过记 1,否则 0);策略梯度类算法提高得分高的推理路径的概率。因为奖励只取决于最终结果,模型可以自行发现中间策略,包括检查和回溯。验证器若有漏洞(测试覆盖不全、答案匹配过松)会被模型钻空子,这叫奖励作弊(reward hacking)。

举个例子

以编程任务为例,训练系统给模型一个 bug 报告和一套隐藏测试。模型提出补丁,每个补丁都拿去跑测试,只有让测试通过的补丁才拿到正奖励。经过大量迭代,模型学会先读失败的测试、复现 bug、并在结束前验证自己的修复。

常见误解

常被以为: RLVR 意味着你使用模型时它的答案是被验证过的。
实际上: 验证只发生在训练阶段。推理时模型只是给出它的最佳猜测,仍然可能出错。

常见问题

RLVR 是什么的缩写?
Reinforcement Learning with Verifiable Rewards,即可验证奖励的强化学习:由程序自动检查结果来给出奖励。
RLVR 和 RLHF 有什么区别?
RLHF 的奖励来自用人类偏好训练的模型;RLVR 的奖励来自测试通过之类的客观自动检查,适合数学和代码,不适合主观质量。
RLVR 对编程 Agent 有什么意义?
代码天然有测试和编译器作验证器,所以 RLVR 式训练是提升模型解决编程任务能力的常见方式。

最近核实: 2026-09-20

相关术语