生态与新兴热词

大型推理模型(LRM)

也叫: LRM · 推理模型 · Large Reasoning Model · 思考模型

大型推理模型(LRM)是一类经过训练、会在给出最终答案前先逐步展开一长串内部推理的语言模型。

大型推理模型本质上仍是语言模型,但训练方式让它在回答前先生成一大段中间推理:拆解问题、尝试一种思路、检查、失败了再退回重来。很多产品把它做成“思考”或“推理强度”开关。

这个方向在 2024–2025 年随着各家厂商和开源权重实验室陆续推出推理模型而爆发,如今已是和快速的非推理模型并列的一档标配。推理模型在数学、编程和多步逻辑上通常明显更强,也常是 Agent 规划步骤背后的模型。

代价是延迟和 token:推理过程要先生成出来,通常也计费,然后才是可见答案。所以多数厂商允许你选择让它想多久。

怎么运作

通常认为有两个要素。一是在答案可检验的问题上做强化学习训练(rlvr),奖励那些推理后答对的过程;二是在回答时花更多算力,让推理链跑得更长(test-time-compute)。结果是模型学会了检查自己的步骤、尝试替代方案等行为。厂商在原始推理过程是完整展示、摘要展示还是隐藏上做法不一。

举个例子

问“为什么这个测试偶尔失败”,普通模型可能直接猜最常见的原因。推理模型会顺着代码路径推演,考虑竞态条件,检查它假设的执行顺序是否可能发生,排除一个猜测,最后只报告经得起检验的那个。

和相关概念的区别

LRM 与 chain-of-thought 提示:思维链是你对任何模型都能用的提示技巧;推理模型则是把这种行为训练进了模型里,不用你要求它也会长篇推理。

常见误解

常被以为: 推理模型一定更好,什么都该用它。
实际上: 它更贵更慢,对简单查询、格式化或分类,多想几步收益很小。很多 Agent 是例行步骤用快模型,难题才用推理模型。
常被以为: 看到的推理过程就是模型真实的决策依据。
实际上: 针对推理过程的研究表明,它可能遗漏或错述真正影响答案的因素,应当把它当作有用的信号,而不是保证准确的解释。

常见问题

大型推理模型是什么?
一种被训练成在给出最终答案前先生成长长的逐步推理(包括检查和修正)的语言模型。
推理模型和普通大模型有什么区别?
推理模型把长推理训练进了模型,会多花 token 和时间思考;普通模型回答更直接、更快更省,只在被提示时才展开推理。
推理模型更适合做 AI Agent 吗?
在规划和难决策上常常是,但并非每一步都需要;按任务难度混用快模型和推理模型很常见。

最近核实: 2026-09-20

相关术语