大型推理模型(LRM)
也叫: LRM · 推理模型 · Large Reasoning Model · 思考模型
大型推理模型(LRM)是一类经过训练、会在给出最终答案前先逐步展开一长串内部推理的语言模型。
大型推理模型本质上仍是语言模型,但训练方式让它在回答前先生成一大段中间推理:拆解问题、尝试一种思路、检查、失败了再退回重来。很多产品把它做成“思考”或“推理强度”开关。
这个方向在 2024–2025 年随着各家厂商和开源权重实验室陆续推出推理模型而爆发,如今已是和快速的非推理模型并列的一档标配。推理模型在数学、编程和多步逻辑上通常明显更强,也常是 Agent 规划步骤背后的模型。
代价是延迟和 token:推理过程要先生成出来,通常也计费,然后才是可见答案。所以多数厂商允许你选择让它想多久。
怎么运作
通常认为有两个要素。一是在答案可检验的问题上做强化学习训练(rlvr),奖励那些推理后答对的过程;二是在回答时花更多算力,让推理链跑得更长(test-time-compute)。结果是模型学会了检查自己的步骤、尝试替代方案等行为。厂商在原始推理过程是完整展示、摘要展示还是隐藏上做法不一。
举个例子
问“为什么这个测试偶尔失败”,普通模型可能直接猜最常见的原因。推理模型会顺着代码路径推演,考虑竞态条件,检查它假设的执行顺序是否可能发生,排除一个猜测,最后只报告经得起检验的那个。
和相关概念的区别
LRM 与 chain-of-thought 提示:思维链是你对任何模型都能用的提示技巧;推理模型则是把这种行为训练进了模型里,不用你要求它也会长篇推理。
常见误解
常见问题
大型推理模型是什么?
推理模型和普通大模型有什么区别?
推理模型更适合做 AI Agent 吗?
最近核实: 2026-09-20