生态与新兴热词

推理期计算(Test-Time Compute)

也叫: 推理时计算 · 测试期扩展 · test-time scaling · inference-time scaling

推理期计算是指在模型回答查询时(而非训练时)花费的计算——通过更长的推理链、多次独立采样、在候选项上做搜索、或自我检查,来提升结果质量。

问题推理路径 A推理路径 B选出最优答案
花费推理期计算的一种方式:对同一个问题并行探索多条推理路径,再从中选出或投票出最好的结果。

多年来,撬动模型能力的主要杠杆是训练:更大的模型、更多数据、更多训练算力。推理期计算是随着主打推理的模型而凸显出来的第二根杠杆:训练好的模型不动,在它回答难题的那一刻多花计算。

这份花费有几种形式。模型可以在给出答案前生成更长的 chain-of-thought。可以独立采样好几次,再投票或挑最好的。可以做搜索——生成候选步骤、评估、展开有希望的分支。可以对自己的草稿做批评和修改(reflection-self-correction)。这些都是用延迟和 token 成本,换一个更高的答对概率,而且都能对难题调高、对简单题调低。现在一些模型直接暴露了一个『努力程度』或推理预算的设置,做的就是这件事。

对 Agent 来说,关联很直接。一个 planning 步骤、或一个棘手的工具使用决策,能从更多推理期计算中获益;例行步骤则不需要。2026 年业界常把最终交付的能力描述为『模型质量 × 推理期计算 × 工具』的乘积——后两者现在和模型本身一样值得优化。

怎么运作

常见策略:(1) 更长推理——让模型在作答前生成更多中间 token;(2) 并行采样加筛选——在某个温度下抽 N 个答案,用多数投票或一个打分模型来聚合(best-of-N);(3) 搜索——把推理当成一棵树,给部分路径打分、展开最优(beam search、类 MCTS 方法);(4) 迭代精修——起草、批评、修改,循环几轮。由一个控制器决定花多少,有时来自用户设定的预算,有时根据模型自身的不确定性自适应。算力对『有可验证或可检查结构』的问题(数学、代码、多步逻辑)帮助最大,对开放式生成帮助较小。

举个例子

Agent 遇到一个子任务:『给定这 12 个文件及其依赖关系,算出数据库迁移的正确执行顺序。』低努力时它直接作答,有时把顺序搞错。高努力时它生成好几种独立的排序,逐一对照给定依赖检查,丢掉违反约束的,返回幸存的那一个——token 更多、慢几秒,但可靠地正确。

和相关概念的区别

推理期计算与训练期计算:训练期计算一次性改变模型权重,惠及之后每一次查询。推理期计算按查询花费、不改变模型、可以按请求调节——难题多花、简单题少花。两者是互补的杠杆,不是替代关系。

常见误解

常被以为: 推理期计算花得越多,答案一定越好。
实际上: 它主要在有可检查结构的问题上提高答对概率;开放式任务的收益很快见顶,而且它总是要付出延迟和 token 成本。
常被以为: 推理模型输出更长,只是在啰嗦。
实际上: 多出来的中间 token 正是机制本身——把它们花在推理链或自我检查上,才是准确率提升的原因,不是废话填充。

常见问题

推理期计算是什么?
在模型作答时花费的计算——更长的推理、多次采样、搜索或自我检查——用来在不重新训练模型的前提下提升结果。
推理期计算和训练期计算有什么区别?
训练期计算一次性改变模型权重,作用于之后所有查询;推理期计算按查询花费、不改变模型,可以按请求调高或调低。
推理期计算对每种任务都有用吗?
对数学、代码、多步逻辑这类有可验证结构的问题帮助最大;开放式生成收益较小,而且仍会增加延迟和成本。

最近核实: 2026-08-30

相关术语