推理期计算(Test-Time Compute)
也叫: 推理时计算 · 测试期扩展 · test-time scaling · inference-time scaling
推理期计算是指在模型回答查询时(而非训练时)花费的计算——通过更长的推理链、多次独立采样、在候选项上做搜索、或自我检查,来提升结果质量。
多年来,撬动模型能力的主要杠杆是训练:更大的模型、更多数据、更多训练算力。推理期计算是随着主打推理的模型而凸显出来的第二根杠杆:训练好的模型不动,在它回答难题的那一刻多花计算。
这份花费有几种形式。模型可以在给出答案前生成更长的 chain-of-thought。可以独立采样好几次,再投票或挑最好的。可以做搜索——生成候选步骤、评估、展开有希望的分支。可以对自己的草稿做批评和修改(reflection-self-correction)。这些都是用延迟和 token 成本,换一个更高的答对概率,而且都能对难题调高、对简单题调低。现在一些模型直接暴露了一个『努力程度』或推理预算的设置,做的就是这件事。
对 Agent 来说,关联很直接。一个 planning 步骤、或一个棘手的工具使用决策,能从更多推理期计算中获益;例行步骤则不需要。2026 年业界常把最终交付的能力描述为『模型质量 × 推理期计算 × 工具』的乘积——后两者现在和模型本身一样值得优化。
怎么运作
常见策略:(1) 更长推理——让模型在作答前生成更多中间 token;(2) 并行采样加筛选——在某个温度下抽 N 个答案,用多数投票或一个打分模型来聚合(best-of-N);(3) 搜索——把推理当成一棵树,给部分路径打分、展开最优(beam search、类 MCTS 方法);(4) 迭代精修——起草、批评、修改,循环几轮。由一个控制器决定花多少,有时来自用户设定的预算,有时根据模型自身的不确定性自适应。算力对『有可验证或可检查结构』的问题(数学、代码、多步逻辑)帮助最大,对开放式生成帮助较小。
举个例子
Agent 遇到一个子任务:『给定这 12 个文件及其依赖关系,算出数据库迁移的正确执行顺序。』低努力时它直接作答,有时把顺序搞错。高努力时它生成好几种独立的排序,逐一对照给定依赖检查,丢掉违反约束的,返回幸存的那一个——token 更多、慢几秒,但可靠地正确。
和相关概念的区别
推理期计算与训练期计算:训练期计算一次性改变模型权重,惠及之后每一次查询。推理期计算按查询花费、不改变模型、可以按请求调节——难题多花、简单题少花。两者是互补的杠杆,不是替代关系。
常见误解
常见问题
推理期计算是什么?
推理期计算和训练期计算有什么区别?
推理期计算对每种任务都有用吗?
最近核实: 2026-08-30