推理时扩展(Test-Time Scaling)正从"让模型想更久"走向完整的推理架构
推理时扩展(TTS)已从"让模型想更久"这一提示级技巧,成长为决定现代 AI 系统如何推理的底层架构。本文梳理它从研究发现走向生产系统的演进,以及这对构建者的意义。

过去十年里,"扩展"在 AI 领域几乎只意味着一件事:把模型做大、用更多数据训练、在预训练上投入更多算力。推理被视为一种固定且近乎可忽略的成本——你给模型一个提示,它就给出答案。这种心智模型如今已经过时。近两年来,另一条扩展轴从研究的好奇心走向了主流系统构筑的核心:推理时扩展(inference-time scaling / test-time scaling, TTS)——在推理阶段投入更多计算,让一个固定模型推理得更好。它最初只是"让模型想更久"这个看似简单的想法,如今已经演化为一套完整的推理架构:由路由器、生成器、验证器、搜索循环与自适应预算共同构成的系统,它针对每个请求决定"值得付出多少、以及何种形式的思考"。
起点:把"思考"当成算力
这条线索的源头很朴素。Chain-of-Thought 提示(Wei 等,2022)表明,让模型在最终答案前先输出中间推理步骤,能提升算术与推理任务的表现;Self-Consistency(Wang 等,2022)更进一步:采样多条推理路径,取多数答案。这些都还是提示技巧,而非架构。真正的概念跃迁发生在 2024 年,两条工作把推理算力重新定义为一等、可控的资源。
OpenAI 的 o1(2024 年 9 月)与 DeepSeek 的 R1(2025 年 1 月)把"思考"变成了可见的产品能力:模型先生成一段往往隐藏的思维链——有时长达数千 token——在其中探索、规划、回溯、自我验证,然后才作答。流行的概括是"让它想更久"。但在这个口号背后,严谨的研究表明,这个杠杆远比"token 越多越好"微妙。
研究真正确立了什么
Snell、Lee、Xu 与 Kumar(2024)提了一个精确的问题:给定固定的推理预算,应当如何花费?他们的答案——一种按每个提示的难度自适应分配推理方法的"计算最优"策略——相比 best-of-N 基线把效率提升了 4 倍以上;在算力匹配的评测中,配齐最优推理时计算的小模型,可以胜出大它 14 倍的模型。他们指出的两个机制是:
- 基于过程验证器奖励模型(PRM)的搜索——生成候选,并对每个推理步骤打分以选出最优。
- 按提示自适应更新回答分布——针对具体输入动态调整模型的输出分布。
关键在于:没有任何单一策略能处处获胜——简单题几乎不需要额外计算,而基座模型几乎从不产出正确候选的难题,收益会迅速衰减甚至归零。
同期工作进一步印证了这一点:
- Wu 等(2024)证明,Llemma-7B 配合树搜索在 MATH 上始终胜过 Llemma-34B,展示了借助高级推理实现的成本—性能帕累托最优。
- Brown 等(2024)在 "Large Language Monkeys" 中指出,覆盖率(N 个样本里至少解决一题的比例)随 log-N 平滑提升,因此即使弱基座模型,只要配上海量候选与可靠验证器,也能变得有竞争力。
统一教训是:训练算力设定模型的天花板,推理算力决定它离天花板有多近。
从一个轴到四维设计空间
当研究者退后一步,便发现"想更久"只是更广阔空间中的一维。2025 年的综述《A Survey on Test-Time Scaling in Large Language Models》(Zhang、Lü 等,arXiv:2503.24235)用四个正交维度组织了整个领域:
| 维度 | 问题 | 示例 |
|---|---|---|
| 扩展什么 | 什么被放大? | 并行、序列、混合、内生计算 |
| 怎么扩展 | 如何放大? | 刺激、验证、搜索、聚合;SFT / RL |
| 在哪扩展 | 在哪些任务? | 数学、代码、开放式问答、多模态 |
| 扩展得怎样 | 如何衡量? | 准确率、效率、可控性、可扩展性 |
这一框架揭示了真正的杠杆:不是"更多思考",而是正确的组合——例如并行采样 + 验证器重排 + 难度感知的自适应预算。
决定性转折:推理走向系统
2025–2026 最重要的转向,是认识到推理时扩展并非提示技巧,而是一个系统工程问题。《Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling》直白地论证:计算最优不等于系统最优。在真实部署中,延迟、每 token 成本、内存与硬件异构性才是主导。其测量结果反直觉:把一个 14B 推理模型用张量并行铺到 4 张 GPU 上,延迟只提升了 1.7 倍,因为长序列推理的瓶颈是 GPU 内同步而非批大小;推测解码对延迟的帮助,大于张量并行对成本的帮助。在 token 预算下最优的算法,在墙钟时间或单位成本预算下可能是错误选择。
因此,现代推理不再是一次前向传播,而是一套由多个组件组合而成的架构:
- 难度估计器 / 路由器——决定"是否思考、思考多少"。
- 生成器——快速模型或专用推理模型。
- 验证器 / 评判器——过程奖励模型、结果奖励模型、单元测试运行器、类型检查器、模式与检索检查器、基于 rubric 的验证器。
- 搜索与采样控制器——自一致性、树搜索、MCTS、粒子化蒙特卡洛。
- 自适应预算控制器——对推理 token、墙钟、重试次数的上限。
- 记忆与工具执行——在智能体化工作流中日益关键。
推理 token 已成为可观测、可计费的资源——OpenAI 在 usage 对象中暴露它,它占用上下文也产生费用。"思考预算"如今是服务等级协议的一部分。
GPT-5(2025 年 8 月)是这套架构最清晰的产品表达:一个统一系统,把高效快速模型、更深层的推理模型(GPT-5 thinking)与实时路由器结合在一起,路由器在真实信号(模型切换、偏好率、实测正确率)上持续训练。到 2026 年,独立的"推理模型"产品线基本消融进通用模型——由模型自行决定"是否思考、思考多久",通过 effort/level 参数控制,工具调用移入推理轨迹内部,原始轨迹对用户隐藏。问题不再是"选哪个模型",而是"授权多少思考"。
验证:缺失的另一半
"想更久"并不自动等于"想更好"。更长的推理可能带来过度思考——发散、产生多余步骤,并自信地把错误答案合理化。多个 2025 年的研究发现,随着思考预算增大,性能会出现平台甚至退化。这正是 2026 年实践把推理算力与验证结合的原因:
- T³RL(斯坦福与慕尼黑工大)指出,测试时 RL 中的多数投票会制造"虚假共识",强化自信的错误答案;引入外部工具验证、对经核实的 rollout 加权,在 AIME 2024 上取得 31.6% 的相对提升。
- Wan 等(ACL Findings 2026)提出"验证的推理时扩展":DeepVerifier 基于自动故障分类法生成 rubric,作为即插即用的验证器,在 GAIA/XBench 难题子集上提升 8–11% 准确率,F1 较 LLM-judge 基线高出 12–48%。
验证本身可在推理时被扩展,验证器也正在成为一等公民——其版本管理、校准与漂移监测,值得与今天的嵌入模型同等对待。
给构建者的启示
对于采用这套架构的团队,文献给出的实践经验高度一致:
1. 不要从 MCTS 起步,而要从任务分层起步——只把高价值、可验证的请求路由到更重的策略。
2. 定义硬性预算与软性停止条件——达成共识、验证器边际增益极小、工具反馈明确为负。
3. 把验证器当作独立产品面来维护——建立离线套件、线上抽样、校准曲线与回滚机制。
4. 埋点推理遥测——基座模型、采样数、推理 token 数、验证器分数、所选策略、是否触发工具或人工复核。没有这些,你无法判断"多想"究竟提升了质量,还是只是把错误变得更贵。
5. 在延迟与成本上做基准,而不只是准确率与 FLOPs——因为在生产中,计算最优与系统最优并不重合。
推理时扩展始于一个朴素直觉:模型可以"想更久"。它已成长为一套架构——针对每个问题,决定系统究竟该如何思考。这不再是一种提示技巧,而是现代推理的操作系统。
- Snell, C., Lee, J., Xu, K., & Kumar, A. (2024). Scaling LLM Test-Time Compute Optimally Can Be More Effective than Scaling Model Parameters. arXiv:2408.03314.
- Wu, Y., Sun, Z., Li, S., Welleck, S., & Yang, Y. (2024). Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for LLM Problem-Solving. arXiv:2408.00724.
- Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. Stanford Technical Report.
- OpenAI. (2024). Learning to Reason with LLMs. OpenAI Technical Report.
- DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- Zhang, Q., Lü, F., et al. (2025). A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well. arXiv:2503.24235.
- Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling. (2025). Preprint.
- Wang, J. (2025). A Tutorial on LLM Reasoning: Relevant Methods behind ChatGPT o1. arXiv:2502.10867.
- OpenAI. (2025). Introducing GPT-5. OpenAI.
- T³RL: Tool Verification for Test-Time Reinforcement Learning. (2025). Stanford & Technical University of Munich.
- Wan, Y., Fang, T., Li, Z., Huo, Y., Wang, W., Mi, H., Yu, D., & Lyu, M. R. (2026). Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification. ACL Findings 2026, arXiv:2601.15808.
- Han, Y., Ma, F., Quan, R., & Yang, Y. (2025). Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time. arXiv:2509.22572.