小模型 + 大推理预算:正在改写 AI 能力与成本方程的新方向
小模型在获得充足的推理期算力预算后,正在数学、代码与智能体任务上逼近甚至超越更大的模型。这一趋势正在改变能力的购买方式,但也存在三个不容忽视的硬边界。

十年来,AI 行业衡量雄心的单位是参数。能力等于规模:更多权重、更多数据、更多预训练算力。到了 2026 年,第二个杠杆已经成熟为一线策略——给小模型一份大推理预算。能力不再只体现在参数里,而是在推理时刻被「买」出来:更长的思维链、带验证器的并行采样、树搜索,以及按请求自适应的算力预算。这一方向如今同时拥有同行评审证据、已落地的产品和陡峭下降的成本曲线,正在悄然改写「能力如何被购买」。
证据:小模型 + 大预算
学术基础在 2024–2025 年奠定。Snell 等人(ICLR 2025 口头报告)形式化了「计算最优的测试时扩展」:在固定推理预算下,按题目难度自适应选择策略,效率较 best-of-N 基线提升超过 4 倍;在 FLOPs 对齐的评估中,配备合理测试时策略的小模型,胜过比它大 14 倍的模型。Wu 等人(2024)证明 Llemma-7B 配合树搜索在 MATH 上稳定胜过 Llemma-34B。Brown 等人的《Large Language Monkeys》(2024)给出覆盖律:N 次采样中至少答对一次的比例随 log-N 平滑增长——只要配上有可靠验证器的多次采样,弱小的基座模型也能变得极具威胁。
2025–2026 年的模型世代把这些发现变成了产品。Qwen3-4B 在推理任务上比肩 72B 级的 Qwen2.5-Instruct;MoE 版本 Qwen3-30B-A3B 每 token 仅激活约 3B 参数,却以约十分之一的激活参数量超过 QwQ-32B。OpenAI 的开放权重模型 gpt-oss-20b(总参数约 21B、每 token 激活约 3.6B)可在 16GB 内存级设备上运行,并提供显式的推理档位:在 2026 年一项测试时扩展可复现性研究(arXiv:2608.04001)中,gpt-oss-20b 在同一数学评测集上低档得分 47.4、高档 64.0——推理预算本身值约 17 个百分点,而模型的尺寸与前沿产品相差一个量级。同一研究的重复采样数据更能说明「大预算」的威力:Qwen3-4B-Thinking-2507 的 Pass@80 达到 87.5%,仅比尺寸大得多的模型(91.7%)低 4 个百分点——允许尝试 80 次的小模型,已经站在前沿的街区里。
艾伦·图灵研究所把这个思路推到了实用极限:在一个为期六周的冲刺中,研究团队用从 DeepSeek-R1 蒸馏的 2,000 条推理轨迹微调了一个 3B 开放权重模型,结合检索增强与推理期的 budget forcing,在真实世界的健康分诊问答上达到接近前沿的水平——模型小到可以跑在一台笔记本上。
为什么是现在:经济账翻转了
三条曲线在此汇合。其一,推理成本不对称:NVIDIA 的立场论文《Small Language Models are the Future of Agentic AI》(Belcak 等,2025)估算,运行 7B 模型的成本约为 70B–175B 模型的十分之一到三十分之一——而大多数智能体负载是狭窄、重复的任务,这笔交易几乎稳赚。其二,固定能力的价格坍缩:a16z 的「LLMflation」约为每年便宜 10 倍,Epoch AI 测得的年度中位数接近 50 倍。2021 年底 GPT-3 达到 MMLU 42 分约需每百万 token 60 美元;如今 Llama-3.2-3B 用约 0.06 美元就能做到。其三,硬件底座:2025–2026 年手机与 Copilot+ PC 普及的 NPU、成熟的量化与 MoE 架构,把数十亿参数的推理模型塞进了消费设备。Artificial Analysis 2026 年 3 月对 Qwen3.5 小尺寸推理模型的测量——4B 智力指数 27、9B 达到 32——显示 10B 以下档位的进步速度超过了它头顶的大模型阵营。
三个硬边界
趋势是真的,但诚实的版本有边界。
一、小模型可学习性鸿沟。 Li 等人(ACL 2025)发现,3B 以下的模型用大教师模型的长而复杂的推理轨迹做微调,性能反而常常变差——它们学到了「思考的腔调」(「等等,让我再检查一下」)却没有学到实质,在 MATH 和 AMC 上掉超过 10 分。他们的解法是混合蒸馏:约 20% 长 CoT 配 80% 短 CoT,让 Qwen2.5-3B 恢复 8 分以上。造一个小推理模型是数据配比问题,不是一条可以盲跑的蒸馏流水线。
二、过度思考。 ACL 2026 Findings 的一项基础数学推理研究发现,推理模型的平均输出 token 是普通模型的 18 倍——Phi-4-reasoning-plus 生成 6,780 个 token,而 Phi-4 只要 379 个,准确率反而更低(69.5% 对 78.9%)。给推理模型的 token 预算设上限,它可能崩溃:Qwen3 在 1,024 token 上限下从 72% 跌到 44%。与此同时,生产环境的档位旋钮呈现边际递减——GPT-5 级模型从 low 调到 high 档,该基准上的准确率增益接近于零。额外的预算只在困难、可验证的问题上有回报;在简单问题上它什么都买不到,甚至会倒扣。
三、饱和与知识广度。 计算最优扩展是双刃剑:预算足够大时,大模型最终会赢,因为小模型先饱和。而且任何推理预算都替代不了缺失的知识——蒸馏出的小模型在数学、代码和结构化任务上亮眼,但在 GPQA-Diamond 这类知识密集的基准上仍然落败。
从「选模型」到「选预算」
实际后果是:模型选型正在变成算力策略选型。生产系统把推理档位做成旋钮(minimal 到 high),路由器逐请求决定是否值得思考,验证器——单元测试、奖励模型、格式校验——让并行采样变得物有所值。2026 年胜出的部署模式是异构的:3–9B 的本地模型承担智能体循环中 80–90% 的例行步骤——解析、工具调用、格式化、分类——只有真正困难的推理轮次才升级到前沿云端模型。路由策略同时就是隐私策略:团队可以按任务决定内容是否允许离开设备。
这不意味着前沿模型不再重要。预训练仍然决定天花板;推理算力决定的是你以多低的成本逼近它,以及——对越来越多的负载而言——你实际上需要多少天花板。变化在于行业寻找下一个效率增益的位置:不是一份更大的权重文件,而是一份更聪明的「思考预算」。带着大推理预算的小模型不会取代前沿系统——它们正在成为前沿系统之下的默认底座。
- Snell, Lee, Xu & Kumar. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 / ICLR 2025 (Oral). https://arxiv.org/abs/2408.03314
- Wu et al. (2024). Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models. arXiv:2408.00724. https://arxiv.org/abs/2408.00724
- Brown et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787. https://arxiv.org/abs/2407.21787
- Li, Yue, Xu et al. (2025). Small Models Struggle to Learn from Strong Reasoners. ACL 2025 / arXiv:2502.12143. https://arxiv.org/abs/2502.12143
- Belcak et al. (NVIDIA). (2025). Small Language Models are the Future of Agentic AI. arXiv:2506.02153. https://arxiv.org/abs/2506.02153
- Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility. (2026). arXiv:2608.04001. https://arxiv.org/html/2608.04001
- Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models. (2026). Findings of ACL 2026. https://aclanthology.org/2026.findings-acl.1285.pdf
- The Alan Turing Institute. (2026). Why we still need small language models – even in the age of frontier AI. https://www.turing.ac.uk/blog/why-we-still-need-small-language-models-even-age-frontier-ai
- OpenAI. (2025). gpt-oss-20b / gpt-oss-120b open-weight models. https://openai.com/index/introducing-gpt-oss/
- Alibaba Qwen Team. (2025). Qwen3 Model Family (Qwen3-4B-Thinking-2507, Qwen3-30B-A3B). https://qwen.ai
- FrontierNews.ai. (2026). How AI Labs Are Squeezing Better Reasoning Out of Smaller Models at Test Time. https://www.frontiernews.ai/news/article/how-ai-labs-are-racing-to-make-models-smarter-at-t-8ff88adf
- Artificial Analysis. (2026). Qwen3.5 small-model intelligence index measurements. https://artificialanalysis.ai
- Chandra, V. (2026). On-Device LLMs: State of the Union, 2026. https://v-chandra.github.io/on-device-llms/
- a16z / Epoch AI. (2025). LLMflation: LLM inference cost declining ~10x per year; Epoch AI inference price analysis. https://a16z.com/llmflation-llm-inference-cost/