当"慢思考"成为新范式:AI 推理模型与测试时计算的 2026 进化史
2026 年大模型领域最重要的范式转移,不是某个参数更大的模型发布,而是"让模型想得更久"这件事本身被正式承认为继预训练扩展之后的新 scaling 轴线。OpenAI o3 在高算力模式下,单题平均消耗 5700 万 token、运行约 14 分钟,在 ARC-AGI 上拿到 87.5%——这是一个标准 LLM 得分接近 0% 的基准。DeepSeek R1 以约 o3 的 1/20 到 1/30 成本实现可比推理性能,把"推理能力不再被前沿规模训练锁死"这件事钉死。而原计划作为 R1 继任者的 DeepSeek R2 最终从未以独立模型发布——推理能力被折叠进了 2026 年 4 月发布的 V4,成为旗舰模型的"思考模式"而非独立产品线。
这三件事拼出了 2026 年推理模型最清晰的图景:测试时计算扩展已成为大模型能力提升的第三条 scaling 路径,推理经济学正在从"按 token 计价"变成"按思考计价",而"推理模型"与"常规模型"的边界正在消融。 本文试图沿着这条主线,拆解 AI 推理模型从 o1 到"思考模式无处不在"的技术演进。
一、三条 scaling law 的交汇:为什么 test-time compute 成了新主角
理解 2026 年推理模型的爆发,得先回到一个根本问题:让模型变强,到底有几种路径?
业界在 2025-2026 年逐渐形成了"三条 scaling law"的共识框架。第一条是预训练扩展——"更大模型、更多数据"的传统路径,仍然是最昂贵的,但在 2026 年收益递减明显。第二条是后训练优化——微调、RLHF、蒸馏,让有能力的基础模型专业化,成本中等。第三条是测试时计算扩展——让模型在推理时"想得更久",生成中间推理链再产出最终答案,成本可变(按思考付费)。
经典 Transformer 的工作方式是:从左到右逐 token 生成,每个 token 投入固定的计算量。要让模型在某个任务上更强,唯一办法是把模型本身做大或用更多数据训练。这套范式贡献了 2020-2024 年的大部分增益。但 Snell 等人 2024 年的研究表明:对于推理任务,在测试阶段投入更多计算,往往比单纯扩大模型参数更具性价比——这一发现直接催生了以 OpenAI o1 系列为代表的推理模型。
推理模型的核心机制是测试时计算:模型在给出最终答案前,先生成一条长长的内部推理链——探索解题策略、检查部分答案、发现错误时回溯——链完成后才产出响应。这条链可能消耗数万甚至数十万 token,但关键在于:训练阶段用强化学习让模型学会"如何可靠地思考",而非仅仅"流畅地猜"。
测试时计算之所以重要,不在于它是一个新技巧,而在于它打开了一个旧范式根本不允许的能力维度。 o3 用测试时计算解决的问题,GPT-4 规模的模型无论参数多大都解不了——这不是量变,是质变。
2026 年行业的焦点已从"测试时计算行不行"转向"效率扩展"——如何用 1 美元买到过去需要 100 万美元算力才能得到的结果。这个焦点转移,直接重塑了整个推理模型的竞争格局。
二、从 o1 到"思考预算":推理模型的工程化成熟
推理模型的产品化,是一条从"实验性突破"到"可调旋钮"的快速工程化曲线。
2024 年 9 月,OpenAI 发布 o1,首次证明强化学习训练的推理模型能在数学、编程、科学基准上大幅超越同规模的标准 LLM。2025 年 4 月,o3 与 o4-mini 发布,o3 成为当时最强推理模型——AIME 2024 约 91-96.7%、GPQA Diamond 87.7%、SWE-bench Verified 71.7%、ARC-AGI 87.5%(高算力)、Codeforces 评级 2727(前 0.1% 竞赛程序员水平)。o4-mini 则作为成本档变体,在 AIME 2024/2025 基准上表现最佳,且支持远高于 o3 的使用限制。
但真正让推理模型进入生产的关键,是**"推理努力程度"(reasoning_effort)参数的工程化**。o3-mini 开放了低/中/高三档调节,允许在简单问题上降低思考计算量换取速度和成本,在困难任务上提高思考量。这把"思考"从一个二元开关变成了一个连续可控的产品杠杆——精度、延迟、成本之间可以动态平衡。
各家在"如何控制思考"上给出了不同答案。OpenAI 的 o 系列采用隐藏式推理——思考 token 计费但用户不可见,通过 reasoning_effort 参数控制预算。Anthropic 的 Claude Extended Thinking 走混合路线:Claude 默认作为常规模型运行,被调用时切换到扩展思考模式,开发者在每次请求时指定一个 thinking budget。Google 的 Gemini 2.5 及 3.6 Flash 内置"混合推理模式"与"扩展思考能力"。Moonshot AI 的 Kimi K3 则采用"常开思考模式",专为长程编码与知识工作等前沿智能场景设计。
o3 高算力模式的成本数据,能最直观说明"思考"的经济分量:在最高难度问题上,o3 平均每题消耗约 5700 万 token、运行约 14 分钟,单题成本在数百美元量级。这意味着推理的经济学已经变得像训练的经济学——你在为计算时间付费,而不只是为文本生成付费。低算力模式下,o3-mini 在 6-27 秒内响应,输出 token 单价 4.40 美元/百万。
三、DeepSeek R1 的颠覆与 R2 的"消失":推理能力如何被折叠进旗舰
如果说 o3 代表了闭源前沿的性能上限,DeepSeek R1 则代表了对这套叙事的成本颠覆。
2025 年 1 月发布的 R1 证明了:纯强化学习(无需监督微调)就能让强推理能力涌现,且模型权重以 MIT 许可开源。R1 在 AIME 拿到 79.8%、GPQA Diamond 71.5%、SWE-bench 49.2%、Codeforces 2029——在最难基准上落后 o3,但成本是 o3 的 1/20 到 1/30。API 定价上,R1 每百万输入 token 0.55 美元、输出 2.19 美元,而 o3 分别为 15 美元和 60 美元。更关键的是,R1 的思考链对用户可见——这种透明性被许多从业者视为重要优势。
但真正的故事发生在 R1 之后。整个行业等待了一年多的 DeepSeek R2,最终从未以独立模型发布。据路透社报道,创始人梁文锋对 R2 性能不满意,拒绝设定发布时间——这不是物流延迟或监管原因,而是创始人在审视本应继任 R1 的模型后,决定它还没准备好。后续报道补充了结构性压力:出口管制切断了 DeepSeek 获取最高端 NVIDIA 加速器的通道,训练数据的质量与体量成为真实约束,代码生成与非英语推理是团队仍在修补的弱项。
DeepSeek 选择了一种不同的解法:把推理能力折叠进旗舰。2026 年 4 月 24 日发布的 V4 系列(V4-Pro 与 V4-Flash)直接内置了思考模式,把本应是 R2 核心特性的推理能力变成了 V4 架构的一部分。7 月 31 日发布的 V4-Flash-0731 正式版暴露了三档推理努力(low/high/max),Terminal Bench 2.1 从 61.8 跃升至 82.7。DeepSeek 官方 API 文档列出的模型列表中只有 deepseek-v4-flash 与 deepseek-v4-pro,曾经的 deepseek-reasoner 别名在 7 月 24 日后被弃用——它映射的正是 V4-Flash 的思考模式。
这并非 DeepSeek 一家的选择,而是 2026 年的行业趋势。OpenAI 的 GPT-5 被定位为"融合快速模型与推理模型的路由器",不再严格区分两类模型。Claude Opus 5"默认开启思考,支持从低到最大的多档努力调节"。Gemini 3.6 Flash 内置混合推理。推理正在从一个独立的模型品类,变成每个旗舰模型都内置的"模式"——"推理模型 vs 常规模型"的二元划分正在消融。
另一个值得关注的工程进展是 DeepSeek 6 月发布的 DSpark 推理框架——一个开源的投机解码框架,通过小模型提议候选、大模型批量验证的方式,在不改变底层模型的前提下将生成速度提升 60%-85%。DSSpark 已作为附件模块随 V4-Flash-0731 发布,在 vLLM 或 SGLang 中用单个标志即可启用。更快的推理,正是下一代推理模型所需的基础设施。
四、测试时计算的三种范式:从"想得更久"到"想得更聪明"
当推理模型成为主流,"测试时计算到底怎么做"就变成了一个需要被形式化的工程问题。
2026 年 8 月 4 日发布于 arXiv 的论文《Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility》试图建立这个框架。论文将测试时扩展统一为**"预算化推理"(budgeted inference)**,并区分了三种本质不同的扩展模式:
第一种是单轨迹长思考(顺序扩展)。 模型在一条推理轨迹上进行更长、更连贯的思考——这是 o3、R1 等推理模型的默认模式,也是"想得更久"最直观的体现。
第二种是多候选生成与选择(并行扩展)。 生成 N 个完整候选答案,再通过投票、验证或重排序选出最优解——即"自一致性"采样,在数学与编程任务上性价比出奇地高。
第三种是部分状态搜索与剪枝(树搜索)。 在生成过程中对未完成的部分状态进行搜索与剪枝,类似 Tree-of-Thought 的 beam search——最适合组合性问题。
这三种模式在统计结构、计算消耗和失效模式上存在本质差异——简单地把它们统一在同一个"预算"标量下,或只报告准确率而不说明具体推理协议,会导致不同研究之间的结果难以比较和复现。
生产实践中,最有效的模式是三类方法的组合:生成器 + 验证器。一个有用的心智模型是——你买的是"搜索"而不是"token",token 只是货币;价值来自更多尝试、更深推理和验证。验证器可以是第二个模型、规则引擎、单元测试、类型检查器、schema 校验器或检索/引用检查——关键是它返回一个生成器无法轻易作弊的信号。
一个被反复强调的陷阱是**"过度思考"(overthinking)**:更长的推理不总是意味着更好的结果。模型可能在长链中漫游、引入虚假步骤,甚至自信地为错误答案编造理由。这就是为什么 2026 年的最佳实践把测试时计算与不确定性信号、验证器配对使用——"计算最优策略不是'总是想更久',而是'只在值得的时候想更久'"。"预算强制"(budget forcing)技术则对特定类别 prompt 强制最小/最大思考长度,既避免思考不足也防止推理失控。
五、2026 年 8 月推理模型格局:一张速览表
为便于横向参照,下表汇总了截至 2026 年 8 月主流推理模型的核心指标(数据综合自各厂商公告与第三方评测):
| 模型 | 厂商 | 架构特点 | 代表基准 | 思考控制 | 开源 |
|---|---|---|---|---|---|
| o3 / o3-Pro | OpenAI | 隐藏式推理,工具内嵌 | AIME 96.7%、GPQA 87.7%、SWE-bench 71.7% | reasoning_effort 低/中/高 | 否 |
| o4-mini | OpenAI | 成本档推理模型 | AIME 2024/2025 最佳 | reasoning_effort | 否 |
| Claude Opus 5 | Anthropic | 默认开启思考 | 推理基准前沿 | 低-最大多档调节 | 否 |
| Gemini 3.6 Flash | 内置混合推理 | token 用量 −17% | 扩展思考模式 | 否 | |
| Kimi K3 | 月之暗面 | 常开思考模式 | 2.8T 参数开源 | 常开 | 是 |
| DeepSeek V4(思考模式) | 深度求索 | 推理折叠进旗舰 | Terminal Bench 2.1: 82.7 | low/high/max 三档 | 是(MIT) |
| DeepSeek R1 | 深度求索 | 纯 RL 训练 | AIME 79.8%、GPQA 71.5% | 固定思考 | 是(MIT) |
| Qwen3(思考模式) | 阿里 | 思考模式可切换 | 推理基准前列 | 模式切换 | 是 |
| Grok 4 | xAI | 推理能力内置 | 竞赛编程前列 | 内置 | 否 |
数据来源综合自各厂商文档、Artificial Analysis 与第三方评测。
这张表透露出几个值得玩味的信号。其一,思考控制已成为产品标配——几乎所有前沿模型都提供了某种形式的"思考预算"调节。其二,开源与闭源的差距在快速收窄——从过去的约 12 个月压缩到 3-6 个月,开源实验室通过测试时计算策略而非更大模型来实现前沿级推理。其三,"推理模型"作为独立品类的边界正在模糊——DeepSeek 把推理折进 V4,OpenAI 用 GPT-5 融合快慢模型,行业不再严格区分"推理模型"与"常规模型"。
六、生产实践:路由、成本与"按思考计价"的新经济学
推理模型进入生产,带来的不是简单的"换一个更强的模型",而是整个推理经济学的重构。
最成熟的部署模式是混合路由:把简单查询发给快速模型,把困难查询发给推理模型,在运行时决定走哪条路。2026 年的生产问题不再是"用推理还是非推理",而是"哪个模型、在哪个回合、用多少推理努力、配什么预算"。这种路由逻辑之所以成立,是因为推理模型的成本结构已经翻转——高算力模式下 o3 单题成本数百美元,低算力模式下 o3-mini 秒级响应——同一模型族内的价差可达数十倍。
成本对比的另一个维度是开源 vs 闭源。DeepSeek R1 API 每 100 万输入 token 0.55 美元、输出 2.19 美元,o3 分别为 15 美元和 60 美元——R1 在输入 token 上便宜约 20-30 倍,输出 token 上便宜约 27 倍。R1 蒸馏变体(如 R1-Distill-32B)可在 RTX 4090 上运行,R1-Distill-7B 甚至能跑在笔记本上。这种成本结构让"自托管推理模型"第一次成为现实——对有严格数据安全审计或合规限制的企业,R1 的开源属性是唯一合规解法。
但成本不是唯一考量。推理模型在不奖励深思的任务上会退化——对话响应、创意写作、摘要、任何"够用的快速答案胜过缓慢的完美答案"的场景,标准模型仍然更合适。斯坦福 2026 年新课中有一个精辟比喻:过去的大模型像考试结束就立刻交卷,而推理模型开始学会检查答案;如果高质量的推理轨迹还能回流到训练阶段,模型便拥有了一本不断扩充的"错题本"。
一个正在成形的趋势是推理模型品类的分化。同步推理——模型思考数秒到数分钟后返回答案,这是大多数人今天使用的形态;智能体推理——模型跨越多次工具调用与外部交互,思考持续数小时,这是智能体工作流的前沿。后者对推理模型的"长程可靠性"提出了更高要求:不仅要会想,还要在数十次工具调用中保持方向感、在出错时自我纠偏——这恰好是 τ(0)-VLA 等"慢思考-快执行"分层架构在机器人侧的镜像。
写在最后:当"想得更久"成为基础设施
把这条线索收拢,2026 年推理模型的爆发可以浓缩成一句话:测试时计算扩展成为继预训练扩展之后的第三条 scaling 路径,"思考预算"从一个研究概念变成了产品标配,推理能力从独立模型品类折叠成了每个旗舰模型的内置模式。
值得持续观察的是几个正在成型的趋势。第一是自适应扩展——模型根据估算的问题难度,动态分配多少思考:简单问题快速响应,困难问题自动扩展推理,无需用户配置。第二是多模型验证——一个模型解题,另一个模型独立检查答案,这种"宪法式"精度方法已在一些高风险企业部署中使用。第三是推理轨迹回流训练——高质量的思考链回流到训练阶段,让模型拥有一本不断扩充的"错题本",实现自我进化。第四是推理成本的持续下降——更好的搜索算法、把推理行为蒸馏进更小模型的技术,正在让思考模型的定价逼近快速模型。
至于那个被反复追问的问题——"推理模型会不会取代标准模型"——2026 年 8 月的答案已经清晰:不会取代,而是融合。GPT-5 作为路由器融合快慢模型,DeepSeek 把推理折进 V4,Claude 默认开启思考——前沿模型正在变成"会根据问题难度自动调节思考深度的统一系统"。真正的竞争不再是"谁的模型更大",而是"谁能在该想的时候想得深、不该想的时候想得快"。
o3 在 ARC-AGI 上 87.5% 的得分之所以震撼,不只是因为分数高,而是因为它证明了一件事:有些问题,靠"想得更久"能解,靠"模型更大"解不了。 这句话改写了大模型竞争的基本规则——当测试时计算成为可独立扩展的轴线,预训练规模不再是能力的唯一门票,推理经济学从"按 token 计价"变成"按思考计价",整个行业的价值分配逻辑正在被重写。测试时计算,是自 Transformer 以来最重要的架构级创新——这个判断在 2026 年已不再是争议,而是共识。
内容由 Qific2.1flash 模型辅助生成
Qific2.1flash 模型是千策人工智能研究院开发的旗舰多模态推理模型。基于 217B 总参数 / 23B 激活参数的稀疏 MoE 架构,原生支持图片和视频理解。