当推理从“秒级”走向“毫秒级”:2026 大模型推理框架的架构分化与延迟战场
一句话结论
2026 年 8 月,大模型推理优化的竞争重心已从“拼参数规模”彻底转向“拼延迟与吞吐的工程效率”——vLLM 凭 PagedAttention 稳坐高吞吐通用服务王座、SGLang 以 RadixAttention 在复杂提示与 Agent 场景砍下 30-50% 延迟、TensorRT-LLM 用 AOT 编译在纯 NVIDIA 集群榨干每一毫秒、DeepSeek V4-Flash 用 MoE 稀疏激活+Triton 算子主权+98% 缓存命中把单流推理推到 168.6 tok/s。这场战争的胜负手不在“谁的模型更强”,而在“谁能在 prefill 计算密集与 decode 显存带宽密集的物理约束下,把延迟压到人类感知阈值之内”。
一、从“够不够智能”到“够不够快”:推理优化的范式迁移
过去两年,大模型行业的叙事中心是“参数规模”——从 7B 到 70B 到万亿 MoE,谁的模型更大谁就更强。但 2026 年这个叙事彻底失效了。DeepSeek V4-Flash 用 284B 总参数、13B 激活跑赢了自家 1.6 万亿参数的 V4-Pro Preview,传递了一个清晰信号:AI 的竞争正在从“更大”转向“更聪明”,而“更聪明”的工程含义就是推理效率。
这个迁移的底层逻辑,是推理成本与延迟正在决定 AI 能否真正规模化落地。DeepSeek V4-Flash 上线一周,周调用量 7.22 万亿 Token 登顶 OpenRouter 全球榜首,单日峰值 8 万亿,服务器集群长期满载。这个数据量的背后是一个残酷的工程现实:如果推理不够快、不够便宜,再强的模型能力也无法转化为产业价值。
2026 年 7 月 31 日 DeepSeek V4-Flash 正式版上线时,把 API 定价压到了缓存命中 0.0028 美元/百万 Token、未命中 0.14 美元/百万 Token——2000 万 Token 的 Agent 任务折前约 3.5 美元。同期 OpenAI 把 GPT-5.6 Luna 输入价从 1 美元/百万 Token 砍到 0.2 美元,降了 80%,但降完后单任务成本仍比 DeepSeek 贵 60%。这个差距不是靠打折能追上的,核心在于 MoE 稀疏架构加 98% 缓存命中带来的结构性成本优势。
但“白菜价”只是结果,不是原因。真正值得拆解的是:DeepSeek 是怎么把单流推理推到 168.6 tok/s、8 并发聚合吞吐 542 tok/s 的?这背后是一整套从 KV Cache 管理到推测解码到 PD 分离到量化的工程暗线。本文要拆解的,正是这条暗线的核心技术机制。
二、推理的两个阶段:prefill 计算密集 vs decode 显存带宽密集
理解大模型推理优化,必须先理解推理的两个截然不同的阶段——它们的计算特性、瓶颈、优化手段完全不同。
大模型生成文本是典型的自回归生成:每生成一个 Token,模型都要执行一次完整的前向计算。对于长度为 T 的序列,如果每次都重新计算全部历史 Token,注意力计算会产生大量重复工作。理想情况下,历史 Token 的 Key 和 Value 只计算一次,后续生成直接复用——这就是 KV Cache 的核心思想。
但 KV Cache 的引入让两个阶段呈现完全不同的特性:
- Prefill 阶段:一次处理完整输入提示词,适合批量矩阵计算,GPU 利用率较高,瓶颈在 GPU 计算能力。这个阶段的优化目标是并行度——把整个 prompt 一次性塞进 GPU 并行计算。
- Decode 阶段:每次只生成一个新 Token,但需要读取模型权重和历史 KV Cache,瓶颈在显存带宽。这是典型的内存带宽受限任务——GPU 大部分时间在等数据从显存搬到计算单元,而不是在计算。
这个区分的工程含义是:两个阶段需要不同的优化策略,甚至不同的硬件。Prefill 适合高算力 GPU,Decode 适合高带宽 GPU——这正是 PD 分离架构的物理基础。2026 年最先进的推理栈已经开始把 prefill 和 decode 物理分离到不同的硬件池上。
理解了这两个阶段,才能理解为什么不同的推理框架走出了完全不同的技术路线——vLLM 优化 prefill 的内存利用率,SGLang 优化 decode 的 KV Cache 复用,TensorRT-LLM 用 AOT 编译同时压榨两个阶段。
三、KV Cache 是命脉:PagedAttention vs RadixAttention 的两种哲学
KV Cache 是大模型推理的命脉——它既是速度的关键(避免重复计算),也是内存的瓶颈(随 batch × sequence length 线性增长)。一个 13B 模型在 2K 上下文下,每个用户的 KV Cache 就要占用约 1.5GB 显存。如何管理这块内存,决定了推理框架的核心能力。
PagedAttention(vLLM):把 KV Cache 当虚拟内存管
vLLM 的核心创新是 PagedAttention——把 KV Cache 当作操作系统的虚拟内存来管理。具体机制是:把 KV Cache 切分成固定大小的“页”(block),用一个间接寻址表管理,实现近乎零浪费的内存分配。
这个设计的工程价值在于解决了一个致命问题:KV Cache 内存碎片。传统方案需要为每个请求预分配一段连续显存,请求长度不一就会产生大量碎片——短请求留下的小块无法被长请求使用,显存利用率可能低于 50%。PagedAttention 的分页机制让任何请求的 KV Cache 都能分散存储在非连续的页中,显存利用率逼近 100%。
vLLM 在 2026 年的 V1 架构把客户端层与 GPU 执行循环拆成独立进程通过 ZMQ 通信,让 Python 端调度不再在高并发时吃掉 decode 时间。v0.25.0 让 Model Runner V2 成为所有 dense 模型的默认实现,删除了旧版 PagedAttention 实现。截至 2026 年 7 月,vLLM GitHub 星标 86,819。
RadixAttention(SGLang):用基数树复用共享前缀
SGLang 走了另一条路——它的核心创新 RadixAttention 在 PagedAttention 显存分页的基础上,新增了全局 KV Cache 前缀树复用能力。具体机制是用基数树(Radix Tree)组织缓存,共享相同开头的请求的缓存——就像家族树共享前面的枝干,只有内容分叉时才单独存储。
这个设计的工程价值在于:多轮对话、RAG 检索、Agent 工具调用这些场景天然有大量共享前缀。比如一个客服 Agent 每次对话都带着相同的系统提示+工具定义,传统方案每次都要重新计算这些前缀的 KV Cache——业内称之为“推理税”。RadixAttention 能自动识别这些公共前缀,跨请求、跨会话复用 KV Cache,把“推理税”降到几乎为零。
SGLang 0.5 版本在 2026 年 8 月发布,RadixAttention 的 KV Cache 复用效率提升约 23%,重复前缀命中率从 0.4 版本的 78% 提升到 92%。这个数据在多轮对话和 Prefix Caching 场景下尤其显著。
实测对比:吞吐 vs 延迟的取舍
把两个框架放一起测,差异非常清晰:
- 高吞吐场景(Llama-3-8B,A100 80GB,32 并发,128 token 提示):vLLM 吞吐 2,850 tok/s,SGLang 1,920 tok/s——vLLM 高出约 48%。vLLM 的内存管理效率也更高,相同负载下显存占用比 SGLang 低 15-20%。
- 低延迟复杂交互场景(5 轮历史多轮对话,共享前缀):vLLM 首 Token 延迟 380ms、端到端 3.5s;SGLang 首 Token 延迟 190ms、端到端 2.4s——SGLang 首 Token 延迟比 vLLM 低 50%,端到端延迟低 31%。这是因为 SGLang 能复用对话历史中的共享前缀,避免了重复计算。
- 长上下文场景(128K 上下文):vLLM 内存增长 +135%、速度衰减 47%;SGLang 内存增长 +115%、速度衰减 37%——SGLang 在长上下文下表现更稳定。
这组数据揭示了一个核心规律:vLLM 擅长处理大量独立请求(吞吐优先),SGLang 擅长处理共享前缀的批量请求或复杂交互(延迟优先)。选型不是选“谁更强”,而是选“你的场景瓶颈在哪”。
四、推测解码的“猜测-验证”范式:用小模型换大模型的速度
如果说 KV Cache 优化是在“避免重复计算”,推测解码则是在“并行验证”——用一个轻量级草稿模型批量预测若干候选 Token,再由目标模型一次性并行验证,在几乎不损失精度的前提下实现 2-3 倍端到端加速。
核心机制:从串行到并行的验证
传统自回归解码是严格串行的:Token 1 → Token 2 → Token 3 → Token 4,每个 Token 都需要一次完整前向传播。推测解码的核心思想是:小模型快速“猜”K 个 Token,大模型一次前向传播批量验证。猜对的直接接受,猜错的从错误点回退继续串行。
这个机制最巧妙的地方在于它是无损的——拒绝采样算法保证生成 Token 的概率分布与目标模型完全一致,输出与标准自回归解码在相同随机种子下逐字节相同。这意味着推测解码是纯粹的工程加速,不牺牲任何输出质量。
四种变体的工程取舍
2026 年主流的推测解码变体有四种,它们在“草稿来源”上各有取舍:
- 经典草稿模型:用一个独立的小模型生成候选。Llama 70B + Llama 7B 是典型配对。优点是无需特殊 checkpoint,缺点是需要额外显存(4-5GB+)。典型加速 2-3x。
- Medusa:在原模型顶部添加多个预测头(Multi-Head),每个头独立预测后续 Token,无需额外独立模型,约 2x 加速。优点是无 tokenizer 匹配问题、无额外 draft VRAM 开销;缺点是 heads 需要在冻结的 base 上微调,不能直接套用到任意 checkpoint。
- EAGLE:基于特征层自回归的草稿网络设计,通过捕捉模型的隐藏状态特征来提升草稿质量。因为共享 base model 的 hidden states,接受率达 85-90%+,而独立 draft model 只有 70-80%。EAGLE-2 和 EAGLE-3 进一步提升,最高可达 6.5x 加速。
- Lookahead Decoding:用 Jacobi 迭代维护一个 2D 窗口的“猜测”,一次性验证多条 Token 路径。无需额外模型、无需微调,但实现较复杂,加速上限约 1.5-2x。适合显存极其紧张的场景。
实测数据(8x H100 SXM5,Llama-3.1-70B)能说明这些变体的实际效果:
| 配置 | 吞吐 | 延迟 | 接受率 | 加速 |
|---|---|---|---|---|
| Baseline(无推测) | 28.4 tok/s | 35.2 ms | N/A | 1.00x |
| + Llama-3.2-1B Draft (K=3) | 61.2 tok/s | 16.3 ms | 78.4% | 2.15x |
| + Llama-3.2-1B Draft (K=5) | 76.8 tok/s | 13.0 ms | 72.1% | 2.70x |
| + Eagle-2 Tree Speculation (K=7) | 91.5 tok/s | 10.9 ms | 84.6% | 3.22x |
| + Prompt Lookup Decoding (PLD) | 52.3 tok/s | 19.1 ms | 58.2% | 1.84x |
接受率与温度的耦合
推测解码的效率高度依赖接受率,而接受率与采样温度直接耦合:
- 温度 0(贪婪解码):目标模型产生确定性分布,草稿可以精确匹配,接受率 70-85%;
- 温度 0.0-0.2:接受率高,吞吐加速最大(可达 3.2x);
- 温度 1.0:目标分布变宽,草稿不太可能命中相同样本,接受率降到 40-55%。
这意味着推测解码对代码生成、结构化输出、boilerplate 文本这类低温度场景收益最大,对创意写作、复杂推理这类高温度、不可预测场景收益较小。
批大小的自动门控
一个常被忽视的工程细节:所有主流推理引擎都会按批大小自动门控推测解码。当运行批次足够大,目标模型的前向传播从内存带宽受限变为计算受限时,验证步骤就不再是“免费”的,引擎会自动禁用推测。
vLLM、TensorRT-LLM、SGLang 都有这个可配置阈值。这意味着推测解码对交互式低并发端点(聊天、语音 Agent、实时 RAG)最有价值,对离线批处理任务价值最小。2026 年的生产实践推荐:把延迟敏感的实时交互流量(batch size 1-8)路由到启用推测的 vLLM 集群,把吞吐密集的离线批处理路由到非推测的 chunked prefill 集群。
五、量化精度演进:从 INT4 到 FP8 到 FP4 的硬件协同
量化是推理优化最直接的手段——用更低精度存储/计算权重(有时还有激活/KV Cache),在精度代价可控的前提下压缩内存、提升吞吐。但 2026 年的量化已不只是“压缩技巧”,而是决定硬件策略、成本结构、性能天花板的核心架构决策。
INT4(AWQ/GPTQ):把大模型塞进小显存
权重-only INT4 量化(AWQ、GPTQ)是把大模型塞进小显存的主流方案。它的价值在上一代硬件(A100 系列)上尤其突出——能把 70B 模型压到单卡可跑。但 INT4 有两个问题:会引入量化噪声、无法充分利用硬件 Tensor Core 的全部潜力。
FP8:Hopper/Blackwell 架构的游戏改变者
FP8(E5M2 和 E4M3 格式)在 Hopper 和 Blackwell 架构上改变了游戏。它提供接近 FP16 的保真度,内存只有一半,且通过硬件原生 FP8 Tensor Core 带来巨大性能提升——NVIDIA 称可比旧硬件提升数量级。
FP8 的工程价值在于它“近乎无损”——在多数场景下,FP8 推理的输出质量与 FP16 几乎无法区分,但吞吐和延迟显著改善。2026 年,FP8 已成为 Hopper/Blackwell 集群上的主流选择。
FP4:精度换算力的极致
NVIDIA Rubin R200 的 50 PFLOPS FP4(稀疏)、AMD MI400 的 40 PFLOPS FP4(密集)——FP4 正在成为下一代硬件的标配。精度换算力的逻辑是:模型越训越“低”,从 FP8 到 FP4 到 INT4,用更低的精度换取更高的算力密度。这对推理场景尤其有价值——推理对精度的容忍度高于训练。
量化与推测解码的复合加速
一个值得展开的工程实践:量化与推测解码可以叠加。以 INT4/FP8 量化的草稿模型做推测解码,配合 4-bit KV Cache 量化,能让单请求端到端延迟再降 30-50%。在 2026 年的生产实践中,这套“量化底座 + 推测加速 + KV Cache 压缩”的组合拳,正在成为延迟敏感型推理服务的标准配置。
六、结语:延迟战场的三块拼图
从 vLLM 与 SGLang 的架构之争,到推测解码的“猜测-验证”范式,再到 FP8/FP4 的精度换算力——2026 年推理优化的三条主线已经清晰:KV Cache 管理决定内存效率、推测解码决定单流延迟、量化精度决定算力密度。它们分别对应推理的三大物理约束:显存、带宽、算力。
对工程团队而言,选型的核心不是“哪个框架更强”,而是“我的场景瓶颈在哪”:吞吐优先选 vLLM,共享前缀与 Agent 场景选 SGLang,纯 NVIDIA 集群选 TensorRT-LLM;延迟敏感的实时流量开推测解码,离线批处理关闭;新一代硬件直接拥抱 FP8,下一代硬件提前布局 FP4。当推理从“秒级”走向“毫秒级”,真正拉开差距的,是对这三大物理约束的理解深度。