每GPU狂飙25000 tokens/秒,vLLM如何让Qwen3.5推理速度坐上火箭?
原文: vLLM Reaches 25K Total TPS/GPU on Qwen3.5
vLLM 团队利用 Blackwell 优化的 GDN 内核、混合状态传输和异步调度,将 Qwen3.5 的推理吞吐推至 25000 tokens/秒/GPU,背后的优化思路比数字更精彩。
- 通过针对 Blackwell 的 FlashInfer GDN 内核,Qwen3.5 的 SSM 层预填充速度最高提升 5.92 倍,端到端吞吐提升 13%。
- 混合注意力模型(Full-Attention + GDN)的分离式推理首次成熟,实现了 KV 缓存和 SSM 状态在异构节点间的高效传输。
- 异步调度中的竞态条件曾被误认为是无效特性,修复后吞吐提升 4.5%,现在默认开启。
- 整个优化过程展现了社区协作的力量,从内核到协议栈的多个 PR 共同支撑起 25K TPS/GPU 的里程碑。
Qwen3.5 是 2026 年初发布的大模型,至今仍在很多业务中扮演主力。但真正让它从“能跑”变成“跑得飞快”的,是 vLLM 社区最新公布的性能突破:在 GB200 NVL72 系统上,每张 GPU 能达到 25000 tokens/秒的总吞吐(Total TPS)。这个数字意味着什么?同等预算下,你可以服务更多用户、获得更低延迟,或者跑完一个离线批处理任务的时间缩短到原来的几分之一。
但比数字更有趣的,是达到这个性能背后的一系列技术决策。Qwen3.5 的特殊之处在于它的混合注意力架构:一部分层使用传统的 Full Attention,另一部分用 Gated Delta Network (GDN),一种类似 Mamba 的状态空间模型变体。这让推理工程团队面临两个直接挑战:如何加速 GDN 的计算,以及如何在分离式服务(将 Prefill 和 Decode 分开在不同节点上)中正确、高效地传输两种不同形态的状态。
第一关:让 GDN 在 Blackwell GPU 上跑出极限
GDN 的原始实现基于 Triton,通用性强但无法充分利用 Blackwell 架构的新特性。vLLM 社区提交了一个Blackwell 优化的 GDN 预填充内核(基于 FlashInfer),在 microbenchmark 上的提升幅度令人印象深刻:不同模型尺寸、并行配置和序列长度下,性能提升从 1.02 倍到 5.78 倍。集成到 vLLM 后,端到端预填充吞吐提升了 13%,用户感知的首 token 延迟(TTFT)也降低了 12%。这个优化对 Qwen3.5-397B 这样的大尺寸模型尤其关键,因为 GDN 层数占比很高,每一层都慢一点,总体就慢很多。
第二关:混合状态的跨节点传输
分离式推理的优势在于 Prefill 节点可以专心处理长上下文计算,Decode 节点负责生成,但两者之间需要传输模型状态。纯 Transformer 模型只需传输 KV Cache,而 Qwen3.5 还需要传输 GDN 层的卷积状态。vLLM 为此实现了双描述符视图和同构张量并行支持,让 Prefill 和 Decode 工作节点可以通过 NIXL 同时传输 Full-Attention 的 KV 缓存和 SSM 状态。这套机制还正确处理了不同层类的物理内存映射,将传输描述符数量从 4284 个减少到 1650 个,在 H100 小规模测试中吞吐就提升了约 7%。对 Qwen3.5 而言,专门的 GDN 支持补丁让这条传输链路彻底打通。
第三关:一个被误解的“异步调度”
异步 KV 块传输本应通过重叠通信和计算来提升吞吐,但在之前的版本中一旦开启,精度就会完全崩塌,导致这个功能一直被标注为“实验性”且几乎无人敢用。vLLM 团队最终定位到两个竞态条件问题:块传输完成信号与调度器状态更新不同步。修复后,异步调度不仅不再崩溃,还额外贡献了 4.5% 的吞吐增益。这个修复被直接设为默认开启,对很多用户来说,可能只是升级了 vLLM 版本就凭空省下了几块 GPU 的成本。
这揭示了一个深层趋势
25K TPS/GPU 不是一个孤立数字,它反映了推理引擎正在从“能跑所有模型”向“为热门模型极致优化”进化。就像编译器为特定 CPU 做矢量化一样,未来推理框架的竞争会越来越多地围绕少数几个主流模型进行垂直整合。对于开发者而言,这意味着:
- 关注硬件适配:Blackwell 内核的 5.92 倍提升说明,同样的模型在更新显存架构后,潜力可能远未被挖掘。及时跟进推理引擎的版本,可以避免在旧实现上花冤枉钱。
- 混合架构已成主流:从 Qwen3.5 到更多前沿模型,混合注意力/SSM 可能成为标配。确保你的服务栈支持这类模型的原生高效推理,否则几个月后性能差距会非常明显。
- 分离式服务不是“锦上添花”:随着长上下文 prompting 成本暴涨,分离 Prefill/Decode 几乎是必经之路。vLLM 给 Qwen3.5 铺平的这条路,任何同类模型都可以复用其基础设施。
最终,25K TPS/GPU 并不是某个天才的单点突破,而是内核、状态传输、调度三个层面协作的结果。它提醒我们:在 AI 工程化阶段,让一个模型跑得快需要整个社区持续半年的打磨,而你的竞争对手可能正在用同样的工具悄悄拉开成本优势。
分析由 BitByAI 生成 · 阅读原文