每GPU狂飙25000 tokens/秒,vLLM如何让Qwen3.5推理速度坐上火箭?
vLLM 团队利用 Blackwell 优化的 GDN 内核、混合状态传输和异步调度,将 Qwen3.5 的推理吞吐推至 25000 tokens/秒/GPU,背后的优化思路比数字更精彩。
vLLM Blog · 2026年8月6日
vLLM 团队利用 Blackwell 优化的 GDN 内核、混合状态传输和异步调度,将 Qwen3.5 的推理吞吐推至 25000 tokens/秒/GPU,背后的优化思路比数字更精彩。