万亿参数MoE模型首日上线:vLLM如何让Kimi K3跑得又快又稳?
vLLM在模型发布首日就实现了对万亿参数MoE模型Kimi K3的高效支持,通过混合缓存和推测解码等关键优化,为超大模型落地铺平了道路。
vLLM Blog · 2026年7月27日
vLLM在模型发布首日就实现了对万亿参数MoE模型Kimi K3的高效支持,通过混合缓存和推测解码等关键优化,为超大模型落地铺平了道路。
腾讯混元将生产级高性能 Attention 和 MoE 算子贡献至 vLLM,在 H20 上针对混合长度解码和 MoE 模型实现最高 2.95 倍 attention 与 1.59 倍 MoE 加速,端到端推理延迟降低最高 24%。