万亿参数MoE模型首日上线:vLLM如何让Kimi K3跑得又快又稳?
vLLM在模型发布首日就实现了对万亿参数MoE模型Kimi K3的高效支持,通过混合缓存和推测解码等关键优化,为超大模型落地铺平了道路。
vLLM Blog · 2026年7月27日
vLLM在模型发布首日就实现了对万亿参数MoE模型Kimi K3的高效支持,通过混合缓存和推测解码等关键优化,为超大模型落地铺平了道路。
vLLM 首日支持 TML Inkling 模型,在 4 张 GB200 上实现 380 tok/s 推理速度,完整支持 1M 上下文、多模态输入及多项架构优化。
Inkling以万亿参数、原生多模态和1M上下文窗口,成为开源领域首个能同时原生处理图像、音频、文本的大模型,架构创新让高效推理与智能体应用成为现实。
腾讯混元将生产级高性能 Attention 和 MoE 算子贡献至 vLLM,在 H20 上针对混合长度解码和 MoE 模型实现最高 2.95 倍 attention 与 1.59 倍 MoE 加速,端到端推理延迟降低最高 24%。
艾伦人工智能研究所(AI2)发布EMO模型,通过创新的预训练方法,让混合专家(MoE)模型中的专家模块能按任务独立调用,仅用12.5%的专家即可保持接近完整模型的性能。