← 返回首页 — vLLM Blog — 进阶
工具链 · 深度解读 · IMPACT 8/10

万亿参数MoE模型首日上线:vLLM如何让Kimi K3跑得又快又稳?

原文: Kimi K3 Is Here: Efficient Day-0 Support on vLLM

vLLM在模型发布首日就实现了对万亿参数MoE模型Kimi K3的高效支持,通过混合缓存和推测解码等关键优化,为超大模型落地铺平了道路。

核心要点
  • Kimi K3是一个2.8万亿参数的混合专家(MoE)模型,上下文窗口达100万token。
  • vLLM在模型发布首日(Day-0)就提供了完整的生产级支持,包括工具调用和结构化输出。
  • 通过与Inferact合作,vLLM集成了DSpark推测解码,将单用户推理速度提升至370 tok/s。
  • vLLM重新设计了混合前缀缓存系统,以适配Kimi K3的混合注意力架构,该设计将惠及所有类似架构的模型。
深度解读

起因:为什么一个模型发布值得专门写篇工程博客?

上周,Moonshot AI 预览了其万亿参数模型 Kimi K3 的架构,本周模型权重正式开源。但对开发者而言,一个模型再强大,如果不能高效地跑起来,就是纸面数据。所以,真正的新闻不是模型本身,而是推理引擎 vLLM 在模型发布的同一天,就拿出了可用的、经过深度优化的生产级支持。这揭示了一个深层趋势:大模型竞争的焦点,正从“训出更大的模型”快速转向“如何把模型又快又稳地用起来”。

拆解:vLLM 究竟做了什么,让 Day-0 支持成为可能?

Kimi K3 的架构有几个硬骨头:2.8万亿参数的MoE(混合专家模型)、混合了线性注意力(KDA)和全注意力的架构、以及100万token的超长上下文。这对推理引擎是全方位的挑战。vLLM 团队的工作,可以理解为为这辆“超跑”定制了一整套专属的赛道和加油策略。

  1. 混合缓存管理:这是最核心的工程创新。传统的注意力模型用KV缓存,但Kimi K3的线性注意力层用的是固定大小的循环状态。vLLM 为此设计了一个能同时管理这两种不同状态的“混合KV缓存管理器”。这就像一个仓库管理员,既要管好按需增长的货架(全注意力KV缓存),又要高效维护一组固定数量的精密设备(循环状态)。这个改动不仅解决了Kimi K3的问题,还让vLLM对所有未来可能出现的混合线性架构模型都做好了准备。

  2. 推测解码的深度集成:vLLM 与 Inferact 合作,训练并开源了一个名为“DSpark”的推测解码器。简单来说,它就像给模型配了一个“速记员”,先快速猜出后面几个可能的词,然后让主模型一次性验证,从而大幅提升生成速度。实测数据显示,启用DSpark后,单用户推理速度从118 tok/s飙升到370 tok/s,提升了3倍多。这是典型的“用算法换算力”的思路,让昂贵的GPU能产出更多token。

  3. 生产功能一步到位:除了基础推理,vLLM 在首日就支持了工具调用、推理输出解析、结构化输出等对构建Agent应用至关重要的功能。这意味着开发者拿到模型权重后,立刻就能着手开发能调用工具、有推理能力的AI Agent,而不是等待社区适配。

趋势洞察:推理引擎正在成为大模型落地的“隐形战场”

这件事告诉我们几个关键趋势:

  • MoE 成为主流,推理优化是关键:像Kimi K3这样的MoE模型,参数量巨大但每次推理只激活一小部分,能效比高。但要发挥其优势,推理引擎必须能高效处理专家路由、负载均衡和稀疏激活。vLLM 的深度支持证明了,只有引擎层跟上,MoE模型才能真正普及。
  • Day-0 支持成为竞争力指标:以前,新模型发布后,社区需要几周甚至几个月时间来适配推理框架。现在,vLLM 展示了在发布日就能提供生产级支持的能力。这背后是团队与模型厂商的深度、前置合作。未来,模型发布方与推理引擎团队的协同,将决定模型生态能多快繁荣起来。
  • 推理性能优化进入“深水区”:简单的算子优化已经不够,现在需要针对特定模型架构(如混合注意力)进行缓存系统、解码策略等系统级的重新设计。优化工作越来越“定制化”和“架构感知”。

实用价值:对你意味着什么?

  • 如果你是开发者:这意味着你可以第一时间尝试用Kimi K3构建高性能的AI应用,无论是长文档分析、多模态理解还是复杂Agent。vLLM 提供了经过验证的Docker镜像和部署方案,降低了试错成本。
  • 如果你是技术负责人:在选择模型时,除了看基准测试分数,必须将“推理引擎的成熟度和支持速度”纳入关键评估维度。一个模型再好,如果部署和运维成本高昂、性能不达标,也无法产生价值。
  • 如果你关注AI基础设施:vLLM 的工作展示了开源社区在推理侧的关键作用。它不仅是工具,更是定义下一代模型如何被使用的事实标准。它的架构决策(如混合缓存)很可能影响未来其他推理框架的设计。

反常识/意外

很多人可能以为,万亿参数模型只有英伟达的顶级GPU才能跑。但vLLM 的支持列表里赫然包括了AMD的MI355X GPU。这表明,大型模型的推理正在摆脱对单一硬件平台的依赖,AMD等竞争对手正在通过与核心推理框架合作,积极切入高端AI推理市场。这对降低算力成本、避免硬件垄断是好消息。


原文地址: Kimi K3 Is Here: Efficient Day-0 Support on vLLM

分析由 BitByAI 生成 · 阅读原文

原文来自 vLLM Blog · 由 BitByAI 自动解读