vLLM 首日接入 TML Inkling:千亿参数多模态模型的推理实战与性能优化
原文: TML Inkling on vLLM: Day-0 Support with Optimized Performance
vLLM 首日支持 TML Inkling 模型,在 4 张 GB200 上实现 380 tok/s 推理速度,完整支持 1M 上下文、多模态输入及多项架构优化。
- vLLM 首日支持 TML Inkling 模型,提供 NVFP4 和 BF16 两个版本
- 模型为 1T 参数多模态架构,原生支持文本、图像、音频输入,上下文长度达 100 万 token
- 采用相对注意力机制、短卷积和专家汇聚等创新设计,提升长上下文效率
- 在 4 张 GB200 GPU 上实现 380 tok/s(含推测解码)和 140 tok/s(无推测解码)的推理性能
- 完整支持 LoRA、多种并行策略、前缀缓存、解耦服务等高级特性
这件事为什么现在值得聊?
在 AI 推理基础设施领域,vLLM 已经成为事实上的标准框架。当 TML(Thinking Machines Lab)发布 1T 参数的多模态大模型 Inkling 时,vLLM 团队没有等待,而是直接实现了"Day-0"首日支持。这意味着模型发布当天,开发者就能用 vLLM 跑起来,而且不是勉强能用,是带着性能优化和完整功能一起上的。这种响应速度背后,反映的是 AI 基础设施正在从"事后适配"转向"同步演进"。
Inkling 到底有什么特别?
Inkling 不是又一个堆参数的模型。它在架构上做了几个有意思的设计:首先是 100 万 token 的超长上下文,但靠的不是暴力堆算力,而是用滑动窗口注意力配合相对位置编码,让长文本处理变得高效。其次是短卷积(sconv)的激进使用,每个层里塞了四个小卷积模块,相当于在局部加了"微型注意力",计算和内存开销却很小。最特别的是"专家汇聚"(expert sink)机制:两个共享专家参与路由打分但不参与 top-6 选择,相当于给模型加了个"概率吸收器",让专家路由更稳定。
性能数据说明了什么?
在 4 张 GB200 GPU 上,开启推测解码(MTP)能达到 380 tok/s/用户,不开也有 140 tok/s。这个数字对 1T 参数模型来说相当能打。更重要的是,vLLM 不是简单地把模型跑起来,而是做了 Sconv 感知的张量并行切分、低延迟融合通信、内核融合、多流执行等一系列底层优化。这说明推理框架的竞争力已经从"能不能跑"升级到"怎么跑得又快又稳"。
这对开发者意味着什么?
如果你在做多模态应用,Inkling 原生支持文本、图像、音频输入,而且上下文直接拉到 100 万,意味着你可以把整个项目文档、历史对话、甚至音频会议记录一次性塞进去。vLLM 还提供了 LoRA、前缀缓存、解耦部署等企业级特性,配合 NVFP4 量化版本,在保持精度的同时大幅降低显存占用。对于想快速验证多模态长上下文场景的团队来说,这是一套开箱即用的方案。
一个容易被忽略的趋势
大多数人只关注模型参数和基准测试分数,但真正决定落地速度的是基础设施的"首日支持"能力。vLLM 这次不仅接入了模型,还同步验证了工具调用解析、函数调用准确性,并且跑通了 MMAU、MMMU-Pro 等多个评测。这揭示了一个深层趋势:模型发布和推理部署正在从"先后关系"变成"并行工程"。未来,谁能第一时间把新模型变成稳定可用的服务,谁就掌握了应用落地的节奏。
原文地址: TML Inkling on vLLM: Day-0 Support with Optimized Performance
分析由 BitByAI 生成 · 阅读原文