vLLM 首日接入 TML Inkling:千亿参数多模态模型的推理实战与性能优化
vLLM 首日支持 TML Inkling 模型,在 4 张 GB200 上实现 380 tok/s 推理速度,完整支持 1M 上下文、多模态输入及多项架构优化。
vLLM Blog · 2026年7月15日
vLLM 首日支持 TML Inkling 模型,在 4 张 GB200 上实现 380 tok/s 推理速度,完整支持 1M 上下文、多模态输入及多项架构优化。
智谱发布 GLM-5.2,首次在开源模型上实现稳定 1M 上下文,并在多个长链编码基准上媲美闭源顶级模型。
DeepSeek V4通过创新的KV缓存压缩和稀疏注意力机制,在vLLM上实现了百万Token超长上下文的高效推理,标志着长文本处理进入新阶段。