推理速度飙升3倍:Liquid AI的DSpark如何让大模型“边想边验证”?
Liquid AI为LFM2.5系列模型发布DSpark草稿模型,通过推测解码技术,在不损失输出质量的前提下,将推理速度提升高达3.2倍。
Hugging Face Blog · 2026年8月21日
Liquid AI为LFM2.5系列模型发布DSpark草稿模型,通过推测解码技术,在不损失输出质量的前提下,将推理速度提升高达3.2倍。
vLLM 开源支持 P-EAGLE 等并行推测解码算法,打破自回归草稿生成瓶颈,实现更高接受率与更简化的工程调参。
EAGLE-3 在 AMD GPU 上通过 vLLM 实现端到端推测解码,在保持模型输出无损的前提下,显著提升 Kimi-K2.5 等大模型推理速度,为开发者提供了一种实用的推理加速新选择。
vLLM 的推测解码训练框架 Speculators v0.5.0 引入了 DFlash 算法,它通过单次前向传播生成草稿令牌,显著降低了推理延迟,并统一了在线与离线训练流程。