4位量化不再‘伤筋动骨’:Liquid AI 如何让小模型在边缘设备上‘无损’运行
Liquid AI 通过‘量化感知蒸馏’技术,在4位量化下恢复了97%的精度损失,让边缘设备运行大模型时速度更快且质量不打折。
Hugging Face Blog · 2026年8月19日
Liquid AI 通过‘量化感知蒸馏’技术,在4位量化下恢复了97%的精度损失,让边缘设备运行大模型时速度更快且质量不打折。
vLLM 在发布日就原生支持了通义千问 2.4 万亿参数的开源大模型 Qwen3.8,展现了开源推理框架与前沿模型同步进化的速度。
vLLM 首日支持 TML Inkling 模型,在 4 张 GB200 上实现 380 tok/s 推理速度,完整支持 1M 上下文、多模态输入及多项架构优化。