← 返回首页 — vLLM Blog — 进阶
Agent框架 · 深度解读 · IMPACT 8/10

2.4万亿参数开源模型上线,vLLM Day 0 支持 Qwen3.8 意味着什么?

原文: Day 0 Support for Qwen3.8-2.4T-A95B on vLLM

vLLM 在发布日就原生支持了通义千问 2.4 万亿参数的开源大模型 Qwen3.8,展现了开源推理框架与前沿模型同步进化的速度。

核心要点
  • 通义千问发布了 Qwen3.8,这是一个 2.4 万亿参数的混合专家(MoE)模型,也是 Qwen 家族首个开源的 Max 级别模型。
  • vLLM 在模型发布当日即提供原生支持,无需修改架构,展现了开源推理引擎的成熟度。
  • 官方和第三方(Inferact)提供了 FP8、BF16 以及 FP4(NVFP4, MXFP4)多种量化版本,其中 FP4 版本在主流测试中精度损失极小,且对硬件要求更低。
  • 该模型采用了 Qwen 3.5 架构,混合使用了全注意力层和线性注意力层,并针对 NVIDIA 和 AMD 硬件进行了深度内核优化。
深度解读

通义千问(Qwen)发布了其开源模型家族的最新力作 Qwen3.8-2.4T-A95B,一个拥有 2.4 万亿参数的庞然大物。然而,比模型参数更引人注目的,或许是推理框架 vLLM 在发布当天(Day 0)就宣布了对其的原生支持。这件事看似只是一则工具更新日志,但它背后揭示了开源 AI 生态正在发生的深刻变化:模型厂商和推理框架不再是简单的上下游关系,而是进入了深度绑定的“共生进化”阶段。

为什么一个 2.4T 的模型这么重要?

首先,这不再是实验室里的玩具。Qwen3.8 被定位为首个开源的“Qwen-Max 级别”模型,这意味着它直接对标此前只能通过 API 调用的顶级闭源模型。它采用了稀疏的混合专家(MoE)架构,拥有 512 个专家,但每次推理只激活其中一部分。更有趣的是其架构细节:在 92 层的骨干网络中,它混合使用了传统的全注意力和更高效的线性注意力(Linear Attention)。这种设计代表了一种趋势:为了支撑万亿参数的规模,模型架构正在从“力大砖飞”的暴力计算,转向更精细化的效率工程。

vLLM 的 Day 0 支持意味着什么?

“Day 0 支持”意味着模型一发布,用户立刻就能用 vLLM 跑起来,无需等待社区适配或手动修改代码。这背后有两点值得玩味:

  1. 架构的成熟与收敛:文章明确提到,Qwen3.8 复用了 Qwen 3.5 的架构。这说明 Qwen 的模型架构已经相对稳定,不像早期模型那样频繁变动。对于开发者而言,这意味着学习成本降低,工具链的稳定性在提升。你的优化经验、你的推理脚本,不会因为模型小版本迭代就完全失效。

  2. 硬件厂商的深度介入:本次支持并非 vLLM 一方的功劳,而是与 NVIDIA、AMD 两大硬件巨头“三方联合开发”的结果。vLLM 博客里详细列出了为线性注意力、MoE 路由等开发的“超快内核”。这揭示了一个深层趋势:推理框架正成为连接模型与硬件的关键中间件,而硬件巨头们也乐意下场,确保自家芯片在跑前沿模型时拥有最佳性能。 这意味着,选择 vLLM 这样的主流框架,实际上也是在享受整个硬件生态的优化红利。

FP4 量化:真正的“平民化”关键

虽然模型参数高达 2.4 万亿,但对普通开发者和企业来说,真正重要的是“能不能跑得起”。文章中提到的 FP4 量化版本(NVFP4 和 MXFP4)是解决这个问题的关键。官方数据显示,在 GSM8K 和 AIME25 等数学推理测试中,FP4 量化版本的精度甚至略高于 FP8 版本(可能得益于更高的推理预算)。这意味着,模型的能力上限,正在与部署成本脱钩。 以前你需要顶级服务器集群才能享受的智能,现在通过高效量化,有望在更普及的硬件上实现。

对你有什么实用价值?

如果你是一名 AI 开发者或技术负责人,这次事件的价值在于:

  • 评估模型时,要看生态支持度:一个强大的模型,如果推理效率低下、部署复杂,其实际价值会大打折扣。像 Qwen3.8 这样在发布日就获得主流框架和硬件厂商全方位优化的模型,在实际项目中的落地可行性显然更高。
  • 关注量化技术:不要只盯着模型参数看。FP4 等低精度量化技术正在快速成熟,它能显著降低你的 GPU 内存需求和推理成本。在规划算力时,可以更激进地考虑量化方案。
  • 拥抱主流开源框架:vLLM 与模型、硬件厂商的紧密合作表明,选择生态位稳固的开源推理框架,是获得持续性能收益和兼容性保障的最省力方式。

原文地址: Day 0 Support for Qwen3.8-2.4T-A95B on vLLM

分析由 BitByAI 生成 · 阅读原文

原文来自 vLLM Blog · 由 BitByAI 自动解读