← 返回首页 — Simon Willison — 进阶
工具链 · 深度解读 · IMPACT 7/10

Qwen 3.8 27B 默认「深度思考」,是天才设计还是愚蠢透顶?

原文: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

Qwen 3.8 27B 模型性能强大,默认开启最高级别深度推理,但导致简单任务也极度耗时。

核心要点
  • Qwen 3.8 27B 是一个 270 亿参数的开源多模态模型,性能基准测试表现优异
  • 模型默认开启最高级别的深度推理(xhigh),导致过度思考
  • 在消费级硬件上,默认设置会让简单任务(如生成 SVG)耗时长达 21 分钟
  • 模型提供了不同级别的推理深度设置,需要用户手动调整以平衡速度和质量
深度解读

为什么这件事值得聊? 阿里 Qwen 团队发布的 Qwen 3.8 27B 开源模型,在基准测试上表现亮眼,甚至超越了自家之前的闭源模型。这本身就是一个值得关注的信号:开源小模型正在逼近甚至超越闭源大模型。但更有趣的是,知名开发者 Simon Willison 的实际体验揭示了一个更深层的问题——模型默认配置与用户实际需求之间的巨大鸿沟

核心问题:默认的「深度思考」是天才还是愚蠢? 这款模型默认开启了 xhigh 级别的推理深度。这意味着,即使是「画一只鹈鹕骑自行车的 SVG 图」这样简单的任务,模型也会动用 2.2 万个推理 token,花 21 分钟来「深度思考」。结果呢?SVG 确实画得非常好,细节精准,但这个时间成本对于一个本地运行的 17GB 模型来说,完全不可接受。

这就像你让一个天才数学家去超市买菜,他却花了半小时在收银台前心算最优折扣组合。结果是精确的,但完全没必要。

这揭示了什么趋势?

  1. 模型的「能力」与「可用性」正在分离。 研究团队追求更强的基准分数,往往会默认开启最耗资源的功能。但这对普通用户,尤其是消费级硬件用户,可能是灾难。这不再是「模型强不强」的问题,而是「默认配置傻不傻」的问题。
  2. 用户需要成为模型的「调教师」。 模型提供了 xhighmediumlow 三档推理深度。这意味着,用好一个本地模型,不仅需要硬件,更需要知道「什么时候用什么档位」。这是一个新的认知负担。
  3. 本地部署的「甜蜜点」在变化。 27B 参数在笔记本上跑起来很酷,但如果默认配置导致一个任务要等 21 分钟,那它的实用价值就大打折扣。这迫使用户和工具开发者(如 LM Studio)必须更智能地管理上下文长度和推理参数。

对你有什么用?

  • 如果你打算尝试这个模型: 请立刻手动将推理深度设置为 mediumlowxhigh 仅适用于你愿意花很长时间等待的复杂分析任务。
  • 如果你是开发者: 这提醒你,在集成任何新模型时,绝对不要盲目信任默认参数。必须测试不同配置下的延迟和质量权衡,并为用户提供简单的切换开关。
  • 更宏观地看: AI 模型的「易用性」正在成为下一个战场。谁能提供更聪明的默认配置、更自动化的参数调节,谁就能赢得本地部署用户的心。毕竟,用户想要的是好用的工具,不是需要反复调试的实验室产品。

Simon Willison 的这篇文章,用一个极其生动的例子告诉我们:一个模型好不好,不仅看它的天花板有多高,更要看它的默认状态有多蠢。


原文地址: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

分析由 BitByAI 生成 · 阅读原文

原文来自 Simon Willison · 由 BitByAI 自动解读