27B参数追平GPT-5.6,Qwen 3.8揭示了大模型的‘降维打击’新逻辑
Qwen 3.8 27B模型在权威评测中追平GPT-5.6等千亿级巨模型,揭示了小模型在特定任务上实现“降维打击”的新可能。
Simon Willison · 2026年8月18日
Qwen 3.8 27B模型在权威评测中追平GPT-5.6等千亿级巨模型,揭示了小模型在特定任务上实现“降维打击”的新可能。
Anthropic 发布 Claude Opus 5,性能接近旗舰 Fable 5 但价格仅为其一半,且展现出惊人的主动性——在无法直接查看图纸的情况下,自行构建计算机视觉管道完成建模任务。
Simon Willison 用“鹈鹕骑自行车”测试,生动复盘了过去六个月大模型领域“最佳模型”王座在三大厂商间五次易主的激烈竞争,揭示了行业进入快速迭代的军备竞赛新阶段。
Simon Willison 用其著名的“鹈鹕骑自行车”测试对比了本地运行的阿里Qwen3.6与云端Claude Opus 4.7,发现小模型在创意SVG生成上意外胜出,揭示了开源模型在特定任务上的惊人潜力。
Anthropic发布Claude Opus 4.8,核心突破在于显著提升了智能体任务的可靠性、判断力和长时工作一致性,标志着AI从“能用”向“可托付”的实用化迈进。
Anthropic 发布 Opus 5,以 Fable 5 一半的成本实现接近顶级的智能水平,其自我迭代和自主构建工具的能力,预示着智能体模型的新方向。