← 返回首页 — Simon Willison — 进阶
模型公司 · 深度解读 · IMPACT 7/10

一只骑自行车的鹈鹕,揭开中国最贵大模型的野心

原文: Kimi K3, and what we can still learn from the pelican benchmark

Kimi K3 以 2.8T 参数和远超同侪的价格亮相,挑战了“中国模型必低价”的刻板印象,其 SVG 生成能力更揭示出评估 AI 的新维度。

核心要点
  • Kimi K3 成为目前参数最大的开放权重模型,在多项基准测试中逼近或超越顶级闭源模型
  • 定价策略一反常态,输入输出价格对标 Claude Sonnet,不再走低价路线
  • Simon Willison 用“鹈鹕骑单车”SVG 测试,发现模型在复杂生成任务上表现惊艳,但成本不菲
  • 中国 AI 实验室正从“性价比优先”转向“能力优先”,开源与闭源之争进入新阶段
深度解读

当硅谷还在围着各色榜单争论模型排名时,Simon Willison 一如既往地祭出了他的秘密武器:一只骑自行车的鹈鹕。这个看似无厘头的 SVG 生成测试,意外地丈量出了 Kimi K3 的深浅。

就在今晨,Moonshot AI 正式发布了他们口中的“最强模型” Kimi K3——2.8 万亿参数,暂居开放权重模型尺寸之冠,并豪言将在 7 月 27 日开源。更令人玩味的是它的定价:输入每百万 token 3 美元,输出 15 美元,直接看齐 Anthropic 的 Claude Sonnet 系列,成为有史以来最贵的中国大模型。这对习惯了“中国模型 = 廉价”的开发者来说,无疑是一次认知冲击。

模型能力的“鹈鹕透视” Willison 那条“生成一只骑自行车的鹈鹕 SVG”指令,不仅是在考验代码生成,更是在检验模型对复杂约束、比例协调以及细节描摹的综合理解。K3 交出的答卷令人惊叹:一辆构造精细的脚踏车,一只有着生动翅膀和憨态可掬的鹈鹕。然而这次创作花费了 16658 个输出 token(其中近八成是推理 token),成本高达 25 美分。这不禁让人思考:在评估大模型时,我们是否过度依赖数字化的跑分,却忽略了真实场景下的代价与产出?K3 恰恰说明,顶级生成能力背后往往是巨大的算力投入,而这种投入正从实验室传导到付费用户身上。

中国大模型的“向上跃迁” 继 DeepSeek 以 1.6T 参数和超高性价比震撼市场后,Kimi K3 选择了一条更激进的路:用更大的参数、更高的精度去正面硬刚 GPT-5.5 和 Claude Opus 4.8。虽然在一些综合榜单上仍稍逊于多模态融合的 Fable 5,但在前端代码生成等垂直领域,K3 已悄然登顶。这揭示了一个深层趋势:中国 AI 实验室不再满足于做“够用”的廉价模型,而是要通过技术溢出重塑品牌溢价,向价值链上游进军。

与此同时,K3 承诺在两周内开源,延续了中国阵营“开放”的底色。此举不仅能吸引全球开发者生态,更在战略上将开源模型与闭源巨头的竞争推向白热化。当模型能力逼近同级别闭源产品,而透明度和可定制性又远超对方时,商业格局必将松动。

给开发者的三个实用判断

  1. 切勿唯跑分论英雄。正如鹈鹕例子所示,真实任务的表现、输出风格和稳定性,远比抽象的 Elo 分数更有参考价值。建议在自己的具体场景中做横向盲测。
  2. 成本计算要动态考量。K3 的价格虽高,但如果能用更少的输出 token 完成任务,实际花费未必比便宜模型多。反过来说,如果任务需要长链推理,一定要留意推理 token 的隐性消耗。
  3. 策略性混用模型。顶级模型用于核心代码生成或高价值分析,常规查询则可调用成本更低的轻量级模型,这样既能保证质量,又不让账单失控。

Kimi K3 的出现或许不会立刻改变你的技术栈,但它预示着一种范式更迭:中国大模型正在撕掉“低价替代品”的标签,以更自信的定价和更开放的姿态,在全球 AI 棋盘上落下关键一子。而那只鹈鹕,只是这场巨变中一个幽默的注脚。


原文地址: Kimi K3, and what we can still learn from the pelican benchmark

分析由 BitByAI 生成 · 阅读原文

原文来自 Simon Willison · 由 BitByAI 自动解读