GPT-5.6 Luna 降价 80% 背后:AI 开始自己优化自己了
原文: Advancing the price-performance frontier with GPT‑5.6
OpenAI 用 GPT-5.6 Sol 优化自身推理,让 Luna 模型成本骤降 80%,首次在廉价市场击败谷歌,揭示了 AI 自我优化的产业趋势。
- GPT-5.6 Luna 输入价格降至 $0.20/百万 token,比 Google Gemini 3.1 Flash-Lite 更便宜
- 成本下降源于 GPT-5.6 Sol 重写了底层 GPU 核心代码,减少 20% 的服务开销
- AI 巨头竞争正从「能力对抗」转向「性价比肉搏」,AI 自我优化成为新武器
- 开发者能以更低成本构建高吞吐应用,但需持续跟踪模型性价比的动态变化
起因:Luna 降价 80%,发生了什么? OpenAI 突然宣布 GPT-5.6 Luna 模型大幅降价:输入价格从 $1/百万 token 降至 $0.20,输出从 $5 降至 $1.20。降幅高达 80%,这让它直接比谷歌的 Gemini 3.1 Flash-Lite($0.25/$1.50)更便宜,也彻底甩开了 Anthropic Claude Haiku 4.5($1/$5)。知名开发者 Simon Willison 立刻将自己 agent 演示站点从谷歌模型切换到了 Luna。这背后并不是简单的促销,而是 OpenAI 用「魔法」打败了竞争对手——他们让 AI 自己优化了自己的底层代码。
拆解:AI 如何给自己「砍成本」? 大语言模型的推理可以想象成一条复杂流水线:每次生成一个 token,都需要成千上万次矩阵运算,这些运算由底层 GPU 核心代码(kernel)执行。过去,优化这些核心代码是性能工程师的苦活,但如今 OpenAI 训练了一个叫 GPT-5.6 Sol 的模型,让它来干这件事。 Sol 扫描了整个推理过程,找出能让 GPU 更高效运行的机会:比如哪些计算可以提前做好、哪些可以完全跳过、哪些可以并行处理。更关键的是,它直接重写了 OpenAI 生产环境中实际运行的 GPU 核心代码——用一种叫 Triton 和 Gluon 的编程语言。最终,端到端的服务成本降低了 20%。换句话说,OpenAI 用自己最聪明的模型,给相对便宜的模型开了一条低成本绿色通道。
趋势洞察:价格战转向「效率战」,AI 进入自我优化时代 这看似是一次普通降价,实则揭示了两个深层变化。 第一,AI 巨头的竞争焦点正从「谁能考更高分」变为「谁更会省钱」。能力差距逐渐缩小后,性价比成了争夺开发者的关键战场。OpenAI 用前沿模型(Sol)去优化经济型模型(Luna),形成了一套「智力溢出」降本体系——高端模型的研发成本可以通过优化低端模型来分摊,甚至反哺整个产品线。 第二,AI 自我优化(AI improving AI)从概念走向工程实践。过去我们谈论 AI 设计芯片、AI 写代码,如今它直接优化自身的运行效率,形成闭环。这可能会引发一个螺旋式下降的成本曲线:更好的模型 → 更强的优化能力 → 更低的推理成本 → 吸引更多用户和数据 → 再次提升模型能力。对于行业来说,这意味着 AI 服务的商品化会加速,中小团队也能以极低价格获得顶级能力,而跟不上效率浪潮的厂商会被淘汰。
实用价值:开发者该怎么想、怎么做? 这次降价对开发者有直接利好:个人开发者或初创团队可以零成本切换,立刻减少 80% 的 token 花销,尤其适合高并发 agent、聊天机器人等场景。但要注意两点:一是降价后模型能力是否「缩水」虽然官方未提及,但实际使用时仍需对比测试;二是价格变动频繁,以前 Lun 和 Haiku 同价,现在相差 5 倍,选型不能再只看模型名,而要建立对性价比的动态监控。长远看,学会根据价格信号自动切换模型服务,或许会成为一项有价值的工程能力。
反常识:别只盯着降价,看 AI 的「自指」进化 让人意外的是,OpenAI 这次在廉价模型上战胜了向来以低价著称的谷歌,而武器竟是「用自家高端模型优化低端模型」。更耐人寻味的是,AI 优化 AI 这件事类似于编译器自我编译——一种古老但强大的范式。当 AI 学会改进自己的运行基座,我们就不能再把它仅仅看作一个工具,它正在变成一套可以自我进化的基础设施。
分析由 BitByAI 生成 · 阅读原文