GPT-5.6 Luna降价80%:AI开始自己写代码优化自己,模型定价逻辑彻底变了
原文: GPT-5.6 Luna 80% price drop: AI now writes code to optimize itself, rewriting model pricing logic
OpenAI大幅降价不只是价格战,而是用更聪明的模型(Sol)重写了底层推理内核,成本直降20%,这揭示了一个新趋势:AI正在成为自己基础设施的优化师。
- GPT-5.6 Luna输入价格降至$0.20/M token,比Gemini 3.1 Flash-Lite还便宜,一夜之间成为性价比之王
- 成本骤降的关键不是传统工程优化,而是用GPT-5.6 Sol自主重写了Triton/Gluon内核代码,减少GPU闲置
- 这预示着模型迭代将同时提升智能和推理效率,未来更强大的模型反而可能更便宜
- 对开发者而言,模型选择不再只看能力,更要关注同等智能水平下的成本结构,应用架构需要跟随价格变化动态调整
你可能已经习惯了模型价格每隔几个月就砍半的节奏,但今天OpenAI这记重拳还是让人一震:GPT-5.6 Luna降价80%,输入价格从$1.00降至$0.20每百万token,甚至比Google以低价著称的Gemini 3.1 Flash-Lite还便宜。不过,真正值得关注的不是降价本身,而是降价的方式——OpenAI用另一个AI模型(GPT-5.6 Sol)优化了Luna的底层推理代码,把GPU利用率提到了新高度。
AI 写代码,让 GPU 别闲着
根据OpenAI的技术说明,他们把Sol用在了两个地方:一是模型服务的负载均衡,这还相对常规;更惊艳的是第二个——让Sol直接改写模型前向传播的计算内核。用通俗的话说,现代大模型推理时,GPU经常因为内存搬运、同步等待、数据布局低效而空转,即便单个操作很快。Sol像个经验丰富的老工程师,自动找出哪些计算可以预先做、哪些可以避免、哪些能并行,然后用Codex能力重写了基于Triton和Gluon(OpenAI维护的两种开源GPU编程语言)的生产级内核代码。这一步直接让端到端服务成本降低了20%。
这听起来像科幻,但已经是现实:一个AI模型给另一个AI模型写底层逻辑,最终让后者运行成本大降。它揭示的趋势远比一次降价深刻。
价格战的背后是“模型自优化”的军备竞赛
过去模型降价主要靠规模效应和硬件进步,但天花板很低。现在头部实验室开始把前沿模型的智能反哺给基础设施层——用更强的模型去优化较弱(或同等)模型的部署效率。这意味着什么?未来模型迭代可能同时带来两个方向的提升:更聪明,且推理成本更低。这彻底颠覆了“越大越贵”的直觉。比如,Anthropic的Claude Haiku 4.5现在输入价格是$1.00,输出$5.00,已经是旧时代的定价;Luna不仅便宜得多,还有望很快追上甚至超越Haiku的能力。当价格不再是线性约束,应用场景会爆炸。
开发者该怎么想?
首先,模型的选择不能再静态地看“哪个能力最强”。你应该建立一个动态评估框架:同等任务成功率下,哪个模型的成本最低?而且这个答案会随着每次降价快速过时。像Simon Willison那样,看到Luna降价后就立刻把自己的agent演示站从Gemini Flash-Lite切过来,就是很好的实务思维——你的系统应该能灵活切换底层模型,只要API兼容。
其次,成本结构变了,产品设计也可以更大胆。以前因为推理太贵而不敢上的“多次调用”“实时重试”“复杂链式推理”等模式,现在可能边际成本趋近于零。你的想象力,而不是预算,会成为创新的瓶颈。
一个容易被忽略的细节:代码是模型写的,但语言是OpenAI的
Sol之所以能写出高效内核,很大程度上得益于它熟悉Triton和Gluon——两者都由OpenAI主导。这形成了一个微妙的技术护城河:模型自优化不仅是能力溢出,更是生态锁定。Google、Anthropic如果想跟进,可能需要在自己控制的软件栈上实现类似循环。未来“谁的工具链更能被自家模型优化”可能成为新的竞争维度。
总之,Luna降价不是一次简单的促销,而是AI工业化的标志性事件:AI开始动手改造自己的生产机床了。以后我们或许会看到更多这样的故事——模型能力每进一步,基础设施成本就自动跟着降一截。在这个新规则下,最值得投资的不是模型,而是能持续吸收这些红利的应用架构。
原文地址: GPT-5.6 Luna 80% price drop: AI now writes code to optimize itself, rewriting model pricing logic
分析由 BitByAI 生成 · 阅读原文