GPT-5.6 Luna 输入价格从 $2.50 跌到 $0.20,且是永久调整。这不是又一次模型更新——它意味着企业「用哪个模型」的决策前提已经被改写。
2026 年 8 月 4 日,OpenAI 工程师 Tibo 在 X 上发了一条澄清推文:GPT-5.6 Luna 的降价「不是临时噱头,而是永久性的」。他随后甩出一组对比数字——GPT-5.4 完整版今年 3 月在 xhigh 设置下得分 51,恰好就是 Luna 目前的最高水平;而 GPT-5.4 的价格是 $2.50/$15(输入/输出每百万 token),Luna 现在卖 $0.20/$1.20。四个月内,同等智能水平的 token 价格缩水到了原来的十三分之一。
如果你是一个每年在 API 调用上烧掉六位数美元的技术负责人,这条消息比任何 benchmark 排行榜都更值得你花 10 分钟读完。
把数字摊开看:
| 模型 | 输入价格 (每 1M tokens) | 输出价格 (每 1M tokens) | 性能基准 | 发布时间 |
|---|---|---|---|---|
| GPT-5.4 (xhigh) | $2.50 | $15.00 | 得分 51 | 2026 年 3 月 |
| GPT-5.6 Luna | $0.20 | $1.20 | 得分 51 | 2026 年 8 月 |
输入价格降了 92%,输出降了 92%。而且这次的降价逻辑和以往不同——它不是 GPT-4o mini、不是量化蒸馏版、不是「低成本路线」。Luna 是 GPT-5.6 系列的主线模型,性能对标的不是某个 cheap variant,而是四个月前你能买到的最好模型。
这带来的冲击是结构性的。很多团队做模型选型时的默认前提——「能力越强越贵」——虽然还没失效,但斜率已经被大幅压平。
过去两年,大多数企业的 AI 采购决策遵循一个简单的分层逻辑:
这个框架假设各层之间有清晰的「价格—能力」梯度。但当 Luna 以 $0.20 的价格提供三个月前旗舰级智能时,这个梯度的下半截就被压塌了——你不再需要为了省钱而选择次优模型。很多场景下,当前性价比最高的选项就是直接用最强模型,省去模型路由、fallback 链、multi-model orchestration 那一整套工程开销。Token 计费的隐性复杂度也常被低估:同样是「便宜」,按 token 计费和按请求计费,对高并发业务的实际成本可能差出一个数量级。
我们在实际项目中验证过这个判断。蓝曜炬辉在 2026 年 Q2 为某金融科技客户搭建的代码审查 pipeline 起初设计了三层路由:简单 lint 走 Haiku、中等复杂度走 Sonnet、复杂逻辑走 Opus。整套路由逻辑加上 prompt 适配层总共约 800 行。当 Luna 降价消息出来后,我们做了一个简单测算:如果把所有调用统一走 Luna,去掉路由层,token 成本增加不到 15%,但维护复杂度砍掉一大半,延迟也更可预测。客户最终决定在新版本中直接砍掉路由逻辑。
降价背后不只是商业策略。OpenAI 能在四个月内把同级别智能的成本压到 1/13,靠的是推理基础设施的代际升级。
同一天发布的 GPT-Live 实时音频架构就是一个侧面证据。Greg Brockman 在介绍中强调,团队「从客户端到模型彻底重建了语音技术栈」,让音频持续流动而不被推理和工具调用打断。这种端到端的架构重构意味着底层推理效率在发生质变——不是算法小修小补,而是硬件利用率和模型 serving 架构的系统性优化。
微软在同一天开源的 Orchard 智能体训练框架则指向另一个方向:让小模型通过更高效的训练和评估流程也能达到强性能。两件事放在一起看,趋势很清楚:「大模型 vs 小模型」的二元对立正在被「高效推理 × 高效训练」的闭环取代。模型尺寸不再是决定成本和能力的唯一杠杆。
对于企业采购决策者来说,这意味着两件事:第一,不要因为现在某个模型便宜就签长期合同锁定供应商——价格下行曲线还没走完。同时保持对开放模型的关注:开放模型在企业落地的成本结构与商业 API 完全不同,在某些私有化部署场景下,即使 Luna 降价后开放模型仍具 TCO 优势。第二,评估 AI 供应商时,把对方是否在做推理效率的持续投入作为一个关键指标,而不是只看当前报价。
问:Luna 降价后,我们之前签的 GPT-5.4 企业合同还有价值吗?
答:取决于你的合规约束和数据驻留需求。如果只是 API 调用,迁移到 Luna 几乎没有成本——接口兼容、prompt 适配量极小。但如果你依赖 GPT-5.4 的某些特定行为(比如特定的 system prompt 响应模式),建议先在 staging 环境跑一轮回归测试。我们在协助一个医疗 SaaS 客户做迁移时发现,Luna 在 structured JSON output 的字段顺序一致性上比 GPT-5.4 稍弱,需要额外加一层 post-processing。模型代际之间的行为漂移在 GPT-5.6 家族中并非孤例——GPT-5.6-Sol 删盘事件同样暴露了新版模型在边界场景下的不确定性,生产环境迁移务必做足回归测试。
问:这个价格能维持多久?会不会几个月后又涨回去?
答:OpenAI 明确说了这是永久调整。从历史来看,token 价格单向下降是趋势——GPT-4 从 2023 年 3 月发布时的 $30/$60 到现在的 Luna $0.20/$1.20,三年内降了 99% 以上。回涨不符合行业方向。
问:对中国大陆企业,Luna 的可用性如何?
答:需要通过 Azure OpenAI Service 或经合法合规渠道接入。具体取决于你的企业资质和业务场景。建议直接咨询合规的云服务商获取最新接入方案。
问:如果模型一直在降价,是不是应该推迟所有 AI 采购决策,等价格更低?
答:反过来想——当模型成本降到某个阈值以下时,AI 能力的竞争优势就从「谁能负担得起」变成了「谁能用得更好」。推迟意味着把先发优势让给已经在用 AI 提效的竞争对手。现在的合理策略是:用当前价格构建工作流,同时保持模型层可替换(abstraction layer),确保降价时可以无缝切换。
基于这次降价,我们建议企业技术决策者在本周内做三件事:
一次降价本身不值得写一篇文章。但当降价幅度、时间跨度和性能对等性三个维度同时拉满时,它不是新闻——是采购策略需要翻篇的信号。