本文要点
- Luna 输入从 1 美元降至 0.20 美元,输出从 6 美元降至 1.20 美元。
- Terra 输入从 2.50 美元降至 2 美元,输出从 15 美元降至 12 美元。
- Sol API 新增 Fast 可选模式,最高 2.5 倍速度,价格为 Standard 的 2 倍。
阅读辅助
先看数字、证据和来源,再读正文。
Luna 输入与输出单价均从原价降至 20%,对应同一项 80% 降幅。
2026-07-29 · OpenAI 发布 GPT-5.6 效率工程说明,披露服务成本与 token 生成效率改进,为次日降价提供背景。
OpenAI 在北京时间 7 月 30 日 18:00 发布 GPT-5.6 价格性能公告,随后由官方账号和 Sam Altman 给出具体口径:Luna 输入、输出价格各降 80%,Terra 两项价格各降 20%;Sol API 增加 Fast 可选模式。
四项新单价已经得到官方 X、开发者社区价格表及多家直接报道交叉确认。Luna 每百万输入、输出 token 分别为 0.20 美元和 1.20 美元;Terra 分别为 2 美元和 12 美元。
证据仍有一处重要缺口。OpenAI 官方公告正文在采集时持续返回 Cloudflare 挑战,CDP 与浏览器降级也未取得正文。本文因此只把官方 RSS 用作标题、时间和入口证明,具体数字由官方 X、Sam Altman 帖及可读取的直接文章页交叉。
开发者眼前出现两种不同决策。批量、审核和高频工作流可以重新计算 Luna、Terra 的单位任务成本;对延迟敏感的 Sol 请求可以选择 Fast,但需接受 2 倍 Standard 价格,并自行验证“最高 2.5 倍”能否在真实负载出现。
四组降价必须分别计算
价格变化的比较基准是每个型号、每种 token 类型自己的旧价。Luna 的新价均为旧价的 20%,所以降幅为 80%;Terra 的新价均为旧价的 80%,所以降幅为 20%。
| 模型与计费项 | 调整前,每百万 token | 调整后,每百万 token | 新价占旧价 | 相对降幅 |
|---|---|---|---|---|
| GPT-5.6 Luna 输入 | 1.00 美元 | 0.20 美元 | 20% | 80% |
| GPT-5.6 Luna 输出 | 6.00 美元 | 1.20 美元 | 20% | 80% |
| GPT-5.6 Terra 输入 | 2.50 美元 | 2.00 美元 | 80% | 20% |
| GPT-5.6 Terra 输出 | 15.00 美元 | 12.00 美元 | 80% | 20% |
输入与输出是两种计费项。Luna 的两个 80% 不能相加成 160%,Terra 的两个 20% 也不能相加成 40%。正确做法是先按实际输入、输出 token 数分别乘以新单价,再加总一次任务的账单。
例如,一个 Luna 工作负载若消耗一百万输入 token 和一百万输出 token,标准公开单价下的合计会从 7 美元降至 1.40 美元。这个例子只演示价格表运算,没有计入缓存、批处理、长上下文、工具费用或第三方平台加价。
Terra 同样要按工作负载结构计算。一百万输入与一百万输出 token 的简单组合会从 17.50 美元降至 14 美元。输出占比越高,输出单价对总账单的影响越大;只看输入价格会低估长答案或多轮智能体任务的成本。
官方账号还说明,Luna 与 Terra 的更低价格会反映在 Codex 和 ChatGPT Work 的用量计算中,让相同额度支持更多使用。原文说的是 usage counted 与 usage goes further,不能扩写成订阅费已经下调,也没有公开套餐级折算公式。
Sol Fast 把延迟溢价写到台面上
Sol 的变化属于新增可选模式。Sam Altman 给出的表述包含三个边界:Fast 相对 Standard 最高达到 2.5 倍速度,价格为 Standard 的 2 倍,模型的智能水平保持不变。三项需要同时保留。
“最高 2.5 倍”是上限措辞。它没有承诺每次请求都获得固定倍数,也没有给出输入长度、输出长度、并发、区域、排队时间和 p50、p95 延迟。将它写成“稳定加速 2.5 倍”会把厂商上限变成服务保证。
“2 倍价格”的基准是 Standard processing。它描述同一 Sol 模式选择的价格关系,不能和 Luna、Terra 的降幅相加。Fast 也没有改变 Sol 的智能水平,官方表达关注的是更快访问相同模型能力。
若某个请求确实达到速度上限,2 倍价格换取 2.5 倍速度可能对强时效任务有吸引力。但这一推论依赖真实加速接近上限。若生产请求只快 1.2 倍,采购方仍支付 2 倍价格,单位延迟收益会明显变差。
因此,Fast 的合理评估单位应是“成功完成一个任务的端到端时间与总费用”。首 token 延迟、完整输出时间、工具等待、重试率和失败率都要计入。单独比较峰值 token 生成速度,无法回答用户实际等待多久。
从效率披露到价格传导
这轮更新发生在 OpenAI 发布 GPT-5.6 效率工程说明的次日。前一篇材料称,生产 GPU 内核工作与更广泛内核改进合计令端到端服务成本降低 20%,投机解码改进令 token 生成效率提高超过 15%。
两组工程数字属于背景,不能直接当作此次价格公式。Luna 降价 80%、Terra 降价 20%,与服务成本降低 20% 的范围、基线并不相同。OpenAI 没有公开各档模型的毛利、负载结构或价格传导比例。
时间顺序仍然有信息量:OpenAI 先展示模型、推理基础设施和智能体运行框架的效率叙事,再把部分产品价格和低延迟选项推向用户。这说明性能竞争正从单一能力榜单扩展到每美元工作量与等待时间。
Reuters 把事件放在企业审视 AI 支出的背景中,VentureBeat 则强调模型竞争向成本转移。两篇报道的直接页面在本次采集中分别遇到访问限制与安全检查,因此本文只采用其事件定位,不从受阻页面摘取额外数字。
Unite.AI 给出四项新旧价格,为官方社交帖提供了直接文章页交叉。Constellation Research 页面虽含同组新价格,但机器解析日期为 2026 年 3 月 19 日,与事件时间冲突,因此只保留为日期异常的背景参考,不承担新闻锚点。
OpenAI Developer Community 的具体讨论帖进一步列出价格表,并复述 Fast 相对 Standard 的速度与价格口径。论坛内容属于社区来源,不能替代官方公告;它的价值在于提供可核对表格和开发者的早期路由讨论。
成本曲线会怎样改变模型路由
Luna 的降幅足以让原有预算模型失效。若任务质量在可接受范围内,分类、抽取、初筛、代码审核前置检查和大规模候选生成会更容易迁移到 Luna。相同预算理论上可承载原先约 5 倍的同构 token 用量。
“约 5 倍”来自新价为旧价 20% 的倒数,仅适用于 token 结构、调用方式及其他费用不变的情形。真实工作负载可能因为价格下降而增加上下文、输出长度和调用轮数,最终账单不会机械地缩至原来的五分之一。
Terra 的 20% 降幅更像对日常主力档位的普遍减负。对于已经稳定使用 Terra 的团队,迁移成本较低,节省可直接进入预算;对于原本在 Luna 与 Terra 之间动态路由的团队,两档相对价格变化会要求重新标定质量阈值。
Sol Fast 面向另一类约束:任务价值会随等待时间下降。交互式编码、实时决策辅助或阻塞人工流程的请求,可能愿意支付延迟溢价。离线批处理、夜间评估和可排队任务通常更在意吞吐成本,Fast 未必合算。
企业买方还要区分官方 API 单价与到手成本。云平台、API 网关、区域、缓存策略、批处理、长上下文和内部治理都会改变账单。新价应进入成本模型,但不宜直接替代一次完整任务的历史实测。
模型厂商面临的压力则更直接。价格大幅下探会迫使竞争者回答三个问题:相近质量下能否给出更低单价;相近价格下能否提供更高吞吐;高端模型能否用确定的延迟服务支撑溢价。
预算模型需要从 token 回到任务
采购团队可先导出调整前一周的请求日志,按模型、任务类型、输入 token、输出 token 和成功状态分组。把四项新价代入后,可得到静态重算结果;它回答的是“若行为不变会省多少”,不包含降价后新增需求。
下一步应加入需求弹性。团队可能把被抽样的审核任务改为全量运行,也可能增加候选数量、上下文长度和反思轮次。若 Luna 单价降为五分之一后调用量增长五倍,token 总账单会接近原水平,但完成的任务数量可能显著增加。
质量成本也要进入分母。便宜模型若需要更多重试、人工复核或升级到 Terra、Sol,表面 token 节省会被补偿流程吃掉。比较时宜记录一次任务从首次调用到验收通过的全部请求,而非只看第一条响应。
延迟型任务则应给等待时间定价。若人工每等待一分钟都会阻塞部署、客服或交易决策,Fast 的溢价可以与节省的人力和机会成本比较。离线任务没有同样的时间价值,继续使用 Standard 往往更合理。
最后应保留调整前后的同任务对照组。固定提示、工具版本、样本集和成功标准,至少连续观察多个时段,才能分辨价格变化、负载波动与模型输出随机性。一次峰值加速不足以支持长期容量承诺。
这次调整把 GPT-5.6 家族的分工变得更清楚。Luna 用大幅降价争取高频与批量任务,Terra降低日常主力负担,Sol Fast 则向愿意为等待时间付费的用户出售优先路径。价格表开始承担模型路由说明书的作用。
最值得关注的数字是 Luna 的 80%,因为它会改变“哪些任务值得调用模型”的边界。过去因单次价值太低而被规则引擎、抽样处理或人工积压的任务,现在可能进入全量推理。调用量增长或许会吸收很大一部分单位价格下降。
Fast 的意义取决于可预测性。企业愿意为低延迟付费,但通常需要 p95、p99 和容量承诺,而非峰值上限。OpenAI 当前给出“最高 2.5 倍”,足以支持试验,尚不足以替代生产容量规划。
信源缺口也影响判断边界。官方公告正文未成功抓取,核心数字虽由官方 X、CEO 帖、社区表格和媒体交叉确认,适用区域、生效细则与完整例外仍可能藏在正文或动态文档中。采购决策应再核对实际控制台账单。
需要警惕的三种误读
第一种误读是把不同百分比相加。Luna 输入和输出各降 80%,描述的是两项单价各自变化;Terra 同理。总任务降幅取决于输入与输出构成,在两项降幅相同的标准情形下才保持相同百分比。
第二种误读是把 Fast 上限写成稳定速度。up to 2.5x 保留了大量负载差异。短输出可能受首 token 和排队主导,长输出可能更接近生成吞吐上限,不同区域与并发也会改变结果。
第三种误读是把“智能水平不变”解释成所有任务结果完全一致。官方意图是 Fast 没有换成更弱模型,但服务路径、采样随机性和运行时条件仍可能令单次输出不同。质量回归测试仍应保留。
此外,官方所说的价格会反映在 Codex 与 ChatGPT Work 用量计算中,只能支持“同样额度可用得更久”的方向性结论。订阅费、额度上限、超额价格和组织级政策是否变化,需要以产品内实际规则为准。
下一轮验证应看真实账单与延迟分布
开发者可以先选一组固定任务,分别记录 Luna、Terra 与 Sol Standard、Sol Fast 的输入 token、输出 token、首 token 延迟、完成时间、错误率和总价。只有任务成功率相近,价格与速度才具备可比性。
对 Luna、Terra,应重点核对新价格是否已经在官方账单、第三方网关和云平台生效。若中间平台尚未同步,公开价与实际支付会暂时分离;若平台另收服务费,节省比例也可能低于官方降幅。
对 Sol Fast,应等待按请求类型拆分的延迟数据。最有价值的后续是不同上下文长度、输出长度、并发与区域下的 p50、p95,以及达到服务目标时的容量限制,单一“最高速度”仍不足以回答这些问题。
对 Codex 与 ChatGPT Work,应观察用量折算规则是否公开,以及实际任务额度能增加多少。模型调用只是智能体账单的一部分,工具调用、重试、长历史和审核步骤都可能消耗新增空间。
最后还要观察需求弹性。若 Luna 调用量增长超过五倍,OpenAI 可能用规模抵消单价下降;若增长较弱,降价会直接压缩收入。这个结果将决定此次更新会成为持续价格竞争的起点,还是一次针对模型分层的重新定位。