行业动态

OpenAI 新披露成本与使用数据,降价是前一日事件

CFO 首次串起服务成本、token 效率和使用增长,但关键数字仍缺少绝对基线。

2026年8月1日 · 周六深度报告中置信重要度 4/5

本文要点

  • 当天新增从单次价格公告扩展为公司层面的成本、效率与需求增长解释。
  • OpenAI 首次披露20%服务成本、超过15%生成效率与99.8%内部 token 口径。
  • 用户使用加深被量化为注册六个月后日消息约多50%,但 cohort 细节仍缺失。

阅读辅助

先看数字、证据和来源,再读正文。

降低 20%端到端服务成本
提高超过 15%token 生成效率
5 条 Claim Audit

本期 news peg 是 CFO 对成本与增长的新增披露,Luna 和 Terra 降价只是前一日背景。

3 个时间点

2025-05-16 · OpenAI 发布 Codex 研究预览,为后来把内部智能体工作量用输出 token 计量提供产品背景。

7 个来源7 个非 X 来源

百分比口径审计,是读这篇 CFO 文章的第一道工序。OpenAI 在同一篇文章里放进 80%20%超过 15%99.8%约 50%,但这些数字分别描述模型价格、内部服务成本、token 生成效率、公司内部智能体输出和用户使用变化。它们没有共同分母,不能相加,也不能互相代替。

北京时间 7 月 31 日 23:00,OpenAI CFO Sarah Friar 发布《Building abundant intelligence》。当天新增信息是公司首次用一篇管理层文章串起生产服务优化、基础设施投入、内部 Codex 使用和需求增长。Luna 降价 80%、Terra 降价 20%发生在 7 月 30 日,文中只是用 Yesterday 回顾前一日事件,并非 7 月 31 日再次降价。

可以确认的运营数字均来自 OpenAI 自报:生产服务软件优化后,端到端服务成本降低 20%;投机解码改进使 token 生成效率提高超过 15%;OpenAI 内部经 Codex 完成的智能体工作占每周输出 token 的 99.8%;同一用户注册六个月后,日均发送消息量相对注册初期约多 50%。文章没有给出这些指标的绝对值、完整统计周期或审计材料,因此本页维持 medium 置信度。

开发者和企业买方需要先判断成本下降发生在哪一层。模型单价决定公开账单,服务成本影响厂商毛利与再投资空间,生成效率影响每次输出的计算开销,使用增长则决定总需求。只有把四层分开,才能评估“效率提高”是否会稳定转化为更低 API 支出。

五组百分比,五个分母

指标准确分母或比较基准可以得出的结论不能外推成什么
Luna 降价 80%7 月 30 日调整前的 Luna 输入、输出单价新价均为原价的 20%7 月 31 日又降了一次,或模型性能提高 80%
Terra 降价 20%7 月 30 日调整前的 Terra 输入、输出单价新价均为原价的 80%所有 GPT-5.6 档位统一降价 20%
服务成本降低 20%OpenAI 内部生产服务优化前的端到端服务成本官方称生产 serving 软件优化降低了内部成本API 单价自动降低 20%,或客户总账单下降 20%
token 效率提高超过 15%投机解码改进前的 token 生成效率生成阶段以更少计算完成更多有效 token所有请求的端到端延迟都改善超过 15%
内部智能体输出 99.8%OpenAI 内部 Codex 智能体工作的每周输出 token该内部工作流几乎全部 token 经 Codex 产生99.8%客户流量、员工任务或代码都由 Codex 完成
注册六个月后日消息约多 50%同一用户注册初期的每日消息量留存到六个月的用户使用深度上升全体注册用户、活跃用户数或收入增长 50%

这张表最重要的一列是“比较基准”。20% 服务成本下降超过 15% token 效率提升看起来都在描述效率,却位于不同测量层。前者是端到端 production serving 成本结果,后者只绑定投机解码所影响的生成阶段。即使二者来自同一组工程改进,也没有依据把它们加成“35%成本改善”。

同理,99.8%是构成比例,约 50%是相对增长。一个回答“内部某类输出 token 中有多少经 Codex 完成”,另一个回答“同一用户经过六个月后的日消息比早期多多少”。把二者写成采用率或用户增速,都会改变原文含义。

“Yesterday”只允许一种中文时态

文章对价格事件的原句是:

原文措辞忠实中文本期不得写成
Yesterday, we reduced the price of GPT‑5.6 Luna by 80 percent and GPT‑5.6 Terra by 20 percent.“前一日,我们将 Luna 价格下调 80%,将 Terra 下调 20%。”“7月31日再次将 Luna 与 Terra 降价”

OpenAI 给出的调整后价格是:Luna 每百万输入 token 0.20 美元、每百万输出 token 1.20 美元;Terra 分别为 2 美元12 美元。对照前一日公告,Luna 原价为 1 美元和 6 美元,新价均为原价的五分之一;Terra 原价为 2.50 美元和 15 美元,新价均为原价的五分之四。这样才能验证 80%20%是降幅,而不是调整后剩余比例。

Sol Fast 也属于前一日价格公告。官方给出的上限口径是处理速度最高达到 Standard 的 2.5 倍、价格为 Standard 的 2 倍,同时称智能水平不变。“最高”约束速度,不意味着所有负载都稳定达到 2.5 倍;“智能水平不变”也只是官方产品状态说明,不是第三方对每类任务的质量保证。

Reuters 在 7 月 30 日已经报道两档小模型降价,并把事件放在企业审视 AI 支出的背景下。这一独立时间锚说明,7 月 31 日的价值不在于又出现一份价格表,而在于 CFO 开始解释公司为何相信成本曲线还能支撑更便宜的调用和更大的需求。

成本数字讲的是工程闭环,不是财务报表

Sarah Friar 的叙事把模型能力当作基础设施优化工具:OpenAI 称 GPT-5.6 Sol 协助优化生产服务软件,使端到端服务成本降低 20%。这项表述的意义在于,模型不只消耗推理算力,也参与改写承载模型的 serving 系统。若该闭环持续成立,能力提升可以通过更好的调度、缓存、批处理或服务代码反过来降低每次推理的资源消耗。

但“端到端服务成本”仍缺少关键会计口径。文章没有披露成本是按请求、token、成功任务还是某组流量归一化,也没有说明硬件代际、利用率、请求长度和批量策略是否保持不变。它更接近一项内部生产指标,而不是可直接映射到毛利率的财务科目。

投机解码带来的超过 15% token 生成效率提升也应停留在技术层。投机解码通常用较低成本的候选生成配合目标模型验证,以减少高成本解码步骤;效果会随模型组合、接受率、输出长度、并发和硬件而变化。官方数字证明 OpenAI 在自己的生产条件下获得改进,却没有证明所有模型、所有地区和所有 API 请求都能获得相同比例。

这两项改进最终是否传导到客户,还要经过定价决策。Luna 和 Terra 的前一日降价提供了一个结果样本,但无法证明某项 20%内部成本下降与某档 20%价格下降存在一一对应关系。Luna 的降幅甚至达到 80%,显然还混合了模型定位、竞争、需求弹性与容量规划等因素。

同一模型,系统层把 ARC-AGI-3 从 13.3%推到 38.3%

文章还给出一组容易被误写成“新模型提升”的数字。OpenAI 称,在模型本身不变的情况下,推理保留和上下文管理改进把 GPT-5.6 Sol 在公开 ARC-AGI-3 任务集上的得分从 13.3%提高到 38.3%,同时输出 token 减少 6 倍,即降至原先约六分之一。

这项结果更接近系统级优化:模型权重不变,推理过程保留哪些中间状态、如何管理上下文、何时继续探索发生了变化。对长任务和智能体产品,它提示“模型能力”不只由一次前向推理决定,运行时编排可能同时改变成功率和 token 消耗。

ARC Prize 的官方页面可以说明 ARC-AGI-3 所评估的抽象推理任务背景,但 13.3%38.3%和少六倍输出 token 仍来自 OpenAI 的实验与配置。文章没有给出完整 harness、每题预算、失败重试、延迟和总计算成本。得分提升与 token 减少同时出现值得关注,尚不能外推为真实软件任务也会获得近三倍得分和六倍节省。

这里还有一个容易忽略的计量差异:输出 token 变少,不必然等于总计算成本按同一比例下降。保留推理状态、上下文处理和多次内部尝试可能消耗额外计算。外部复现应同时报告成功率、输出 token、总输入 token、墙钟时间、工具调用和总成本,而不是只选择最漂亮的一列。

99.8%与50%描述两种需求

OpenAI 称其模型覆盖超过 10 亿活跃用户和超过 200 万家企业。文章随后用留存后的行为变化说明需求会随使用经验增长:用户注册六个月后,每日发送消息量相对注册初期约多 50%,使用 ChatGPT 的工作类型约为早期的 2 倍

这个基准是“用户随注册时长变化”,不是“今年比去年增长”。更准确地说,它观察留存到六个月后的使用加深;如果早期流失用户没有进入后续样本,就可能存在明显的幸存者偏差。文章没有公开注册月份、地区、免费与付费层级、消息定义或工作类型分类方法,因此不能用该数字推算全体用户的平均留存、收入或算力需求。

99.8%则描述 OpenAI 自身的生产性需求。原文把适用范围限定为 OpenAI 内部经 Codex 完成的智能体工作,并以“每周输出 token”作为分母。它不等于 99.8%的内部代码、不等于 99.8%的员工任务,也不等于外部客户有同样采用率。高占比还可能受到输出冗长度、重试和任务拆分方式影响;在任务数不变时,单个智能体输出更多 token 也会抬高该构成比例。

尽管如此,把内部工作流计量到 99.8%仍透露了 OpenAI 的组织选择:公司愿意让 Codex 承担大量可 token 化的智能体输出,并把内部使用当作优化产品与基础设施的反馈源。它能证明“OpenAI 大规模自用”,不能单独证明这些任务的成功率、节省工时或经济回报。

三条链要分别接受验证

Friar 的文章试图建立一条循环:更强模型帮助优化系统,系统效率降低服务成本,较低价格扩大使用,更多使用又为模型和产品带来反馈。这个循环在逻辑上成立,证据却分布在三个不同层级。

工程链已有内部结果,包括服务成本降低 20%token 生成效率提高超过 15%以及 ARC-AGI-3 的系统级改善。它最需要可复现实验和绝对成本基线。

定价链已有 Luna 与 Terra 的前一日价格变化,但一组产品价格不能证明全部成本节省都会传给客户。它需要连续几个季度的 API 价格、折扣、缓存价、Fast 溢价和服务质量共同验证。

需求链已有注册六个月后的消息增长和内部 Codex token 构成,却缺少 cohort 与任务成功率。它需要留存、付费转化、每任务总成本以及企业生产部署数据,才能从“发了更多消息”走到“创造了更多价值”。

早报观点

这篇文章的增量,是 OpenAI 开始公开一套解释算力经济学的管理层框架。此前的价格公告告诉客户单价变了;CFO 文章进一步主张,模型、serving 软件、内部智能体和用户需求可以组成自我强化的成本循环。对一家需要持续投入巨额算力的公司,这套叙事同时服务工程决策、客户采购与资本投入。

最有信息量的数字是 20%端到端服务成本下降,也是最需要保留边界的数字。它直接触及单位推理经济性,却没有绝对成本、时间范围和流量结构。没有这些分母,外界只能确认公司声称效率改善,无法判断改善来自软件、硬件、请求组合还是会计归集变化。

99.8%内部输出 token展示了 OpenAI 把自身当作 Codex 的高强度试验场,但 token 不是业务价值。一个低成功率、频繁重试的智能体也可以制造大量输出。后续若能补充完成任务数、人类接管率、周期缩短和单位任务成本,这项指标才会从采用信号升级为生产率证据。

前一日降价与当天披露必须严格分开。把 Luna、Terra 写成再次降价,会人为制造不存在的新闻;把服务成本、生成效率和价格降幅相加,则会制造不存在的经济模型。准确的编辑结论应更克制:OpenAI 已给出成本循环的若干内部观测点,但连接这些点的因果关系仍主要由公司自述。

对开发者而言,最现实的策略是按实际任务重算账,而不是把厂商百分比直接代入预算。需要同时记录输入、输出、缓存、重试、Fast 溢价、工具调用、成功率和端到端时延。只有单位成功任务成本下降,模型价格与系统效率的改善才真正到达应用层。

后续核验应追到原始分母

  • 服务成本需要补齐每百万 token 或每个成功任务的绝对值,并说明硬件、地区、模型、上下文和并发是否可比。
  • 投机解码需要在不同输出长度与接受率下报告端到端时延、吞吐和总计算,而不只报告 token 生成效率。
  • 内部 Codex 使用需要同时披露任务数、成功率、重试、人类接管和节省工时,避免 token 构成比例替代生产率。
  • 用户增长需要公开 cohort、留存筛选、付费层级与“工作类型”的分类方法,才能判断约 50%增长是否具有代表性。
  • 价格传导需要观察后续 API 单价、缓存折扣、Fast 模式溢价与服务水平,确认成本改善如何在客户与厂商之间分配。