本文要点
- Jalapeno从已宣布项目变成有公开实测结果的first-party silicon。
- OpenAI把指标收窄到每瓦吞吐、端到端延迟和交互负载。
- 全栈文章把芯片结果连接到供应链、数据中心和产品经济性。
阅读辅助
先看数字、证据和来源,再读正文。
OpenAI首次公开Jalapeno自研推理芯片的实测结果。
2026-08-25T07:00:00Z · OpenAI发布Jalapeno首次实测结果,称其是首款自研推理芯片。
OpenAI在2026-08-25连续发布两篇文章:一篇披露首款自研推理芯片Jalapeno的首次实测结果,另一篇由CFO Sarah Friar解释“abundant intelligence”背后的全栈算力策略。两篇合在一起,给出的是一套从模型、Serving软件、芯片、内存、网络、数据中心到开发者平台和产品经济性的优化闭环。
可以确认的事实有三层。第一,OpenAI称Jalapeno已经是working first-party silicon with measured results。第二,在SemiAnalysis的InferenceX公共基准上,OpenAI称Jalapeno在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三种公开模型上,相对comparison systems取得1.5x-1.9x更高的peak AI work per watt,并取得1.7x-3.6x更低的端到端延迟。第三,OpenAI计划在年底前begin deploying Jalapeno within OpenAI’s compute infrastructure,原文语义是“开始部署”,不是“已经完成生产部署”。
需要收窄的部分也很重要。Jalapeno的性能数字来自OpenAI官方披露,采集正文没有给出comparison systems的完整配置、样本流量、功耗日志和第三方复现。InferenceX是OpenAI文中引用的公共基准来源,但本文没有把SemiAnalysis不可直接验证的落点当作已独立读取来源。Artificial Analysis用于解释GPT-5.6 Sol和模型榜单背景,不能证明Jalapeno芯片测试。
对读者的直接影响,是OpenAI正在把“谁有最强模型”改写成“谁能以更低功耗和更短延迟交付可用智能”。如果Jalapeno后续进入真实生产流量,它会影响Agent长任务的单位成本、OpenAI对供应链的议价能力,以及云和芯片伙伴在OpenAI基础设施中的角色分配。
新闻锚点:首次实测和全栈叙事同日出现
Jalapeno这条新闻的news peg很明确:OpenAI在8月25日首次公开自研推理芯片的实测结果。文章开头说,OpenAI一直在测试芯片和围绕它构建的系统,结果显示Jalapeno can serve more AI work per unit of power while also returning responses more quickly。发布重点落在可比较的吞吐、延迟和功耗口径,而不是停留在“有一块芯片”的存在声明。
同一天的全栈文章把这个技术结果放到更大的组织战略里。Sarah Friar把OpenAI的compute strategy定义为one integrated system,横跨data centers and chips、frontier models、developer platform、consumer and enterprise products、AI-native devices。文章说,更好的软件让硬件更高效,针对工作负载设计的硬件改善速度和效率,更强模型带来更好产品,产品产生需求、使用和学习信号,再流回系统继续优化。
这两篇文章之间的关系,决定了今天的写法。Jalapeno文提供硬指标,全栈文解释OpenAI为什么要自研推理芯片。OpenAI并没有说要停止使用外部伙伴,反而列出Microsoft、NVIDIA、AWS、AMD、Broadcom、Cerebras、CoreWeave、Oracle、SB Energy和SoftBank等伙伴。更准确的理解是,OpenAI要在伙伴组合之外增加第一方硅,让不同工作负载可以匹配到经济性最好的系统。
关键数字不能混写
Jalapeno文章里有几个容易被误写的数字。它们看起来都像“性能提升”,但口径不同,基准不同,适用范围不同。
| 原文口径 | 中文可写法 | 写作边界 |
|---|---|---|
| 1.5 to 1.9 times more AI work per watt at peak throughput | 峰值吞吐下每瓦AI工作量高1.5x-1.9x | 这是每瓦吞吐,不是单芯片绝对算力提升 |
| 1.7 to 3.6 times lower end-to-end latency | 端到端延迟低1.7x-3.6x | 这是延迟更低,不是吞吐更高 |
| highly interactive workloads delivered 2.1 to 4.1 times higher performance | 高度交互负载性能高2.1x-4.1x | 仅限OpenAI所称高度交互负载 |
| Jalapeno is rated at 700 watts | 封装额定功耗为700W | 测试中sustained power at or below 550W |
| begin deploying by the end of the year | 年底前开始部署 | 不是已经大规模部署 |
| 54% fewer output tokens than another leading model | 输出token比另一领先模型少54% | 相对对象未命名,且不是性能提高54% |
这些区分不是文字洁癖。推理芯片的商业价值来自系统级约束:单位功耗能完成多少有效请求、用户等待多长时间、交互式Agent能否连续推进任务、功耗和机柜密度是否可控。把1.5x-1.9x写成“性能提升”,会把能效口径误导成绝对算力;把1.7x-3.6x写成“速度更快”,会掩盖它衡量的是端到端延迟;把54% fewer output tokens写成“效率提高54%”,又会混淆模型输出长度和任务成功成本。
OpenAI对功耗的写法也值得保留原状。文章说,为了一致比较各系统,OpenAI用每个加速器公开的chip power rating做归一化。Jalapeno is rated at 700 watts,although its measured sustained power remained at or below 550 watts on the workloads tested。这说明700W是封装额定功耗,550W是测试工作负载里的持续功耗上限。两者不是同一个指标,也不能用550W替换700W作为额定功耗。
InferenceX给的是系统推理口径
OpenAI强调,Jalapeno的评估放在matched user experience下:每单位功耗可以完成多少有用AI工作,同时满足客户和交互式Agent需要的延迟。它把InferenceX称为SemiAnalysis的public benchmark,用来测量服务一个AI请求的完整流程。
这套说法对应推理时代的核心问题。训练时代的叙事常围绕集群规模、FLOPS和训练吞吐展开;推理时代的竞争变量更接近用户请求。一个Agent请求可能包含长上下文、工具调用、多轮中间推理、结构化输出和重试。对用户来说,响应能不能快一点、失败率能不能低一点、长任务能不能便宜一点,比单张卡的峰值算力更直接。
OpenAI在三种公开模型上给出结果:GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T。选择这些模型的意义在于,测试覆盖了OpenAI内部以外的公开模型。OpenAI借此表达的是Jalapeno architecture works across models developed both inside and outside OpenAI。尤其是Kimi,OpenAI称这是它测试过的最大公开模型,并在Kimi上交付约1.5x更高的peak performance per watt和3.4x更低的端到端延迟。
但这里仍有明显缺口。comparison systems是什么、软件栈版本如何、每个模型的量化和并行策略如何、token长度分布如何、负载是否贴近真实ChatGPT或API生产流量,采集到的OpenAI正文没有完全展开。对工程读者来说,这些信息会决定结果能否迁移。没有这些材料之前,Jalapeno可以被写作“官方称取得行业领先速度和效率”,不应被写作“已被独立验证全面领先商业GPU系统”。
自研芯片的战略含义
OpenAI全栈文章解释了为什么Jalapeno不只是硬件项目。文章说,Jalapeno gives us greater control over how our models run and over the economics of serving them。更关键的一句是,OpenAI希望把model、serving software、chip、memory和network一起开发,从而把throughput、latency、energy efficiency和cost作为一个系统优化。
这个方向对OpenAI有三层意义。第一是成本曲线。ChatGPT、API、Codex和未来Agent产品的使用量越大,推理成本越接近公司的底层约束。自研芯片如果能在特定工作负载上降低单位成功任务成本,OpenAI就能把更多能力开放给用户,或在同样价格下保留更高毛利。第二是供应链弹性。NVIDIA、云厂商和专用加速器伙伴仍然关键,但第一方硅让OpenAI多了一个可控选项。第三是产品反馈。OpenAI能把模型使用数据、Serving路径和硬件设计放进同一个循环,缩短下一代系统的优化周期。
全栈文章还提到Project Camellia in Georgia,作为数据中心层面的leverage示例。OpenAI说这个项目围绕客户workloads设计,同时涉及就业、本地企业、项目基础设施和能源成本、closed-loop water system,以及年度独立公开审计。这个段落不直接证明Jalapeno性能,却说明OpenAI正在把基础设施叙事延伸到选址、能源、水资源和地方承诺。对于未来的AI供给竞争,数据中心约束会和芯片约束一样重要。
AI参与芯片开发是第二条暗线
Jalapeno文章里还有一个值得单独拆开的细节:OpenAI称AI在芯片开发中发挥了直接作用。官方说,早期模型帮助团队design and bring up the chip,最新模型正在加速优化和编程。OpenAI还称,AI帮助团队在9个月内从initial design推进到tapeout,通过探索实现方案、缩短设计、测量和验证循环,并围绕模型工作负载持续迭代。
这段话不能被夸大成“AI自动设计芯片”。更准确的表述是,AI参与了设计探索、验证、测量和软件优化流程,帮助缩短迭代周期。OpenAI还给出一个限定性数字:Using Codex with GPT-Astra,团队在两个月内把三个原本不在Jalapeno production plan里的open-weight models做到high performance。对selected GPT-OSS attention and mixture-of-experts blocks,AI-generated implementations比现有人类专家实现快1.5x-1.8x。这个数字只适用于selected blocks,不适用于整模型,也不等于芯片整体性能提升。
如果这条暗线成立,它可能比单次benchmark更长远。芯片设计通常有长周期、高验证成本和强专业壁垒。OpenAI把模型用于芯片开发,本质上是在让自己的AI工具改进自己的基础设施。它既可能加速未来Gen 2、Gen 3的迭代,也可能让硬件团队更快把新模型工作负载映射到具体kernel、memory layout和serving策略上。真正要观察的是,这种AI-assisted hardware workflow能否在后续代际里稳定重复,而不是只在第一代项目里留下一个好看的研发故事。
GPT-5.6 Sol的54%只是模型背景
全栈文章最后提到Artificial Analysis Coding Agent Index:GPT-5.6 Sol with max reasoning reached a new high while using 54% fewer output tokens than another leading model。这个信息属于OpenAI全栈战略中的模型效率例子,不是Jalapeno芯片测试的一部分。
Artificial Analysis模型页可以提供GPT-5.6 Sol的模型性能、价格、速度和榜单背景;模型榜单页可以说明Artificial Analysis覆盖多种模型指标。但是,OpenAI原文没有在这句话里公开“another leading model”的名称。合理写法是“OpenAI称GPT-5.6 Sol在Artificial Analysis Coding Agent Index达到新高,同时输出token比另一领先模型少54%”。不合理写法是“GPT-5.6 Sol性能提升54%”或“Jalapeno让GPT-5.6输出token少54%”。
这条背景仍有价值,因为它和Jalapeno共同服务于同一个主线:OpenAI希望用模型层和基础设施层一起改善useful intelligence per dollar。模型少输出token,可能降低长任务成本;芯片提高每瓦吞吐和降低延迟,可能改善推理服务经济性;数据中心和伙伴组合,则决定这些效率能否变成大规模供给。
早报判断是,OpenAI今天给出的核心信号,是它正在把推理经济性拆到每一层去优化。Jalapeno提供了第一方硅的实测入口,全栈文章则把这个入口接到数据中心、伙伴组合、模型效率和产品需求上。对一家需要服务海量交互式AI请求的公司来说,这比单个benchmark排名更接近长期护城河。
这套叙事有说服力,也有待验证的空白。说服力来自指标选择:每瓦吞吐、端到端延迟和交互负载性能,正好对应Agent推理的三项痛点。空白在于comparison systems和真实生产流量。没有完整配置、任务分布和第三方复现时,Jalapeno的数字仍应被视为OpenAI官方自报成绩,而不是行业共识。
OpenAI与伙伴的关系也不会因此变成简单替代。全栈文章明确列出多家云、芯片、数据中心和能源伙伴,说明第一方硅更像是组合中的新杠杆。它会增强OpenAI在特定工作负载上的控制力,也可能让外部伙伴面对更精确的性价比压力。真正的变化,是OpenAI从“买算力训练和服务模型”走向“定义哪些工作负载应该跑在哪类系统上”。
对开发者和企业买方,最务实的读法是先看成本指标会不会落到产品价格和任务成功率上。Jalapeno如果只停留在官方benchmark,它是基础设施新闻;如果年底前开始部署后让Codex、ChatGPT Work或API Agent长任务的延迟和成本明显下降,它才会变成产品新闻。
接下来怎么验证
透明度首先要落到InferenceX方法上。OpenAI是否公开comparison systems配置、功耗归一化方法、模型并行策略、上下文长度、请求长度分布和失败样本,会决定1.5x-1.9x、1.7x-3.6x和2.1x-4.1x能否被外部工程团队理解。SemiAnalysis或其他第三方如果能发布完整榜单页面和方法说明,Jalapeno的可信度会明显上升。
部署状态决定这条新闻何时进入产品层。OpenAI原文说年底前begin deploying,这意味着接下来几个月仍会经历production qualification、software maturing、scale operation preparation和更多模型验证。应看它是否只服务内部实验负载,还是进入真实OpenAI模型流量;是否覆盖ChatGPT、API、Codex或企业产品;是否披露稳定性、利用率和故障处理。
经济性传导会比单次硬件数字更有说服力。推理芯片的最终价值不会停在“每瓦吞吐更高”,而要落到用户可感知的响应速度、企业可度量的单位任务成本、开发者可选择的价格档位,以及模型厂商可持续的毛利结构。OpenAI全栈文章已经把useful intelligence per dollar作为关键词,后续价格、配额、延迟SLA和Agent完成率会比单次硬件论文式数字更能说明问题。
最后还要跟踪Gen 2和Gen 3。OpenAI称Gen 2 is deep in development,Gen 3 is taking shape。这是路线图状态,不是具体发布时间。第一代Jalapeno证明的是OpenAI有了working first-party silicon with measured results;后续代际要证明的是,这条路线能持续改进,并且能在更多模型、更多负载和更复杂产品形态里带来真实成本下降。