本文要点
- 前沿与典型企业的每活跃用户输出token差距由1月2.6倍升至6月8.3倍。
- Codex占企业客户两产品合计输出token的64%,代理使用成为主要输出来源。
- 非工程职能的Codex活跃用户相对增速高于工程,扩散信号由开发转向知识工作。
阅读辅助
先看数字、证据和来源,再读正文。
前沿企业与典型企业的每活跃用户输出token差距从1月2.6倍扩大到6月8.3倍。
2025-06 · 工作论文把全部企业客户合计输出token设为增长指数基期。
8.3倍与64%是这次发布最醒目的两个数字,但它们首先是产品使用指标。前者衡量OpenAI企业客户中,月度使用量前10%的“前沿企业”与第45至55百分位“典型企业”之间的每活跃用户输出token差距;后者是截至2026年6月,Codex在企业客户Codex与ChatGPT合计输出token中的份额。它们说明代理式任务正在消耗更多模型输出,尚不能直接说明企业多创造了多少收入、节省了多少工时。
OpenAI在8月12日同时发布两份互补材料。Enterprise Signals观察其全球企业客户中的代理使用、能力采用和职能分布;工作论文《How Organizations Use AI: Evidence from ChatGPT》把ChatGPT Enterprise账户记录连接到组织、岗位、任务分类与美国上市公司财务数据。前者回答“领先客户怎样用得更深”,后者回答“采用如何在企业、员工和任务之间分布”。
证据强度也停在这个边界内。两项研究都由OpenAI及其合作者完成,底层都是OpenAI产品遥测;Enterprise Signals未公开可供第三方复算的企业级数据,工作论文仍是可能修订的v1。消息、token和活跃用户可以描述使用,却没有直接观察下游制品质量、生产率、组织流程变化或投资回报。
对企业买方而言,四层采用框架比单一倍数更实用:谁获得了访问、谁持续活跃、代理被接入哪些上下文和工具、完成结果是否通过质量与价值指标。少任何一层,使用深度都可能停留在成本曲线,无法进入经营结果。
两份研究并非同一个样本
OpenAI的发布页把两份研究并列,但其研究对象、窗口和可回答问题不同。将数字跨报告混用,会把客户总体趋势、固定采用队列和岗位子样本误当成同一分母。
| 维度 | Enterprise Signals | How Organizations Use AI |
|---|---|---|
| 核心对象 | OpenAI全球企业客户的聚合使用信号 | 付费、集中管理的ChatGPT Enterprise工作区 |
| 主要窗口 | 前沿差距比较2026年1月与6月;职能增长以2月为起点 | 企业采用日期覆盖2024年1月1日至2026年3月31日 |
| 关键分组 | 每月输出token/活跃用户前10%,对比第45至55百分位 | 采用队列、岗位与资历、任务类别、美国上市公司匹配样本 |
| 可回答 | 哪类客户用得更深,Codex与高级能力向哪里扩散 | 谁在用、强度多大、做何种任务、采用者具有什么既有特征 |
| 不能回答 | token是否转化为利润、质量或净工时节省 | ChatGPT Enterprise是否造成更高估值、生产率或就业变化 |
Enterprise Signals称所有分析使用聚合、去标识化企业数据,消息内容由自动系统分类,没有OpenAI员工逐条查看。工作论文同样采用隐私保护流程,但把样本限制写得更细:产品面板保留工作区活跃但没有活动的组织周为零使用;不包含个人账户、API、其他订阅计划或其他厂商产品。
从2.6倍到8.3倍,变化发生在“使用深度代理”
Enterprise Signals每月按每位活跃用户生成的输出token排序企业客户。按这个定义,前沿企业与典型企业的差距从2026年1月的2.6倍扩大到6月的8.3倍,OpenAI将其描述为约三倍的差距扩张。行业内也存在分化:信息与技术行业的差距为11.7倍,制造业为5.3倍;典型企业各行业使用量在过去一年只增长约1.9倍至2.8倍。
这组指标能支持一个有限判断:最重度客户让模型处理的上下文和输出规模,增长速度快于中位附近客户。它不能支持“前沿企业价值创造高出8.3倍”。长输出可能来自更复杂的任务,也可能来自长上下文、工具循环、失败重试或低效提示。OpenAI在报告中也明确承认,短回答可能价值很高,长回答可能价值很低,token只是深度与所需求“智能量”的代理指标。
还有一个容易遗漏的构成问题:前沿组和典型组是每月重新排名,并非披露过的固定企业队列。差距扩大可能同时包含同一企业用得更深、企业在分位组间迁移、客户结构变化等因素。没有企业级转移矩阵和绝对token基数,不能把2.6倍到8.3倍写成同一批领先公司的纯纵向增长。
工作论文提供了另一条纵向证据。全部ChatGPT Enterprise客户的聚合输出token从2025年6月到2026年3月约增7倍;在2025年6月前已采用的固定队列中,同期仍约增4倍。作者据此估算,大约一半总增长发生在既有采用企业内部。这个拆分比单纯客户数更接近“采用后继续加深”,但论文附录同时说明,观察期的聚合增长主要由非Codex输出驱动,不能拿它替代6月Enterprise Signals的Codex结构数据。
Codex越过工程边界,但任务仍带技术底色
截至2026年6月,Codex贡献企业客户Codex与ChatGPT合计输出token的64%。这个比例是输出量份额,不是“64%的员工使用Codex”,也不是“64%的企业任务已由代理完成”。代理会运行更长的多步任务,天然产生更多token,因此产品份额与用户份额并不等价。
跨职能增长信号更直接。以2026年2月为基线,OpenAI报告每周活跃企业Codex用户在法律岗位增长108倍,销售与招聘各增长41倍,营销增长26倍,工程增长5倍。
| 职能 | 每周活跃企业Codex用户相对增长 | 可读出的信号 | 仍缺的分母 |
|---|---|---|---|
| 法律 | 108倍 | 代理开始进入法规检索、文档和流程执行 | 绝对用户数、起始基数、留存与准确率 |
| 销售 | 41倍 | 客户上下文整理与跟进工作具备扩散条件 | CRM接入覆盖、人工复核和成交贡献 |
| 招聘 | 41倍 | 信息整合、候选流程和结构化材料可能被代理承接 | 合规错误、偏差审查与每任务成本 |
| 营销 | 26倍 | 研究、内容与运营动作开始连成工作流 | 制品质量、返工率和品牌风险 |
| 工程 | 5倍 | 基数更成熟,继续增长但相对倍数较低 | 与非工程岗位可比的初始人数 |
“非工程扩散”需要再加一层任务结构。Enterprise Signals在超过1000万条消息的样本中称,编码与系统或代理操作合计占代理消息近75%。招聘、销售、政策、传播岗位中,系统与代理操作分别占消息的32%、26%、25%和24%;设计岗位近60%的代理消息仍属于编码。换言之,Codex的用户身份正在跨出工程部门,但不少新增工作仍是自动化、数据处理、工具操作和轻量编码,并非技术成分消失。
6月发布的旧背景论文《The Shift to Agentic AI》给出相同方向:非开发者用户增长快,OpenAI内部法律、财务和招聘较晚转向Codex;但它也以OpenAI自身作为高采用案例。8月的新报告把观察面扩大到企业客户,仍没有独立证明这些使用产生了同等比例的业务结果。
工作论文如何从账户记录走到岗位结论
工作论文不是一个统一的“1700万条消息”样本包办所有分析,而是四个彼此嵌套但用途不同的样本。
| 样本 | 规模 | 用途 | 主要限制 |
|---|---|---|---|
| 组织周使用面板 | 未公开完整组织数 | 新增企业与既有企业使用增长 | 只含OpenAI集中管理工作区 |
| 岗位特征样本 | 1764家组织、17446551条消息 | 采用满26周后的岗位、资历与使用强度 | 岗位字段缺失且只在一个时点观察 |
| 任务分类样本 | 973家组织、8696657条消息 | 60类任务的覆盖与消息份额 | 分类器自2025年10月30日才可用 |
| 美国上市公司样本 | 417个ticker、521个ticker-year | 采用与财务、规模、无形投入的相关性 | 随机抽取匹配客户,只覆盖美国上市公司 |
岗位样本要求企业能映射行业、至少部分用户有可用行政岗位字段,并且在采用后的第26周仍可观察。没有岗位信息的活跃用户仍会进入组织层总量与分母,却在异质性分析中落入缺失或未分类。更关键的是,作者没有每类岗位的完整员工总数,因此“某岗位占周活跃用户多少”不是“该岗位有多少员工采用”的比例。
任务分类依赖自动分类器。每条消息被分到60类任务之一,研究同时计算某任务一周内至少被使用一次的用户覆盖率和该任务的消息份额。前者可以大于总和100%,因为同一用户一周能做多类任务;后者才是互斥的消息结构。文档与技术写作、技术数字工作、沟通在多数行业都居前,金融、法律、销售等角色又呈现与本职工作一致的专业类别。
大公司更早采用,不等于AI让它们更强
美国上市公司匹配样本展示了明显的选择性。采用者的收入中位数为22.751亿美元,未匹配企业为2.096亿美元;总资产分别为43.942亿美元与6.676亿美元;员工数分别为2934人与424人;市值分别为49.972亿美元与3.164亿美元;研发支出分别为1.131亿美元与990万美元。
这些差异描述的是谁更早购买ChatGPT Enterprise。论文把采用时间与滞后财务特征连接后发现,规模更大、每员工收入更高、SG&A与研发等无形资本存量更高的公司更可能采用;处在同行业年度收入前5%的企业,采用概率高出11.3个百分点。但在已采用企业内部,规模与每员工消息、活跃用户和输出token反而呈负相关,说明“更容易采购”与“每员工用得更深”是两个不同问题。
因果方向不能反过来写。财务指标大多先于采用,说明已有资源、软件基础与组织能力可能帮助企业部署AI;并不说明ChatGPT Enterprise创造了这些市值或研发投入。论文的“非采用者”只是没有匹配到ChatGPT Enterprise账户,其中可能有人使用其他厂商产品、API、自建工具或个人账户,这类测量误差也会改变组间差异。
早期职业员工用得更密集,仍需岗位分母
采用满六个月后,平均企业的周活跃用户横跨组织层级:经理与总监约占24%,普通个人贡献者与专业人员约占15%,高级个人贡献者与首席级人员约占14%,高管约占10%,早期职业员工与受训人员约占7%。工程与技术人员约占周活跃用户的11%,高管、创始人与合伙人约占9%,财务会计和营销传播各约占5%,销售与客户管理约占4%。
构成不等于强度。论文在同一企业内比较活跃用户后发现,早期职业员工与受训人员每周比平均活跃用户多约8至9条消息;OpenAI的8月总览改用高管作参照,概括为采用满六个月后每周多发13条。两个数字基准不同,不应互相替换。作者也提醒,消息量只能表示活跃强度,不能完整衡量经济重要性。
外部证据能帮助判断哪些方向可能具有普遍性,但不能替OpenAI复算。NBER基于美国人口普查局全国代表性企业调查的研究称,在2025年11月至2026年1月,约18%企业至少在一个业务职能使用AI,就业加权后为32%;采用集中在大企业与知识密集行业。微软研究团队对约550万次M365 Copilot会话的分析同样发现,写作占主导,信息检索、分析和决策支持广泛但不均匀。它们支持“企业扩散广而不齐”这一方向,却没有验证OpenAI专属的8.3倍差距、64%Codex份额或各职能增长倍数。
这次研究的增量,是把企业AI的讨论从“买了多少席位”推进到三个可观测层面:每位活跃用户让模型做了多深的工作、代理有没有接入可复用的上下文与工具、使用是否穿过工程部门进入组织其他职能。两份报告拼在一起,能看见企业之间和企业内部的扩散差异。
最值得管理者借鉴的不是把token当KPI,而是学习其分层方法。席位覆盖回答访问,周活跃回答参与,Plugins与skills回答工作流复用,Codex输出回答委派深度,任务完成质量与经营指标才回答价值。若考核停在前四层,组织很容易奖励更长输出和更多代理循环,却不知道交付是否变好。
非工程岗位的高倍增长是强信号,也最容易被低基数误导。法律增长108倍并不表示法律用户已经多于工程用户;Codex占输出token的64%也不表示多数员工已改用代理。只有绝对用户、留存、完成率、返工和风险事件同时公开,才能判断扩散是否越过试验期。
企业AI竞争正在由模型访问权转向组织互补资产:上下文、权限、评审、技能沉淀和跨部门学习决定同一模型能承担多少工作。OpenAI的数据为这个机制提供了产品内证据,但由于厂商、客户选择和结果变量都受限,它更像一套值得复用的测量框架,而不是领先企业已获得生产率优势的证明。
接下来应补上的证据
- 前沿企业需要披露稳定队列结果:同一批企业从1月跟踪到6月,差距是否仍由2.6倍升到8.3倍,以及多少变化来自组别迁移。
- 职能扩散需要绝对量:法律、销售、招聘与营销的起始用户数、四周留存、人均任务数和活跃企业数,才能校正108倍与41倍的低基数效应。
- 代理份额需要结果指标:把64%输出token连接到任务完成时间、一次通过率、人工复核时长、错误率和单位合格交付成本。
- 岗位结论需要完整分母:补齐各岗位员工总数、岗位字段缺失机制和个人账户使用,才能把活跃用户构成转换成岗位采用率。
- 财务分析需要更强识别:观察采用前趋势、分阶段推出或其他准实验,并纳入竞争产品使用,才能讨论AI对生产率、估值和就业的影响。
目前可以稳妥写下的结论是:OpenAI企业客户内部,代理式输出和非工程岗位活跃度正在快速增加,领先使用组与中位附近组的产品使用深度差距也在扩大。超出这个范围的“生产率跃迁”“领先企业回报更高”或“高管落后导致组织绩效下降”,仍需要独立数据和因果设计。