头条

OpenAI GPT-5.6 工作栈:模型、Work 与 Copilot 同步铺开

模型能力层、长任务执行层和办公分发层被 OpenAI 打成同一套工作栈。

2026年7月10日 · 周五深度报告高置信重要度 5/5

本文要点

  • 从单模型评测,变成 Sol、Terra、Luna 三层能力分工
  • 从聊天问答,变成 Work 在文件和应用中执行数小时项目
  • 从独立 ChatGPT 入口,变成 Microsoft 365 Copilot 桌面分发

阅读辅助

先看数字、证据和来源,再读正文。

53.6ALE 分数
13.1 分领先 Fable 5
4 条 Claim Audit

OpenAI 这次不是单点模型发布,而是同步推出工作栈入口。

4 个时间点

2026-07-09 10:00 · OpenAI RSS 记录 GPT-5.6 与 ChatGPT Work 同时发布。

5 个来源5 个非 X 来源

OpenAI 7 月 9 日连发三条官方稿:GPT-5.6 家族全面可用,ChatGPT Work 上线,GPT-5.6 成为 Microsoft 365 Copilot 的首选模型。把它们拆成三篇会更像新闻流,但合在一起才是当天真正的变化:OpenAI 正在把前沿模型、长任务 agent 和企业办公入口包装成一个可采购、可分发、可评估的工作栈。

三项发布各占一层。模型层包含旗舰 Sol、日常平衡模型 Terra 和高性价比模型 Luna,以及用于协调多智能体并行任务的 ultra 设置。OpenAI 称 Sol 在 Agents Last Exam 得到 53.6,较 Claude Fable 5 高 13.1 分;medium reasoning 档高 11.4 分,估算成本约为后者的四分之一。执行层的 ChatGPT Work 可跨应用和文件处理数小时项目。分发层则由 Microsoft 365 Copilot 承担,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。

这套组合仍有三处公开缺口。GPT-5.6 的 benchmark 与成本口径缺少第三方完整复现;ChatGPT Work 没有完整说明权限继承、文件审计和长任务失败恢复;Copilot 的租户级模型选择、回退策略、日志边界和地区可用性仍需微软文档确认。

信源边界需要说明:标题、正文和关键数字均以三篇 OpenAI 官方文章为依据;发布时间另用 OpenAI 官方 RSS 的第三方 JSON 转换交叉核对。该转换服务不是 OpenAI 官方端点,只承担日期核对。Microsoft 365 Copilot 产品页只用于说明企业生产力入口,不参与 GPT-5.6 发布事实确认。

对读者的影响可以一句话概括:企业买方评估 OpenAI 的最小单位,正在从“选哪个模型”变成“采购哪套工作栈”。开发者要重新判断 Codex、Work、API、Copilot 之间的边界;企业 IT 要把模型能力、权限治理、审计日志和 Office 入口放到同一个采购表里;模型厂商则要回答一个更难的问题:如果前沿模型不能直接落进长任务和办公分发,它的 benchmark 领先还能转化成多少真实工作量。

三层工作栈:能力层、执行层、分发层

OpenAI 把 Sol、Terra、Luna 定义为能力与成本分层:Sol 负责 hardest work,Terra 面向日常工作平衡,Luna 负责成本效率。ultra 不是单独模型名,而是用于协调多个 agent 并行处理复杂任务的最高能力设置。

OpenAI 将 ChatGPT Work 描述为跨应用和工作流收集信息、拆解复杂项目并持续处理数小时的产品,可生成表格、幻灯片、文档和 Web 应用。官方同时称 Codex 周活超过 500 万,其中超过 100 万人用于软件开发之外的工作。

OpenAI 称 GPT-5.6 将成为 Microsoft 365 Copilot 在 Word、Excel、PowerPoint、Chat 和 Cowork 中的首选模型;微软还会通过 API 直接访问 OpenAI 模型,把 GPT-5.6 带给 Microsoft 365 客户。

层级官方动作关键数字待验证问题
模型能力层GPT-5.6 Sol、Terra、Luna 全面可用ALE 53.6三档模型的任务分工能否被企业实测复现
成本效率层medium reasoning 较 Fable 5 高 11.4四分之一成本成本估算是否公开完整方法和账单口径
低成本层Terra 与 Luna 超过 Fable 5十六分之一成本低成本档在真实任务中能否保持质量
速度层Artificial Analysis 指数任务时间更少61%第三方能否复现相同任务时长
编码执行层Coding Agent Index 创新高80指数样本和评分细节何时公开
非开发扩展Codex 周活和非开发使用扩大500 万+100 万+非开发使用能否沉淀为稳定 Work 模板
办公分发层GPT-5.6 成为 Copilot 首选模型Word、Excel、PowerPoint企业管理员能否控制切换、日志与回退

官方效率指标与复现缺口

OpenAI 在同一篇发布稿中并列分数、推理档位、成本和任务时间,并强调“more useful work from every token”与“stronger performance per dollar”。这些都是官方定位,尚未构成企业生产环境的独立结果。

Agents Last Exam 被描述为覆盖 55 个领域的长程专业工作流评测。OpenAI 称 Sol 得分 53.6,高出 Claude Fable 5 13.1 分;medium reasoning 高 11.4 分且成本约四分之一;Terra 和 Luna 则以约十六分之一成本超过 Fable 5。

OpenAI 还给出 Artificial Analysis 指数任务时间下降 61% 和 Coding Agent Index 80。公开页面没有完整展开两个指标的样本、评分与成本估算方法。

这里的 caveat 是,官方数字尚未被完整复现。OpenAI 披露了结果和相对优势,但公开页面没有把 ALE 的完整题集、评分细则、成本估算方法逐项展开。对于企业采购,这不会阻止早期试点,但会影响采购委员会能否把 GPT-5.6 与 Claude、Gemini、内部模型做公平横评。接下来最该看的不是下一张榜单,而是这些 benchmark 是否开放方法、第三方是否复测、企业客户是否能把成本口径映射到自己的账单。

ChatGPT Work 的功能范围与治理缺口

OpenAI 称 ChatGPT Work 可“在你的应用和文件中采取行动”,典型产物包括表格、幻灯片、文档和 Web 应用。这些成果可被检查、交付或继续编辑。

官方披露的 Codex 数据是每周 500 万+用户和 100 万+非开发用途。OpenAI 没有进一步拆分研究、运营、分析、内容或管理等任务的占比与成功率。

官方稿尚未充分披露跨应用文件权限、审计日志、任务状态、失败恢复和人工确认点。企业上线前需要逐项核对这些机制。

Copilot 让工作栈进入企业默认入口

如果只有 GPT-5.6 和 Work,这仍然是 OpenAI 自家产品线升级;加上 Microsoft 365 Copilot,事件就进入企业桌面分发。Word、Excel、PowerPoint、Chat 和 Cowork 是企业员工每天打开的入口。OpenAI 称 GPT-5.6 将成为这些入口中的首选模型,意味着模型升级不需要员工主动迁移到 ChatGPT,也不需要企业重新教育用户打开新应用。

这正是 Copilot 的价值:它把模型能力放进已有权限、文档、会议、邮件和协作上下文里。OpenAI 在公告里说,微软也会通过 API 直接访问 OpenAI 模型,把 GPT-5.6 带给 Microsoft 365 客户。这个表述说明 OpenAI 并不只依赖 ChatGPT 订阅把 Work 推给企业,而是在 Microsoft 365 的企业合同、身份系统和管理控制面里寻找分发效率。

但这也带来一个问题:首选模型不等于企业完全可控。管理员是否能选择 GPT-5.6 或回退到旧模型?租户级日志能否显示某个 Copilot 任务调用了哪个模型、哪个推理档位、哪些文件进入上下文?跨地区客户的数据处理是否跟随 Microsoft 365 既有合规边界?这些问题没有在 OpenAI 的短公告里展开。企业买方如果把 GPT-5.6 视作 Copilot 默认能力,需要等 Microsoft 管理文档补齐模型选择、审计、数据边界和地区可用性。

早报观点

这次发布把 GPT-5.6 的能力翻译成了企业能采购的三层语言:模型层讲分数、成本和时间;Work 层讲长任务、文件和成品;Copilot 层讲默认入口、办公套件和企业分发。早报判断是,前沿模型竞争正在从单模型能力竞赛转向“能力如何进入工作系统”的竞赛。供应商需要同时证明能力分档、可审计执行和企业桌面分发。

Work 与 Codex 还可能改变企业对 agent 的评估单位。跨应用读取文件、创建制品和持续执行数小时,会让权限体系、审计日志、失败恢复与人工确认点比单一 benchmark 更接近上线门槛。超过 100 万非开发用途也提示代码执行正在向通用工作扩展,但任务分布和成功率尚未公开。

从竞争角度看,OpenAI 借 Copilot 获得的是分发,微软获得的是模型新鲜度。对 Google Workspace、Anthropic enterprise、独立 agent 平台来说,压力不只来自 GPT-5.6 分数,而是来自模型更新直接进入 Office 默认路径。独立生产力 agent 因此需要在权限、工作流或专业垂直场景上证明额外价值。

这个判断有边界。GPT-5.6 的关键数字仍是 OpenAI 自报,ALE 和 Coding Agent Index 需要第三方复现;ChatGPT Work 的企业治理机制还没有充分公开;Copilot 的管理员控制面、回退策略和数据边界也要等微软侧文档。也就是说,工作栈的战略方向很清楚,但采购级证据还不完整。企业今天可以把它放进试点计划,不应该直接把官方 benchmark 当成生产环境 ROI。

被低估的一点是 Codex 的非开发迁移。超过 100 万非开发用途说明,很多知识工作已经开始用“代码执行”解决非代码问题。ChatGPT Work 把代码执行、文件处理、网页生成和办公产出包装成普通员工可使用的任务角色。长期看,分析师、运营、PM 和研究员可能会把更多完整制品交给 agent;这一变化仍需真实任务成功率验证。

对企业采购而言,三档模型的意义应落到任务分级。低风险、可快速复核的批量工作可以测试 Luna;需要更稳推理和日常协作的任务可以测试 Terra;高价值、长链路且有人类审批的项目再使用 Sol。这样的分层只有在价格、延迟、失败率和人工复核成本同时公开后才有价值。官方 benchmark 只能给出起点,企业仍需要用自己的文档、权限和错误成本重建评测集。

Work 的验收也应从“能否完成演示”提升到“能否留下可审计轨迹”。一个持续数小时的任务至少要记录读取了哪些文件、调用了哪些工具、生成了哪些中间制品、在哪个步骤失败,以及谁批准了最终输出。若这些记录不能由管理员导出,Work 很难进入财务、法务、采购和受监管行业。若记录足够完整,它才可能从个人助手升级为组织流程节点。

Copilot 分发则带来责任边界问题。用户在 Word 或 Excel 中看到的是 Microsoft 365 入口,底层模型却可能由 OpenAI 更新。企业需要知道模型版本何时切换、敏感数据由谁处理、旧模型能否回退、事故由哪一方解释。默认入口可以降低采用成本,也可能让模型变化更难被普通员工察觉。因此,管理员控制面与变更记录应和模型能力同时评估。

这套工作栈最合理的试点方式,是把同一真实任务分别交给不同模型档位、Work 和既有 Copilot 流程,记录成功率、人工修改时间、总成本与权限事件。只有这些数据能回答“单位美元产出”是否成立,也能区分模型能力、执行产品和办公入口各自贡献了多少价值。

试点还应记录人工复核次数、失败后的回滚时间和无法完成的任务,避免只统计最终成功案例。

接下来最该验证什么

第一,GPT-5.6 的 API 价格、速率限制、区域可用性和数据保留边界。OpenAI 已经把“performance per dollar”放在发布叙事中心,但企业最终会用真实账单验证它。特别是 Sol、Terra、Luna 三档之间的价格差、上下文窗口、工具调用成本和并发限制,会决定它们是否真能成为不同工作负载的默认选择。

第二,ChatGPT Work 的权限与审计。Work 如果要在应用和文件中采取行动,就必须回答“它看到了什么、改了什么、失败时如何回滚、谁批准了最终交付”。这些问题一旦没有清晰界面,Work 就更像个人效率工具;一旦补齐,它才可能成为企业级 agent 执行层。

第三,Copilot 的管理员控制面。GPT-5.6 成为首选模型只是入口,企业还需要知道能否按租户、部门、任务类型选择模型,能否回退,能否导出日志,能否证明某些敏感文件没有进入不该进入的上下文。OpenAI 给出了发布事实,Microsoft 侧的管理文档会决定这件事的落地速度。

第四,第三方复现。ALE 53.6、medium reasoning 高 11.4 分、约四分之一成本、Terra/Luna 约十六分之一成本、Artificial Analysis 任务时间少 61%、Coding Agent Index 80,这些数字共同构成 GPT-5.6 的效率叙事。只要其中几个被独立复现,这套工作栈的采购说服力会显著增强;如果复现结果波动很大,企业会重新回到自建评测和小范围试点。

第五,Codex 非开发用途能否稳定模板化。500 万+周活和 100 万+非开发用途已经说明需求存在,但 Work 要成为产品线,还需要把这些零散使用沉淀为可复用任务模板,例如季度经营分析、竞品研究、销售材料生成、网页原型、数据清洗、合规检查。OpenAI 接下来如果公开这些模板和成功率,Work 才会从“聪明 agent”走向“企业流程组件”。