#Codex
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 产品上新2026-08-26 · 周三重要度 5/5深度报告 →
OpenAI发布Admin插件接入Work与Codex
OpenAI 8月25日发布Admin plugin,让ChatGPT Work和Codex在权限范围内查询用量、管理成员并处理使用限额请求。
- 核心是把企业管理动作变成可审计的Agent工具调用。
- OpenAI强调插件不扩大权限,这为Work进入IT和财务审批链路提供了边界。
- 行业动态2026-08-25 · 周二重要度 3/5
TechCrunch追问OpenAI白领Agent采用
TechCrunch 8月24日采访OpenAI产品工程团队,称ChatGPT Work面向非工程师扩展Agent工作流,但权限配置、评测和成本仍是阻力。
- 这篇媒体观察没有新增OpenAI产品发布。
- 它把内部98% Codex使用率与外部组织订阅者17%使用率放在一起,显示白领Agent仍卡在信任、权限和可评测性。
- 开源工具2026-08-24 · 周一重要度 3/5
solo-skills扩至26个Agent技能
solo-skills 8月23日提交把公开技能从15个扩至26个,并补充面向一人业务运营的脚本和流程说明。
- 这条属于Agent操作手册商品化的长尾样本,不能按模型能力新闻解读。
- 技能仓库把经验沉淀成可被模型读取的流程,适合小团队复制局部自动化。
- 客户案例2026-08-21 · 周五重要度 3/5
少源|OpenAI称Stampli用Codex省68%工时
OpenAI 8月20日发布Stampli案例,称Deep Finance上市制作工时从243小时降至约77小时,需按厂商自报阅读。
- 这更像企业采用叙事中的可量化案例,而非独立benchmark。
- 它提示Codex正在从写代码扩展到GTM资产制作,但节省比例仍取决于OpenAI与客户的建模口径。
- 研究论文2026-08-13 · 周四重要度 5/5深度报告 →
OpenAI作者团队发布企业AI使用实证研究
OpenAI于8月12日同时发布Enterprise Signals与企业AI使用工作论文:前者报告企业客户的代理使用差距,后者分析1764家组织的岗位与任务记录。两项结果均来自OpenAI产品内样本,不能外推为全市场生产率。
- 企业AI研究从问卷自报迈向产品行为数据,能够观察组织内谁在用、用得多深以及做什么任务。
- 样本仅含OpenAI客户且由OpenAI作者主导,不能外推为全部企业或净生产率证据。
- 产品上新2026-08-12 · 周三重要度 5/5深度报告 →
OpenAI预览ChatGPT Linux客户端
OpenAI于北京时间8月12日凌晨开放ChatGPT Linux桌面客户端预览,覆盖指定Ubuntu、Debian与Fedora版本,并为x64、ARM64提供原生安装包;Computer Use和完整Wayland体验尚未就绪。
- Linux补齐了ChatGPT桌面入口,也把ChatGPT Work与Codex带进开发者的原生工作环境。
- 预览标签意味着企业部署仍要关注更新渠道、沙箱权限和发行版兼容性。
- 产品上新2026-08-05 · 周三重要度 4/5
待验证|OpenAI称教育场景新增三款插件
OpenAI 的 2026-08-04 官方公告称,ChatGPT Work 和 Codex 新增三款教育插件。严格新鲜度检查受 OpenAI 访问拦截,公告内容已由采集记录取得,部署范围仍待公开页面复核。
- 这次新增的重点是把角色技能、课程材料和既有工具包装成可部署工作流,而非宣布面向所有用户开放新模型。
- 由于官方页面在严格校验中返回访问拦截,地区和管理员条件仍应视为待验证。
- 社区工具2026-08-03 · 周一重要度 2/5
Codex Vision Proxy补强意图提示与粗到细观察
Codex Vision Proxy在窗口内移除缺少对照数据的关键词路由,改由助手最近意图生成看图提示,并加入局部放大、像素取色和渲染差分方法。
- 这组提交把视觉代理的可靠性问题拆成意图、定位与确定性测量。
- 项目只有作者经验和局部测试,方法收益仍需统一评测验证。
- 社区工具2026-08-02 · 周日重要度 1/5
待验证|Ponytail v1.1用七级检查约束过度实现
Ponytail 在窗口末段发布 v1.1,通过七级检查和生命周期钩子阻止 Agent 过度实现。作者自报少写 54% 代码,尚无独立复核。
- 它把“先判断是否需要写代码”固化成可移植技能。
- 公开报告给出固定仓库、任务、基线和样本数,但只有单模型单仓库,仍属作者自测。
- 行业动态2026-08-01 · 周六重要度 4/5深度报告 →
OpenAI 新披露成本与使用数据,降价是前一日事件
OpenAI CFO Sarah Friar 发布全栈成本文章,披露端到端服务成本降低 20% 等数据。文中所称 Luna 与 Terra 降价发生在前一日,并非再次降价。
当天增量是公司把模型、推理基础设施和需求增长放进同一成本叙事。关键运营数字仍是厂商自报,缺少绝对成本基线。
- 头条2026-08-01 · 周六重要度 5/5深度报告 →
DeepSeek 发布 V4-Flash-0731 权重并开放 API 公测
DeepSeek 于窗口内发布 V4-Flash-0731 的 MIT 权重,并让官方 API 进入公开测试。官方称架构与预览版相同,本次升级仅适用于 Flash API。
- 同日开放权重、API 与 Codex 适配,降低了从评测到部署的距离。
- 厂商 benchmark 与独立指数口径不同,不能直接横向相加。
- 头条2026-07-31 · 周五重要度 5/5深度报告 →
OpenAI 下调 Luna 与 Terra 价格,Sol 新增 Fast
OpenAI 将 GPT-5.6 Luna 的输入与输出价格下调 80%,Terra 下调 20%。Sol API 新增 Fast 模式,官方称速度最高为标准模式的 2.5 倍,价格为 2 倍。
这次调整直接改变的是单位工作负载成本与延迟选择。三个百分比对应不同基准,不能把降价与加速合并成单一性能提升。
- 工程实践2026-07-30 · 周四重要度 4/5深度报告 →
OpenAI 披露 GPT-5.6 服务成本降低 20%
OpenAI 称,生产 GPU 内核及更广泛内核改进合计让端到端服务成本降低 20%;改进投机解码令 token 生成效率提高超过 15%。
两个百分比对应不同优化范围,不能相加。更重要的工程变化是模型开始参与分析流量、改写内核和设计推理实验。
- 产品上新2026-07-30 · 周四重要度 5/5深度报告 →
OpenAI 启动研究者免费计划,首批 1 万人
OpenAI 启动 ChatGPT for Academic Researchers,今年夏天先覆盖 1 万人,并计划到 2027 年扩展至 10 万人。申请已开放。
关键是把前沿模型访问从零散资助变成机构级计划。10 万人是未来目标,不是公告当天已完成的覆盖量。
- 行业动态2026-07-29 · 周三重要度 4/5深度报告 →
OpenAI 汇总 8 个智能体辅助科研计算项目
OpenAI 发布探索性 field report,覆盖 8 个科研软件项目。5 个只用 Codex,3 个同时使用 Codex 与 Claude Code;报告未给统一提速百分比。
案例共同指向验证和维护成为新瓶颈。没有共同基线意味着这份材料能证明可行路径,却不能证明普遍生产率增益。
- 行业动态2026-07-27 · 周一重要度 2/5
据传:Codex成员分享Multi-Agent V2编排方法并开源
X用户转述称,OpenAI Codex DX团队成员Eric Provencher分享Multi-Agent V2编排方法论,并开源为codex-skills仓库中的Skill:主Agent拆任务定边界,子Agent并行执行。此说法官方未确认。
- 核心是按任务复杂度分配不同推理强度:定位文件用轻量档,限定范围改动用中档,有歧义的复杂实现用高档。
- 这是社区工程实践信号而非官方发布,适合关注Agent编排工程化的团队参考,不构成官方路线图承诺。
- 产品上新2026-07-24 · 周五重要度 4/5
单源称|OpenAI 把桌面语音接入 Work 与 Codex
OpenAI 官方 X 称 ChatGPT Voice 于 7 月 23 日开始全球推出,可在 macOS 与 Windows 控制电脑并协调 Work 或 Codex 智能体。官方帮助页尚未提供同步说明。
语音正在成为多智能体调度入口,但当前证据只有官方 X。覆盖方案、远程控制边界与分批节奏仍需产品文档确认。
- 工程跟进2026-07-20 · 周一重要度 2/5
待验证|Codex 仍有残余 TRACE 写入
北京时间 7 月 20 日凌晨,一名用户在 Codex 0.144.5 上复测称,主要日志洪泛似乎已修复,但 30 秒样本仍产生约 5.06 MiB WAL 写入。
- 新增证据只说明单机仍有残余 TRACE 持久化,不能复述成 37 TB 个案仍普遍存在。
- 过去 24 小时没有对应的新修复提交或 release。
- 开发者工具2026-07-12 · 周日重要度 2/5
待验证|社区称 Codex 浏览器可导入 Chrome 登录态
X 用户称 Codex 更新后可在内置浏览器导入 Chrome 登录态,并查看 DOM、控制台和网络请求;目前缺少官方文档确认。
这项能力尚无官方文档,不能当作已发布功能。若获得确认,关注重点应是凭据隔离和操作审计。
- 头条2026-07-10 · 周五重要度 5/5深度报告 →
OpenAI GPT-5.6 工作栈:模型、Work 与 Copilot 同步铺开
OpenAI 7 月 9 日把 GPT-5.6、ChatGPT Work 和 Microsoft 365 Copilot 首选模型切换放在同一窗口发布。
- 这不是单一模型新闻,而是一次工作栈打包:模型家族负责能力分层,Work 负责长任务执行,Copilot 负责企业桌面分发。
- 真正的变化在采购与使用路径被合并。
- 头条2026-07-06 · 周一重要度 5/5深度报告 →
待验证|Codex 静默掐思考:39 万条遥测把 516 钉在 GPT-5.5 脸上
vguptaa45 在 openai/codex#30364 公开 39 万条 response。GPT-5.5 命中 516 的比例 44.0%,其它模型平均 1.3%。516 = 512 加 4 的形状指向 reasoning budget 阈值截断。
- 44.0% 与 1.3% 的 33.6 倍差距加月度命中率从 0.11% 跃迁到 53.30%,且姊妹 issue 5 次 516 tokens 复现全部答错、长推理全部答对
- 三条证据叠起来指向同一件事:GPT-5.5 的 reasoning budget 在 5 月被压到 512 量级。
- 产品上新2026-07-05 · 周日重要度 3/5深度报告 →
待验证|Superpowers 6.0 提速 50% 属实,但「接入 Fable 5」是误读——一篇事实核查
obra、superpowers v6.0.0 内部评测确报「约 2x 速度、近 50% 减 token」,但加速来自子代理评审流重写,与 Fable 5 无关。博客 fable5 页 DNS 不存在,主源全篇无 Fable 字样。所谓「接入 Fable 5」是把框架提速与 Claude Fable 5 回归 LMArena 两件事拼成的伪叙事。
- 观点观察2026-07-05 · 周日重要度 3/5
开发者共识收敛:Fable 5 做诊断,Codex 做执行
Jiaxi_Cui 短评:Fable 5 查 bug 能力明显强于 Codex,能发现 Codex 解决不掉的问题;顺带提到 zvec 这个新向量数据库性能优秀但兼容性 bug 多。与 Berman、theo 的工作流分工趋势一致。
- 开发者对 Fable 5 与 Codex 的定位已从「都能写代码」分化到「Fable 做诊断、Codex 做执行」。
- 背后是 Anthropic 押深度诊断加推理、OpenAI 押执行加 UI 验证加计算机使用的产品分化。
- 观点观察2026-07-05 · 周日重要度 5/5深度报告 →
Berman 双 $200 订阅工作流:Fable 5 Planning 加 GPT-5.5 Execution
Berman 每月 $200 订 Fable、$200 订 GPT-5.5,搭出分工:Fable 做 Planning、GPT-5.5 做 Execution。theo 实测此前 50% 的 agent 驱动 PR 会被关掉,搭这套后当天零关闭。
- 双 $200 订阅用户在主动编排模型角色:Fable 做诊断规划、GPT-5.5 做执行。
- 这不是营销叙事而是工程实测——theo 工作流里 PR 关单率从 50% 降到 0。
- 观点观察2026-07-03 · 周五重要度 2/5
待验证|团队负责人 @xiaogaifun 长文反思:做 AI 的 Leader 而不是传声筒——与 Karp 批评形成隐性共振
团队负责人 @xiaogaifun 7.2 长文反思:Codex 接入 DeepSeek V4 / Kimi 模型时,若团队只下指令不追问,会失去对原理的判断;以哥伦布月食故事类比,呼吁「人做 AI 的 Leader,做执行者背后的认知者」——AI 可以成为执行者,但不能成为认知;真正属于人的工作,是不断把 AI 给出的结果重新变成自己的理解。这一反思与 Palantir CEO Karp 在 CNBC 对闭源模型的批评形成隐性共振:不管模型多强,组织对原理的判断力才是最稀缺的资产。
- @xiaogaifun 的反思与 Karp 在 CNBC 的批评是同一条暗线的两端
- Karp 从企业 CEO 角度说「闭源模型把企业命脉外包给实验室」,@xiaogaifun 从团队负责人角度说「团队把认知外包给 AI」,两者都指向同一个结构性问题:在 AI 工具普及后,「判断力」与「认知主权」的归属正在被悄然转移。
- 产品上新2026-07-02 · 周四重要度 2/5
Codex App / CLI / SDK 可搭配任意开源模型使用:Codex 切换为 GLM 已成可用模式
@thsottiaux 提醒:Codex App、CLI、SDK 可搭配任意开源模型使用,不限于 OpenAI 模型;@zarazhangrui 进一步指出可以把 Codex 的模型切换为 GLM。这意味着 Codex 不再是 OpenAI 模型的专属载体,开发者可以用 Codex 的产品形态跑任意开源模型——BYOK 范式在 OpenAI 自身产品上的落地。
- Codex 支持任意开源模型,这意味着 OpenAI 自家产品 Codex 也在做『BYOK 兼容』
- 开发者可以保留 Codex 的产品体验,同时把模型切换为 GLM / Qwen / DeepSeek / Llama 等开源选择。
- 产品上新2026-06-28 · 周日重要度 2/5
OpenAI Codex 本周体验更新:长线程滚动更顺、复制到 Slack 保留 Markdown
据 @OpenAIDevs / @thsottiaux,Codex 本周落地一批体验改进:超长对话线程滚动更顺滑、浏览时阅读位置不再跳动;线程切换后台开销降低、可加载更深本地历史;从 Codex 复制内容粘贴到 Slack 时完整保留 Markdown(列表/加粗/代码块/链接)、大段粘贴不再卡 UI;新增可悬停的导航栏轮次预览、设置搜索覆盖更多控件,以及一个 Pets 面板。@thsottiaux 推文 1949 赞、@OpenAIDevs 2967 赞。
- 这批更新看着琐碎,但方向值得注意:OpenAI 在抢 Slack 这个工作流入口
- 『复制到 Slack 保留 Markdown』和同周 Anthropic Claude Tag 进 Slack 是同一战场的两种打法,一个把 Agent 直接驻进频道,一个优化『从 IDE 到 Slack』的内容流转。
- 观点观察2026-06-27 · 周六深度报告 →
智能体渗透工作三方对账:99.8% 渗透率与 1.6 倍吞吐之间的鸿沟
OpenAI 内部报告显示 Codex 占每周输出 token 从 2025 年 8 月不足 10% 升至 99.8%,80.6% 员工发起过等效人类超 30 分钟的请求、25.6% 超 8 小时,非开发者用量个体涨 137 倍、组织涨 189 倍,法务/财务/招聘 4 月跨过使用过半拐点;Anthropic 经济影响研究(逐小时采样)显示近半受访者预期 12 个月内职责显著变化,不到 10% 自认会失业但超三分之一估计初级同事失业概率高于 60%;字节洪定坤分享 TRAE 团队半年超 90% 代码由 AI 生成,人均吞吐却只提升约 1.6 倍,引入 Harness(上下文工程/架构约束/团队知识沉淀)后可交付性从 40-60 分升至约 80 分。三方数据拼出一个完整图景:智能体『用』已无争议,『用好』还差很远,瓶颈正从模型能力转移到工程化交付。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
EnterpriseClawBench:把 5291 条真实职场会话变成评测,给 Claude Code、Codex 直接打分
Frontis.AI 从真实企业 agent 会话中提炼出 852 个可复现任务(含 120 题人工审核 Lite 子集),用『硬规则 + 五维语义评判』双层打分,评测 32 个 harness-模型组合。最佳 Lite 仅 0.663(Codex+GPT-5.5);全集 DeepAgents 上 GPT-5.5=0.766、Sonnet 4.6=0.749、Haiku 4.5=0.632。因含内部内容数据不公开,公开的是构建与评测协议。