2026年8月25日 · 周二

官方发布拉回基础设施主线

  • 过去24小时,OpenAI把GPT-5.6接入Kiro并给出Kiro场景成本口径。
  • NVIDIA用AgentX重新衡量AI工厂每兆瓦吞吐。
本期判断
  • 早报判断是,Agent竞争正在从模型入口转向系统瓶颈。
  • 今天最值得看的是成本、能耗和网络协议如何重新定义可用规模。

本期速览

3 条
  1. 01开发成本有新口径
    • GPT-5.6已进入Kiro。
  2. 02AI工厂指标改写
    • NVIDIA发布Vera Rubin NVL72数据。
  3. 03以太网协议被重做
    • Meta发布MetaRoCE。

编辑总结

今天的高置信增量主要来自官方发布。OpenAI把GPT-5.6放进Kiro,NVIDIA把Agent推理效率放进每兆瓦账本,Meta则把AI集群以太网的压力推到端点协议设计。

长尾线索仍值得看,但需要降级阅读。TechCrunch文章是媒体观察,HF日榜是论文跟进,Agent工作台新仓主要证明提交和社区关注,暂时不能替代产品成熟度证据。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

Kiro成本降幅

OpenAI称GPT-5.6 Terra在Kiro完成Terminal-Bench 2.1成功任务的成本降低。

来源:OpenAI →
约82%

Vera吞吐能效

NVIDIA称Vera Rubin NVL72相对GB300 NVL72,在AgentX负载每兆瓦吞吐更高。

来源:NVIDIA →
最高30倍

Vera token成本

NVIDIA自测口径,相对GB300 NVL72每百万tokens成本更低。

来源:NVIDIA →
最高低35倍

OmniAssistBench工时

论文称数据集构建用了超过1000个专家工时。

来源:arXiv →
超1000小时
Briefs

快讯 · 已核验与追踪

2 条
行业动态重要度 3/5中置信多源混合

TechCrunch追问OpenAI白领Agent采用

TechCrunch 8月24日采访OpenAI产品工程团队,称ChatGPT Work面向非工程师扩展Agent工作流,但权限配置、评测和成本仍是阻力。

要点拆解展开
Why
  • 编码Agent已经验证了长任务场景,但普通办公任务缺少像测试一样明确的成功标准。
  • 采用差距会影响OpenAI的商业化节奏。
Impact

企业买方应先审查权限最小化和数据留存。AI产品团队需要把按钮、插件和审计做成可理解的采用路径。

Numbers
内部Codex使用
98%TechCrunch引用OpenAI-backed研究,口径为6月OpenAI员工使用Codex。TechCrunch
组织订阅者使用
17%同一研究口径,组织订阅者使用agentic coding tool的比例。TechCrunch
早报判断
  • 这篇媒体观察没有新增OpenAI产品发布。
  • 它把内部98% Codex使用率与外部组织订阅者17%使用率放在一起,显示白领Agent仍卡在信任、权限和可评测性。
接下来看
  • OpenAI是否公开ChatGPT Work的真实外部活跃用户。
  • GDPval是否成为非代码Agent的持续评测口径。
研究论文重要度 3/5中置信已核验

8月24日跟进|OmniAssistBench登HF日榜

Hugging Face 8月24日把OmniAssistBench列入Daily Papers;论文8月21日提交,目标是评测实时视频助手的多轮交互能力。

要点拆解展开
Why

多模态助手需要在连续视频、语音和用户目标之间做闭环决策。静态视频问答难以覆盖这种执行风险。

Impact

研究者可用它检查历史上下文和延迟响应能力。产品团队需要谨慎看待66.4分和51.2分的归一化口径。

Numbers
专家工时
超1000小时论文称数据集构建需要超过1000个专家工时。arXiv
Gemini-3-Pro
66.4分论文称分数归一化到0-100,非通用视频理解榜。arXiv
早报判断
  • 新闻点是社区策展和项目页更新,论文首发日期仍是8月21日。
  • 它值得保留,因为指标从被动视频理解转向模型建议会改变用户后续动作的交互场景。
接下来看
  • 数据集和评测脚本是否稳定公开。
  • 更多闭源模型是否补充同口径分数。
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

开源工具重要度 2/5低置信发展中

待验证|OpenBot等Agent工作台继续更新

待验证低置信合并稿:OpenBot、Cumora和Rome在8月24日均有GitHub提交,主题集中在Agent工作台、隔离环境和团队协作。

要点拆解展开
Why

开源工作台会影响开发者如何把多个AI助手纳入日常协作。现阶段可核验的是提交时间,成熟采用仍待观察。

Impact

开发者可以观察权限隔离和BYO模型接入。企业团队暂不应把星标数等同于稳定性或安全成熟度。

Numbers
OpenBot星标
约2653GitHub API采集时星标数,8月24日有技能、网络隔离和凭据轮换提交。GitHub API
Cumora星标
约3032GitHub API采集时的星标数,8月24日发布v0.2.2并修复Apple邮箱验证。GitHub API
早报判断
  • 这些仓库的共同信号是Agent产品开始把浏览器、文件、聊天和本地CLI组合成工作台。
  • 由于证据主要来自仓库元数据和提交标题,它们更适合当作社区工具线索而非头条。
接下来看
  • OpenBot是否把网络隔离和credential rotation写进默认安全模型。
  • Cumora的BYO Claude Code与Codex流程是否公开审计边界。
#OpenBot#Cumora#Rome#Agent工作台
Social Radar

社交雷达 · X 讨论

6 条
OpenRouter@OpenRouter65 likes
  • OpenRouter 称隐身前沿模型 Ox Alpha 上线 5 天后,单日用量已到 8 万亿 tokens
  • 被引社区帖称短短几天累计超过 16.6 万亿 tokens,是今日模型路由和 coding agent 讨论的核心信号。
jjacky

jjacky 称 Ox Alpha 已上线 5 天,累计超过 16.6 万亿 tokens,并整理 3000 多条 Discord 社区反馈。

原帖 ↗
cline@cline348 likes
  • Cline 用仓库真实 bug 对比 Ox Alpha 与 Fable:两者都修对,但 Ox 输出 tokens 约少 3 倍。
  • 帖子把差异归因于更少重复验证,是代码代理后训练风格的可观察信号。
cline

Cline 此前宣布 Ox Alpha stealth model 已在 Cline 免费可用,可通过 /models 选择。

原帖 ↗
ChatGPT@ChatGPT930 likes
  • ChatGPT 官方宣布 Images 支持把照片、想法或梗图做成带透明背景的贴纸包,并可分享到 iMessage 或 WhatsApp
  • 透明背景能力也可用于其他图片生成场景。
原帖 ↗
Apodex_AI@Apodex_AI
  • Apodex 1.1 发布并开放 FrontierAgent 本地研究工作台,覆盖复杂专业任务、科学研究、金融分析和深度搜索
  • 同时提供 Apodex 1.1 mini 开放权重模型。
原帖 ↗
MatthewBerman@MatthewBerman929 likes

Matthew Berman 发布与 OpenAI Codex 负责人 Tibo 的访谈片段,Tibo 称 Codex 在 2-3 个月后会显得原始,下一代模型需要的不只是本地电脑。

MatthewBerman

完整访谈目录覆盖 Codex、ChatGPT 与 Codex 合并、下一代模型和 OpenAI 产品文化。

原帖 ↗
SpaceXAI@SpaceXAI1014 likes
  • SpaceXAI 称 Grok Voice Think Fast 2.0 登上 Artificial Analysis Speech-to-Speech Index 第一
  • 该榜衡量语音代理听懂语音、解决真实客户问题并调用工具完成任务的能力。
原帖 ↗
更多讨论4 条
grapeot@grapeot49 likes
  • grapeot 解读 AI skill 论文:8135 次受控实验中,65.7% 的有效 skill 来自步骤指引和检查单,真正补知识仅 4.5%
  • 未提炼工作记录还会提高超时率。
原帖 ↗
NFTCPS@NFTCPS26 likes

Datalab Marker v2 被社区转述为新一代文档解析流水线:单张 B200 GPU 每秒 23.7 页,支持 PDF、图片、DOCX、PPTX 转 Markdown,并覆盖 90 多种语言。

原帖 ↗
justinsuntron@justinsuntron73 likes
  • 社区转引 B.AI 消息称小米 MiMo-V2.5 已开放全量免费调用
  • 原帖称模型为 310B 稀疏 MoE,支持文本、图像、视频、音频和 1M 上下文。
BAI_AGI

B.AI 称小米 MiMo-V2.5 开启全量免费,支持全模态输入、1M 上下文和通用编程等场景。

原帖 ↗
elonmusk@elonmusk4983 likes
  • Elon Musk 转述 Grok Bot 用 10 分钟把 Doom 移植到新设备
  • 原作者称 Grok bot 已在 ESP32-S 上通过 Doom 测试并以较高帧率运行。
yunta_tsai

Yun-Ta Tsai 称 Grok bot 将 Doom 移植到 ESP32-S,并以较高帧率运行。

原帖 ↗