最新一期第 39 期 · 共 6 条信号
2026年7月31日
周五 · 过去 24 小时的 AI 世界

模型降本提速,机器人走向全身协作

  • OpenAI 下调 GPT-5.6 Luna 与 Terra 的价格,并为 Sol API 增加 Fast 模式。
  • Google DeepMind 同日发布 Gemini Robotics 2
本期判断
  • 今天的主线是前沿能力开始用更低单价、更快推理和更完整执行栈争夺真实工作负载。
  • 模型本身仍重要,但部署成本、硬件选择与任务编排正在共同决定采用速度。

本期速览

3 条
  1. 01OpenAI 下调两档模型价格
    • Luna 输入与输出价格均下调 80%。
  2. 02机器人模型扩展执行边界
    • Gemini Robotics 2 加入全身控制。
  3. 03开放权重模型缩小部署体量
    • Inkling-Small 为 2760 亿总参数。

编辑总结

今天最直接的变化是成本和延迟被写进模型产品分层。Luna、Terra 与 Sol Fast 面向不同预算和时效约束,开发者需要按完整任务而非单个 token 重新测算。

具身模型的增量则来自系统分工。Google 把全身动作、设备端执行与高层编排拆成三层,并首次把多机器人协作放进同一发布周期。

开放权重、TPU 后端和堆叠会话说明部署选择仍在扩张。当前状态、未来计划与案例演示必须分别理解,避免把预览、承诺或工作流文章写成已经全面交付的能力。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

Luna 降价幅度

输入与输出单价均相对本轮调整前价格下调

来源:OpenAI
80%

Terra 降价幅度

输入与输出单价均相对本轮调整前价格下调

来源:OpenAI
20%

Sol Fast 最高速度

OpenAI 自报最高相对标准模式速度,价格为标准模式 2 倍

来源:OpenAI
2.5 倍

SGLang GitHub 星标

LMSYS 文章发布时的项目规模快照,不代表单日新增

来源:LMSYS →
超过 3 万
Briefs

快讯 · 已核验与追踪

3 条
行业动态重要度 4/5中置信已核验

法官称政府仍未举证 Anthropic 风险标签

  • TechCrunch 报道,美国地区法官 Rita Lin 表示,政府仍未提交足够证据支持把 Anthropic 列为供应链风险。
  • 这是诉讼程序进展,不是最终实体判决,相关限制也未因此自动撤销。
要点拆解展开
Why

供应链风险标签会影响政府采购和承包商使用模型的边界。法院要求证据,可能改变 AI 厂商与政府争议的程序标准。

Impact

政府承包商暂不能据此假定限制失效。法务与采购团队应继续跟踪法院命令、补充证据和适用范围。

Numbers
报道更新时间
7 月 31 日 05:33北京时间;TechCrunch 页面更新时刻TechCrunch
早报判断
  • 争点正从政府能否采取风险措施,转向措施是否有可审查的事实记录。
  • 单场听证的质疑不能替代最终裁决,但会提高政府补证压力。
接下来看
  • 法院是否发布书面命令或初步禁令决定
  • 政府会提交哪些供应链风险证据
#Anthropic#美国政府#供应链风险#诉讼
工程实践重要度 3/5高置信官方源

SGLang 接入 Google TPU,PyTorch 后端计划年内推出

  • RadixArk 与 Google Cloud 宣布把 SGLang 扩展到 TPU。
  • SGL-JAX 当前已可用于最新 TPU
  • 额外的 PyTorch 原生 SGL-torchtpu 后端计划在 2026 年稍晚推出。
要点拆解展开
Why

推理软件栈决定硬件替换成本。统一 API 和缓存、量化、投机解码能力可让团队按工作负载选择硬件。

Impact
  • 现有 JAX 用户可试用 SGL-JAX。
  • PyTorch 团队暂时不能把 SGL-torchtpu 当作已交付能力,应等待代码和基准。
Numbers
GitHub 星标
超过 3 万文章发布时的 SGLang 项目快照,不是单日新增LMSYS
贡献者
超过 1700 人文章发布时的项目累计规模LMSYS
早报判断
  • 当前可用与未来计划必须分开:JAX 后端已经上线,PyTorch 后端和 Day 0 支持仍是承诺。
  • 若兑现,推理框架会降低 GPU 与 TPU 之间的迁移成本。
接下来看
  • SGL-torchtpu 的公开仓库和首个 release 何时出现
  • TPU 与 GPU 在相同模型上的吞吐和成本对比
#SGLang#Google TPU#RadixArk#JAX
工程实践重要度 2/5高置信官方源

GitHub 展示 Copilot 堆叠会话与拉取请求流程

  • GitHub 官方博客用旧项目现代化案例展示 Copilot app 的 stacked sessions。
  • 后续会话承接前序成果,并为拆分任务创建对应拉取请求
  • 原文没有把它写成当天全量发布公告。
要点拆解展开
Why

编码智能体能否进入团队流程,取决于改动是否可分段、可评审和可回滚。堆叠会话提供了一种任务组织样板。

Impact

开发团队可参考会话拆分与 PR 依赖管理。采用前仍需验证权限、冲突处理和失败恢复行为。

Numbers
文章发布时间
7 月 31 日 01:30北京时间;这是案例文章发布时间,不代表功能全量上线时刻GitHub Blog
早报判断
  • 文章价值在于演示如何把长任务拆成可审查的小差异,而不是宣布新模型。
  • 它把智能体并行效率与代码审查边界放在同一工作流里。
接下来看
  • GitHub 是否发布对应产品 changelog 与开放范围
  • 堆叠 PR 的冲突和下游 rebase 如何自动处理
#GitHub Copilot#编码智能体#Stacked PR#代码审查
Social Radar

社交雷达 · X 讨论

6 条
sama@sama11673 likes
  • Sam Altman 宣布 GPT-5.6 系列降价:Luna 输入
  • 输出价格下调 80%,降至每百万 token 0.20 美元和 1.20 美元
  • Terra 下调 20%,降至 2 美元和 12 美元。
  • Sol API 新增 Fast 模式,官方称速度最高为 2.5 倍,价格为 2 倍,智能水平不变。
原帖 ↗
GoogleAI@GoogleAI2679 likes
  • Google 发布 Gemini Robotics 2
  • 并介绍高层具身推理模型 Gemini Robotics ER 2:模型负责观察环境、规划动作、协调视觉—语言—动作模型并追踪进度
  • 目标是让机器人完成多步任务、失败后自我纠正并适应新场景。
原帖 ↗
thinkymachines@thinkymachines1976 likes
  • Thinking Machines 发布开放权重模型 Inkling-Small。
  • 官方称其规模约为 Inkling 的四分之一、性能可比,采用 2760 亿总参数和 120 亿激活参数
  • 用户可在 Tinker 微调,或在 Playground 中体验文本、图像和音频能力。
原帖 ↗
cursor_ai@cursor_ai1148 likes
  • Cursor 披露其内部合并 PR 中由云端智能体产出的比例已从去年 12 月的 10% 升至 56%。
  • 团队称,做法是给智能体独立云端计算机,并允许它们修复和改进自身环境,以承担更长的端到端工程任务。
原帖 ↗
TencentHunyuan@TencentHunyuan764 likes
  • 腾讯混元称,研究智能体 Hyra 与 Hy3 模型协助找到一个显式构造,证明有限整数集合中和集与差集增长指数的最优上界恰为 2。
  • 该问题的上界自 1969 年已知,但此前 50 多年的最佳构造仅略高于 1.1
  • 团队同时给出论文、博客和形式化证明。
原帖 ↗
GeminiApp@GeminiApp686 likes
  • Gemini Spark 接入 Chrome 的 auto browse。
  • 经用户授权后,Spark 可直接在浏览器中代办网页任务,官方举例包括安排看房和自动填写航班信息。
原帖 ↗
更多讨论6 条
openclaw@openclaw466 likes
  • OpenClaw 推出按月发布的 extended-stable 长期稳定通道,为旧版本回移植安全与可靠性修复
  • 同时上线公开成熟度评分卡,帮助团队判断哪些功能适合关键工作负载。
原帖 ↗
OpenAIDevs@OpenAIDevs417 likes
  • Codex 的 ImageGen 新增灯箱与画布,用于在工作流中查看和迭代视觉素材。
  • 演示展示了更直接的局部编辑方式:指向角色、擦除对象,或在标题位置留下修改意见。
dominik kundel
  • Dominik Kundel 演示 ChatGPT 与 Codex 桌面端的新图像编辑流程:用户可直接指向角色
  • 擦除不需要的内容,并在目标位置评论标题修改要求。
原帖 ↗
cognition@cognition320 likes
  • Devin 原生支持 GitHub Stacked PR:可将大改动拆为更小
  • 便于审查的差异,跨整个 PR 栈处理评审意见,并自动 rebase 下游改动。
原帖 ↗
arena@arena186 likes
  • Arena 发布 AutoEval,用基于数百万条真实用户偏好训练的奖励模型估算模型排名。
  • 官方称结果与在线人工评测高度一致,评测可从数天缩短至数小时,并覆盖文本、视觉、图像和代码榜单
  • 新模型的估算分数将直接显示在排行榜上。
原帖 ↗
Vtrivedy10@Vtrivedy1069 likes
  • LangChain Labs 更新 eval-engineering skill:新增带指令与示例的多轮模拟用户,补充后端与数据库环境模拟
  • 用 trace 校验环境是否贴近生产的方法,并加强与领域专家共同迭代 harness
  • 环境和验证器的指导。
原帖 ↗
evermind@evermind22 likes
  • EverMind 发布自进化智能体评测论文,主张由 LLM 诊断失败并提出 harness 改动,再由确定性程序执行有效性、激活、配对显著性和密封测试。
  • 团队称 7 个领域中有 6 个通过统计归因,密封测试提升 9.0 至 15.5 个百分点,并保留训练增益的 86% 至 147%。
原帖 ↗
Previous Editions

往期早报

全部归档 →