模型降本提速,机器人走向全身协作
- OpenAI 下调 GPT-5.6 Luna 与 Terra 的价格,并为 Sol API 增加 Fast 模式。
- Google DeepMind 同日发布 Gemini Robotics 2
- 今天的主线是前沿能力开始用更低单价、更快推理和更完整执行栈争夺真实工作负载。
- 模型本身仍重要,但部署成本、硬件选择与任务编排正在共同决定采用速度。
本期速览
3 条01OpenAI 下调两档模型价格
- Luna 输入与输出价格均下调 80%。
02机器人模型扩展执行边界
- Gemini Robotics 2 加入全身控制。
03开放权重模型缩小部署体量
- Inkling-Small 为 2760 亿总参数。
编辑总结
今天最直接的变化是成本和延迟被写进模型产品分层。Luna、Terra 与 Sol Fast 面向不同预算和时效约束,开发者需要按完整任务而非单个 token 重新测算。
具身模型的增量则来自系统分工。Google 把全身动作、设备端执行与高层编排拆成三层,并首次把多机器人协作放进同一发布周期。
开放权重、TPU 后端和堆叠会话说明部署选择仍在扩张。当前状态、未来计划与案例演示必须分别理解,避免把预览、承诺或工作流文章写成已经全面交付的能力。
本期导航
本期重点 · 深度报告
Key Numbers
Luna 降价幅度
输入与输出单价均相对本轮调整前价格下调
来源:OpenAITerra 降价幅度
输入与输出单价均相对本轮调整前价格下调
来源:OpenAISol Fast 最高速度
OpenAI 自报最高相对标准模式速度,价格为标准模式 2 倍
来源:OpenAI快讯 · 已核验与追踪
法官称政府仍未举证 Anthropic 风险标签
- TechCrunch 报道,美国地区法官 Rita Lin 表示,政府仍未提交足够证据支持把 Anthropic 列为供应链风险。
- 这是诉讼程序进展,不是最终实体判决,相关限制也未因此自动撤销。
要点拆解展开
供应链风险标签会影响政府采购和承包商使用模型的边界。法院要求证据,可能改变 AI 厂商与政府争议的程序标准。
政府承包商暂不能据此假定限制失效。法务与采购团队应继续跟踪法院命令、补充证据和适用范围。
- 报道更新时间
- 7 月 31 日 05:33北京时间;TechCrunch 页面更新时刻TechCrunch
- 争点正从政府能否采取风险措施,转向措施是否有可审查的事实记录。
- 单场听证的质疑不能替代最终裁决,但会提高政府补证压力。
- 法院是否发布书面命令或初步禁令决定
- 政府会提交哪些供应链风险证据
SGLang 接入 Google TPU,PyTorch 后端计划年内推出
- RadixArk 与 Google Cloud 宣布把 SGLang 扩展到 TPU。
- SGL-JAX 当前已可用于最新 TPU
- 额外的 PyTorch 原生 SGL-torchtpu 后端计划在 2026 年稍晚推出。
要点拆解展开
推理软件栈决定硬件替换成本。统一 API 和缓存、量化、投机解码能力可让团队按工作负载选择硬件。
- 现有 JAX 用户可试用 SGL-JAX。
- PyTorch 团队暂时不能把 SGL-torchtpu 当作已交付能力,应等待代码和基准。
- GitHub 星标
- 超过 3 万文章发布时的 SGLang 项目快照,不是单日新增LMSYS
- 贡献者
- 超过 1700 人文章发布时的项目累计规模LMSYS
- 当前可用与未来计划必须分开:JAX 后端已经上线,PyTorch 后端和 Day 0 支持仍是承诺。
- 若兑现,推理框架会降低 GPU 与 TPU 之间的迁移成本。
- SGL-torchtpu 的公开仓库和首个 release 何时出现
- TPU 与 GPU 在相同模型上的吞吐和成本对比
GitHub 展示 Copilot 堆叠会话与拉取请求流程
- GitHub 官方博客用旧项目现代化案例展示 Copilot app 的 stacked sessions。
- 后续会话承接前序成果,并为拆分任务创建对应拉取请求
- 原文没有把它写成当天全量发布公告。
要点拆解展开
编码智能体能否进入团队流程,取决于改动是否可分段、可评审和可回滚。堆叠会话提供了一种任务组织样板。
开发团队可参考会话拆分与 PR 依赖管理。采用前仍需验证权限、冲突处理和失败恢复行为。
- 文章发布时间
- 7 月 31 日 01:30北京时间;这是案例文章发布时间,不代表功能全量上线时刻GitHub Blog
- 文章价值在于演示如何把长任务拆成可审查的小差异,而不是宣布新模型。
- 它把智能体并行效率与代码审查边界放在同一工作流里。
- GitHub 是否发布对应产品 changelog 与开放范围
- 堆叠 PR 的冲突和下游 rebase 如何自动处理
社交雷达 · X 讨论
- Sam Altman 宣布 GPT-5.6 系列降价:Luna 输入
- 输出价格下调 80%,降至每百万 token 0.20 美元和 1.20 美元
- Terra 下调 20%,降至 2 美元和 12 美元。
- Sol API 新增 Fast 模式,官方称速度最高为 2.5 倍,价格为 2 倍,智能水平不变。
原帖 ↗- Google 发布 Gemini Robotics 2
- 并介绍高层具身推理模型 Gemini Robotics ER 2:模型负责观察环境、规划动作、协调视觉—语言—动作模型并追踪进度
- 目标是让机器人完成多步任务、失败后自我纠正并适应新场景。
原帖 ↗- Thinking Machines 发布开放权重模型 Inkling-Small。
- 官方称其规模约为 Inkling 的四分之一、性能可比,采用 2760 亿总参数和 120 亿激活参数
- 用户可在 Tinker 微调,或在 Playground 中体验文本、图像和音频能力。
原帖 ↗- Cursor 披露其内部合并 PR 中由云端智能体产出的比例已从去年 12 月的 10% 升至 56%。
- 团队称,做法是给智能体独立云端计算机,并允许它们修复和改进自身环境,以承担更长的端到端工程任务。
原帖 ↗- 腾讯混元称,研究智能体 Hyra 与 Hy3 模型协助找到一个显式构造,证明有限整数集合中和集与差集增长指数的最优上界恰为 2。
- 该问题的上界自 1969 年已知,但此前 50 多年的最佳构造仅略高于 1.1
- 团队同时给出论文、博客和形式化证明。
原帖 ↗- Gemini Spark 接入 Chrome 的 auto browse。
- 经用户授权后,Spark 可直接在浏览器中代办网页任务,官方举例包括安排看房和自动填写航班信息。
原帖 ↗更多讨论6 条
- OpenClaw 推出按月发布的 extended-stable 长期稳定通道,为旧版本回移植安全与可靠性修复
- 同时上线公开成熟度评分卡,帮助团队判断哪些功能适合关键工作负载。
原帖 ↗- Codex 的 ImageGen 新增灯箱与画布,用于在工作流中查看和迭代视觉素材。
- 演示展示了更直接的局部编辑方式:指向角色、擦除对象,或在标题位置留下修改意见。
原帖 ↗- Devin 原生支持 GitHub Stacked PR:可将大改动拆为更小
- 便于审查的差异,跨整个 PR 栈处理评审意见,并自动 rebase 下游改动。
原帖 ↗- Arena 发布 AutoEval,用基于数百万条真实用户偏好训练的奖励模型估算模型排名。
- 官方称结果与在线人工评测高度一致,评测可从数天缩短至数小时,并覆盖文本、视觉、图像和代码榜单
- 新模型的估算分数将直接显示在排行榜上。
原帖 ↗- LangChain Labs 更新 eval-engineering skill:新增带指令与示例的多轮模拟用户,补充后端与数据库环境模拟
- 用 trace 校验环境是否贴近生产的方法,并加强与领域专家共同迭代 harness
- 环境和验证器的指导。
原帖 ↗- EverMind 发布自进化智能体评测论文,主张由 LLM 诊断失败并提出 harness 改动,再由确定性程序执行有效性、激活、配对显著性和密封测试。
- 团队称 7 个领域中有 6 个通过统计归因,密封测试提升 9.0 至 15.5 个百分点,并保留训练增益的 86% 至 147%。
原帖 ↗