Luna 降价幅度
输入与输出单价均相对本轮调整前价格下调
来源:OpenAI今天最直接的变化是成本和延迟被写进模型产品分层。Luna、Terra 与 Sol Fast 面向不同预算和时效约束,开发者需要按完整任务而非单个 token 重新测算。
具身模型的增量则来自系统分工。Google 把全身动作、设备端执行与高层编排拆成三层,并首次把多机器人协作放进同一发布周期。
开放权重、TPU 后端和堆叠会话说明部署选择仍在扩张。当前状态、未来计划与案例演示必须分别理解,避免把预览、承诺或工作流文章写成已经全面交付的能力。
输入与输出单价均相对本轮调整前价格下调
来源:OpenAI输入与输出单价均相对本轮调整前价格下调
来源:OpenAIOpenAI 自报最高相对标准模式速度,价格为标准模式 2 倍
来源:OpenAI供应链风险标签会影响政府采购和承包商使用模型的边界。法院要求证据,可能改变 AI 厂商与政府争议的程序标准。
政府承包商暂不能据此假定限制失效。法务与采购团队应继续跟踪法院命令、补充证据和适用范围。
推理软件栈决定硬件替换成本。统一 API 和缓存、量化、投机解码能力可让团队按工作负载选择硬件。
编码智能体能否进入团队流程,取决于改动是否可分段、可评审和可回滚。堆叠会话提供了一种任务组织样板。
开发团队可参考会话拆分与 PR 依赖管理。采用前仍需验证权限、冲突处理和失败恢复行为。
社交雷达 · X 讨论
- Sam Altman 宣布 GPT-5.6 系列降价:Luna 输入
- 输出价格下调 80%,降至每百万 token 0.20 美元和 1.20 美元
- Terra 下调 20%,降至 2 美元和 12 美元。
- Sol API 新增 Fast 模式,官方称速度最高为 2.5 倍,价格为 2 倍,智能水平不变。
原帖 ↗- Google 发布 Gemini Robotics 2
- 并介绍高层具身推理模型 Gemini Robotics ER 2:模型负责观察环境、规划动作、协调视觉—语言—动作模型并追踪进度
- 目标是让机器人完成多步任务、失败后自我纠正并适应新场景。
原帖 ↗- Thinking Machines 发布开放权重模型 Inkling-Small。
- 官方称其规模约为 Inkling 的四分之一、性能可比,采用 2760 亿总参数和 120 亿激活参数
- 用户可在 Tinker 微调,或在 Playground 中体验文本、图像和音频能力。
原帖 ↗- Cursor 披露其内部合并 PR 中由云端智能体产出的比例已从去年 12 月的 10% 升至 56%。
- 团队称,做法是给智能体独立云端计算机,并允许它们修复和改进自身环境,以承担更长的端到端工程任务。
原帖 ↗- 腾讯混元称,研究智能体 Hyra 与 Hy3 模型协助找到一个显式构造,证明有限整数集合中和集与差集增长指数的最优上界恰为 2。
- 该问题的上界自 1969 年已知,但此前 50 多年的最佳构造仅略高于 1.1
- 团队同时给出论文、博客和形式化证明。
原帖 ↗- Gemini Spark 接入 Chrome 的 auto browse。
- 经用户授权后,Spark 可直接在浏览器中代办网页任务,官方举例包括安排看房和自动填写航班信息。
原帖 ↗更多讨论6 条
- OpenClaw 推出按月发布的 extended-stable 长期稳定通道,为旧版本回移植安全与可靠性修复
- 同时上线公开成熟度评分卡,帮助团队判断哪些功能适合关键工作负载。
原帖 ↗- Codex 的 ImageGen 新增灯箱与画布,用于在工作流中查看和迭代视觉素材。
- 演示展示了更直接的局部编辑方式:指向角色、擦除对象,或在标题位置留下修改意见。
原帖 ↗- Devin 原生支持 GitHub Stacked PR:可将大改动拆为更小
- 便于审查的差异,跨整个 PR 栈处理评审意见,并自动 rebase 下游改动。
原帖 ↗- Arena 发布 AutoEval,用基于数百万条真实用户偏好训练的奖励模型估算模型排名。
- 官方称结果与在线人工评测高度一致,评测可从数天缩短至数小时,并覆盖文本、视觉、图像和代码榜单
- 新模型的估算分数将直接显示在排行榜上。
原帖 ↗- LangChain Labs 更新 eval-engineering skill:新增带指令与示例的多轮模拟用户,补充后端与数据库环境模拟
- 用 trace 校验环境是否贴近生产的方法,并加强与领域专家共同迭代 harness
- 环境和验证器的指导。
原帖 ↗- EverMind 发布自进化智能体评测论文,主张由 LLM 诊断失败并提出 harness 改动,再由确定性程序执行有效性、激活、配对显著性和密封测试。
- 团队称 7 个领域中有 6 个通过统计归因,密封测试提升 9.0 至 15.5 个百分点,并保留训练增益的 86% 至 147%。
原帖 ↗