官方按下暂停键的一天:GPT-5.6 三档预览余热未散,看点转向开源追平与 Mythos 出口管制松动
- 过去 24 小时,OpenAI 与 Anthropic 官博都没有新的重要发布
- GPT-5.6 Sol/Terra/Luna 三档预览是 6-26 的余热,Claude Tag 进 Slack 是 6-23 的延续。
本期速览
3 条01OpenRouter 6 月 Insights
- 开源权重与闭源前沿差距稳定在 3-6 个月、过去 18 个月没被拉开
02OpenAI GPT-5.6 三档预览余热
- Terra
03Anthropic Claude Tag 把 Agent 搬进 Slack 做异步团队成员、跑在 Opus 4.8 上,自报产品团队 65% 代码已由它生成(远超 Google >30%、微软 20-30%);为 6-23 发布的延续报道
- Anthropic Claude Tag 把 Agent 搬进 Slack 做异步团队成员、跑在 Opus 4.8 上
本期编辑说明
本期归档日 2026-06-28(北京时间)。过去 24 小时,OpenAI 与 Anthropic 官方博客都没有新的重要发布——GPT-5.6 Sol/Terra/Luna 三档预览是 6 月 26 日的余热,Claude Tag 进 Slack 是 6 月 23 日发布的延续报道。当日真正的动态集中在社区与开源侧:OpenRouter 6 月 Insights 抛出『开源与闭源前沿差距稳定在 3-6 个月、18 个月没被拉开』的判断,DeepSeek 开源投机解码全栈库 DeepSpec,Coinbase 工程师披露『换开源默认模型后 AI 支出近乎减半、token 用量仍涨』;政策面上,被华府暂停访问的 Mythos 5 据社区转述出现『部分解禁』,亚洲厂商(360、Sakana AI)趁封锁窗口抢推 Mythos-like 模型。
5 篇深度页对应当天 5 条主线(GPT-5.6 三档预览、Claude Tag、开源权重追平、Mythos 出口管制、DeepSeek DSpark/DeepSpec),其余长尾条目覆盖 Codex/OpenCode 工具更新、SpaceX 收购光互联、GitHub agent skills 趋势,以及 MoA 协同失效、世界模型幻觉、简历筛选提示注入等当日 arXiv 研究。凡涉及 X 转述、厂商自报或社区命名的内容,文中均已标注 caveat 与待核实;Mythos『部分解禁』三类条款、DSpark 提速口径、Coinbase 成本数字等最抓眼球之处,恰恰也是最需要追问口径、等待官方坐实的地方,特此说明。
本期导航
本期重点 · 深度报告
Key Numbers
Anthropic 产品团队由 Claude Tag 生成的代码占比
厂商自报、口径未公开;横向对照 Google >30%(2024 底)、微软 20-30%(2025-04)
来源:Anthropic 官方博客 / The Decoder →DeepSeek V4 Flash SWE-bench / 定价
V4 Pro 80.6% 开源最高;输出成本约为 GPT-5.5 的 1/150(理想口径,实际看托管)
来源:OpenRouter Insights / DeepSeek 官方定价 →快讯 · 已核验与追踪
论文:67 个前沿模型实测,Routing/Voting/MoA 的『协同失效上限』
- 一篇 arXiv 论文(When Does Combining Language Models Help?
- )在 67 个前沿模型上系统分析了 Routing、Voting、Mixture-of-Agents 三类『组合多模型』策略,提出『协同失效上限(Co-Failure Ceiling)』:当被组合的模型倾向于在同一批样本上同时犯错时,无论怎么路由、投票或混合,集成收益都存在一个由共同失败决定的天花板。
要点拆解展开
为正在升温的 multi-agent/MoA 路线提供了一个冷静的理论边界——集成收益受成员『共同失败』封顶,而非取决于组合策略的精巧。
对做多智能体/模型集成的团队:提示应优先优化成员模型的『错误多样性』,而非盲目堆模型或调路由策略。
- 这篇给当下火热的 multi-agent / MoA 叙事泼了一盆必要的冷水。
- 业界默认『多个模型一起上总比单个强』,但这篇用 67 个模型的大规模实证指出:集成的收益不取决于你用了多巧妙的路由或投票,而取决于成员模型的错误是否相关
- 如果大家在同样的难题上一起翻车,再复杂的组合也救不回来。
- 这与早报此前覆盖过的 EDV『自我确认陷阱』遥相呼应:多智能体系统的护城河不在『数量』或『拓扑』,而在成员之间的『错误多样性』。
论文:LLM 自动简历筛选可被提示注入攻破,单注入与多注入实测
- 一篇 arXiv 论文(Prompt Injection in Automated Résumé Screening with Large Language Models)研究用 LLM 做自动简历筛选时的提示注入攻击,在『单注入』与『多注入』两种设置下实测
- 求职者可在简历中嵌入隐藏指令操纵 LLM 的筛选/打分结果,从而不公平地抬高自己的通过率。
要点拆解展开
把 prompt injection 从演示推进到就业公平/企业合规的高利害真实场景,揭示『LLM 读外部不可信文本做决策』这类流程的普遍风险。
- 对用 LLM 做简历初筛/文档决策的企业:输入侧指令隔离与注入检测成为合规必需
- 对 agent 安全:能力越自主,被注入操纵的后果越严重。
- 这是 prompt injection 从『安全研究者的演示』落到『高利害真实场景』的一个典型案例。
- 简历筛选直接关系到就业公平和企业合规,而越来越多公司在用 LLM 做初筛——这意味着攻击面已经实实在在地存在于招聘流水线里。
- 论文区分单注入与多注入,说明攻击不是非黑即白,而是有强度梯度的。
- 它的现实意义大于学术意义:任何把 LLM 接入『读取外部不可信文本并据此做决策』的流程(简历、合同、用户提交内容),都继承了同一类风险。
OpenAI Codex 本周体验更新:长线程滚动更顺、复制到 Slack 保留 Markdown
- 据 @OpenAIDevs / @thsottiaux,Codex 本周落地一批体验改进:超长对话线程滚动更顺滑、浏览时阅读位置不再跳动
- 线程切换后台开销降低、可加载更深本地历史
- 从 Codex 复制内容粘贴到 Slack 时完整保留 Markdown(列表/加粗/代码块/链接)、大段粘贴不再卡 UI
- 新增可悬停的导航栏轮次预览、设置搜索覆盖更多控件,以及一个 Pets 面板。
要点拆解展开
佐证 Slack 工作流入口正成为 coding agent 的兵家必争之地,且竞争从能力转向体验细节。
对 Codex 用户:长线程与跨工具(Slack)协作体验改善;对竞品:体验打磨成为能力收敛后的新差异化维度。
- 这批更新看着琐碎,但方向值得注意:OpenAI 在抢 Slack 这个工作流入口
- 『复制到 Slack 保留 Markdown』和同周 Anthropic Claude Tag 进 Slack 是同一战场的两种打法,一个把 Agent 直接驻进频道,一个优化『从 IDE 到 Slack』的内容流转。
- 当各家旗舰能力差距收敛,产品体验(长线程不卡、粘贴不丢格式)这种『最后一公里』的打磨会越来越成为留住开发者的护城河。
- Pets 面板这种小彩蛋也透露出 Codex 在往『日常陪伴型工具』而非纯命令行工具演化。
论文:世界模型的幻觉是可预测、可预防的
- 一篇 arXiv 论文(Hallucination in World Models is Predictable and Preventable)研究世界模型(用于 agent 规划/仿真的环境预测模型)中的幻觉问题,主张这类幻觉并非随机不可控,而是可预测
- 可预防的,并给出相应的识别与抑制方法。
要点拆解展开
直击『世界模型当可控模拟器替代真实环境训 agent』这条路线的关键约束——模拟器自身的幻觉可控性,决定该范式能否落地。
- 对押注模拟环境降低 agent 训练成本的团队:若幻觉可预测可预防,世界模型作为 RL 环境的可靠性就有了工程抓手
- 方法泛化性待第三方验证。
- 这条接在 Qwen-AgentWorld 等『把世界模型当 agent 训练第一性目标』的热潮之后,问到了点子上:如果要用世界模型做可控模拟器来替代真实环境训练 agent,那模拟器自己会不会『幻觉』出不存在的状态转移,就是整条路线成立与否的关键约束。
- 如果幻觉真的可预测、可预防,意味着世界模型作为 RL 训练环境的可靠性有了工程抓手
- 这对正在押注『模拟环境降低 agent 训练成本』的团队是结构性利好。
- 但『可预测可预防』是论文主张,具体方法的泛化性和在大规模复杂环境下的有效性,仍需第三方在真实 agentic 任务上验证。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
待验证|SpaceX 收购光互联公司 Mesh:为 AI 数据中心与轨道算力铺路
- 据 @qinbafrank 深度拆解,SpaceX 收购光互联公司 Mesh(已获 FTC 快速批准)。
- Mesh 由三位前 SpaceX 工程师 2025 年创立,创始人曾主导 Starlink 星间激光链路设计,核心产品是面向 AI 数据中心的高速光学收发器(用光代替电信号互联)。
- 收购动机:收回核心人才与技术
- 解决 AI 数据中心互联的功耗/速度瓶颈(光互联被视为下一代方案)
要点拆解展开
AI 算力竞赛正向最底层的物理互联(光互联)延伸,SpaceX 凭星间激光技术切入 AI 数据中心互联是一条难以复制的垂直整合路径。
- 对 AI 基础设施:光互联可能成为突破数据中心功耗/带宽墙的关键
- 对格局:SpaceX 从发射服务商向 AI 基础设施玩家延伸,且已绑定 Anthropic/Google 算力合同。
- 这条把『AI 算力竞赛』的战线从模型和芯片往下拉到了最底层的物理互联。
- 当数据中心规模逼近功耗与带宽墙,GPU 之间、机柜之间的互联效率成了新瓶颈,光互联(硅光/光学收发器)正是被押注的下一代方案。
- SpaceX 收购 Mesh 的真正野心藏在『轨道数据中心』那句里
- 把星间激光链路的现成技术(已部署 2.3 万个激光器)迁移到地面 AI 数据中心互联,再反向铺向太空算力,是一条别人很难复制的垂直整合路径。
Coinbase 工程拆解:AI 支出砍半靠自建 LLM 网关 + 换默认模型 + 缓存路由
- 据 @markletree 转述 Coinbase 工程实现细节:本季度 AI 支出几乎砍半、token 用量持续攀升,全部请求走自建 LLM 网关(单一端点 + 格式,跨厂商故障转移、脱敏、日志、成本管控)。
- 三招省钱:
- (1)更便宜的默认模型——91% 员工根本碰不到用量上限,于是不降配额、改默认廉价模型(据 CEO Brian Armstrong 称在试用 GLM 5.2、Kimi 2.7 等开源权重)
- (2)缓存——在 LibreChat 把命中率从 5% 拉到 60%
要点拆解展开
为『企业大规模换开源模型省钱』提供了少见的工程级细节,且揭示成本杠杆在架构(网关/缓存/路由)而不只在模型单价。
- 对企业 LLMOps:给出可复制的省钱组合拳(自建网关 + 高缓存命中 + 缓存感知路由)
- 印证『低价激发用量』而非单纯削减预算。
- 这是『开源追平』那条主线最硬的需求侧证据——而且它比『换个便宜模型』复杂得多。
- Coinbase 的关键洞察是:省钱的杠杆不只在模型单价,更在工程架构(网关 + 缓存命中率 + 缓存感知路由)。
- 把缓存命中率从 5% 拉到 60% 这一招,价值可能不亚于换模型本身,因为它直接决定了每次请求要为多少 token 付全价。
- 这条也给所有想复制 Coinbase 路线的企业提了个醒:换开源默认模型是入场券,真正把成本压下来的是围绕它的整套 LLMOps 工程。
待验证|GitHub 涨星榜:agent skill 包与 context 文件正成为新的开发者 dotfiles
- 据 @sharbel 整理,本周 GitHub 涨星最快的 10 个仓库主题集中在『agent skill 包与 context 文件正成为新的开发者 dotfiles』:OpenMontage(+17.2K,首个开源 agentic 视频制作系统,12 条 pipeline/52 工具/500+ agent skills)、skills(+11.1K,来自作者 .claude 目录的工程师 skills)、codebase-memory-mcp(+7.6K,把代码库索引成持久知识图谱,158 种语言、亚毫秒查询、省 99% token)、Agent-Reach(+7.2K,给 agent 读/搜 Twitter/Reddit/YouTube/B站等)、Anthropic-Cybersecurity-Skills(+5.1K,817 个安全 skill 映射 MITRE ATT&CK 等 6 套框架)。
- 另据 @zrebroia,一个让 Claude『像最懒资深工程师那样编码』的 skill 一周冲到 5.8 万星、2.9k fork,宣称代码量少 54%、便宜 20%、快 27%。
要点拆解展开
揭示用 agent 的核心竞争力正从『选模型』转向『配 skill 与上下文』,skill 生态成为 agent 工具新的差异化战场。
- 对开发者:可移植、可分享的 agent skill 包正成为新的生产力资产
- 对工具厂商:skill/context 生态的丰富度成为留住用户的关键。
- 『agent skill 正成为新 dotfiles』这个判断很到位:过去开发者攒的是 .vimrc、.zshrc 这类个人配置,现在攒的是 .claude 目录里的 skill 和 context 文件
- 可移植、可分享、可版本控制的『agent 能力包』。
- 这背后是一个范式转移:用 agent 的核心竞争力,正从『选哪个模型』转向『给它配哪套 skill 和上下文』。
- codebase-memory-mcp『省 99% token』和那个『少 54% 代码』的 skill 之所以能爆火,恰恰因为它们直击了 agentic 编码最痛的成本与上下文管理问题。
待验证|OpenCode v2 发布:TUI / 桌面 / Web 多端共享同一后端,默认全部同步
- 据作者 @thdxr(推文 3348 赞),OpenCode v2 让 TUI、桌面端和 Web 端的所有实例共享同一个后端,默认全部同步
- 无论开多少个窗口,资源占用都被压到最低。
要点拆解展开
反映开源 coding agent 在架构上向『多端共享后端、状态默认同步』收敛,降低多设备协作摩擦。
- 对 OpenCode 用户:多窗口/多设备资源占用下降、状态一致
- 对生态:『共享后端』可能成为下一代 agent 工具的默认架构。
- 这是 coding agent 工具走向『多端一致』的一个务实信号:开发者越来越常在终端
- 桌面 App 和浏览器之间来回切,各端各跑一份后端既费资源又导致状态不一致。
- OpenCode v2 把后端单一化、状态默认同步,等于把『一个 agent session』从某个具体窗口里解放出来,成为可以多处接入的共享资源
- 这和 Claude Tag『一个频道一个共享 Claude、任何人可接力』在理念上同源,都是把 agent 从『单点工具』变成『可共享的常驻服务』。
待验证|awesome-evals 等开源资源升温:Agent 评测正从『刷榜』走向工程化基础设施
- 本周 GitHub 多个 agent 工具/资源升温:benchflow-ai/awesome-evals(544★,Agent 评测论文/工具/基准精选库)
- eli-labz/Godcoder(245★,本地优先开源编码 agent,代码不离机)
- NotASithLord/peerd(202★,首个浏览器原生 agent harness)
- lightbearco/tupper(128★,本机安全运行不可信 AI 生成代码的沙箱)。
要点拆解展开
agent 评测与安全运行正从『刷榜』升级为工程化基础设施赛道,反映 agent 走向生产后对『严肃评测 + 安全运行』的刚需。
- 对 agent 开发者:可复用的评测库、沙箱、浏览器 harness 降低了『严肃评测 + 安全运行』的门槛
- 对评测社区:LLM-as-judge 向可诊断、可反哺改进演进。
- 把这几个项目放在一起看,一条清晰的趋势浮现:agent 评测与运行环境正在从『跑个 benchmark 报个分』变成一类正经的工程基础设施。
- awesome-evals 这种精选库的走红,说明社区开始系统性沉淀『怎么评测 agent』的知识
- tupper(沙箱)、peerd(浏览器 harness)、Godcoder(本地优先)则各自补上 agent 安全运行的一块拼图
- 尤其 tupper 直击『AI 生成代码不可信怎么安全跑』这个随 coding agent 普及而愈发尖锐的问题。
社交雷达 · X 讨论
- OpenAI 官方放出新一代前沿模型 GPT-5.6 的限量预览,一次推三档:GPT-5.6 Sol(下一代旗舰前沿模型)
- GPT-5.6 Terra(日常高效场景的均衡档)
- GPT-5.6 Luna(面向高并发的快速廉价档)。
- 配文"New models are on the horizon",社区测试集中在前端设计、仿真、游戏与建模能力的显著提升,并普遍拿来对标 Fable。
原帖 ↗OpenCode v2:TUI、桌面端和 Web 端的所有实例共享同一个后端,默认全部同步,无论开多少个窗口资源占用都被压到最低。
原帖 ↗- Codex 本周一批体验优化上线:长对话线程滚动更顺滑、浏览会话时阅读位置不再跳动
- 线程切换的后台开销降低,可加载更深的本地历史而无需一次性全量载入
- 归档对话更易滚动和删除
- Dock 与侧边栏的未读角标保持同步。
原帖 ↗- 本周 GitHub 涨星最快的 10 个仓库,主题集中在 agent skill 包与 context 文件正在成为新的开发者 dotfiles:1) OpenMontage(+17.2K)首个开源 agentic 视频制作系统,12 条 pipeline、52 个工具、500+ agent skills
- 2) skills(+11.1K)来自作者 .claude 目录的工程师 skills
- 3) codebase-memory-mcp(+7.6K)把代码库索引成持久知识图谱,支持 158 种语言、亚毫秒查询、省 99% token
- 4) Agent-Reach(+7.2K)给 agent 读/搜 Twitter/Reddit/YouTube/GitHub/B站/小红书,零 API 费
原帖 ↗- OpenAI 的 Codex 本周落地一批体验改进:能流畅处理超长对话线程
- 新增可悬停的导航栏预览/跳转各轮
- 设置搜索覆盖更多控件,自定义 provider 设置更易找
- 缩放时不再错位 tooltip/对话框/菜单等
原帖 ↗- 推荐一篇关于 LLM-as-judge 的论文 BINEVAL:把每条评估标准拆成若干原子化的是/否问题,对每个输出逐题独立判断,再聚合成校准过的多维分数。
- 好处是整体评分会隐藏推理过程与天花板效应,而 BINEVAL 每个问题级判定都可检视,能精确诊断输出为何低分,且这些判定可直接反哺成有针对性的提示词改进信号。
- 在 SummEval、Topical-Chat、QAGS 上无需训练即可匹敌或超过 UniEval 与 G-Eval,在事实一致性上尤其强。
原帖 ↗更多讨论7 条
- DeepSeek 联合北京大学发布投机采样加速框架 DSpark 技术报告,并开源全栈代码库 DeepSpec,DSpark 已部署于 DeepSeek-V4 线上业务。
- 在输出无损前提下,Flash 版单用户生成速度提升 60%-85%,Pro 版提升 57%-78%,表现超过原 MTP-1 基线。
- 技术上先用 DFlash 并行主干生成隐藏状态,再追加轻量马尔可夫头(查表+一次矩阵乘)串行注入相邻词关联,配合置信度预测头与异步零开销调度避免高并发下吞吐崩塌。
原帖 ↗- 深度拆解 SpaceX 收购 Mesh(已获 FTC 快速批准):Mesh 由三位前 SpaceX 工程师 2025 年创立,创始人曾主导 Starlink 星间激光链路设计,核心产品是面向 AI 数据中心的高速光学收发器(用光代替电信号互联)。
- 收购动机:收回核心人才与技术
- 解决 AI 数据中心互联功耗/速度瓶颈(光互联是下一代方案)
原帖 ↗- Anthropic 旗舰模型 Mythos 5 的出口管制部分解禁,仅限三类:
- (1)Anthropic 自家非美籍研究人员
- (2)美国"可信合作伙伴"及其外籍员工
原帖 ↗- Coinbase 工程师披露本季度 AI 支出几乎砍半、而 token 用量持续攀升的实现细节:全部请求走自建 LLM 网关(单一端点+格式,跨厂商故障转移、脱敏、日志、成本管控)。
- 三招省钱——(1)更便宜的默认模型:91% 员工根本碰不到用量上限,于是不降配额改默认廉价模型
- (2)缓存:在 LibreChat 把命中率从 5% 拉到 60%,靠维持长而稳定的前缀让每次只对新 token 付全价
原帖 ↗- 援引聚合商 OpenRouter 的分析:开源模型与闭源前沿的性能差距已稳定在 3-6 个月,过去 18 个月闭源实验室没能拉开身位。
- 具体数据:DeepSeek V4 Flash(2840 亿参数)在 SWE-bench Verified 拿到 79.0%,逼近 GPT-5.5
- 官方输入/输出定价 0.14/0.28 美元每百万 token,输出成本比 GPT-5.5 便宜约 150 倍,即便加西方云托管溢价实际成本也只有闭源前沿的约 1.3%。
原帖 ↗- 顺着 Noam Brown(OpenAI 研究科学家)"任何评测上报都应固定推理预算"的说法可以推出一个有意思的结论:开源模型在"每美元算力能买到的 token"上远比闭源 API 划算。
- 因此今天发布开源模型
- 或因处境而倾向开源的玩家,理应用"在主流推理服务商上按美元推理成本"来标注思考强度(thinking levels),而不是用横轴上的 token 数。
原帖 ↗- 中文圈近两日出现一波 Claude 封号反馈,理由多为"unusual activity",不少中国用户打开 Claude 只看到 account_banned。
- 作者补了个戏剧化背景:Anthropic CEO Dario Amodei 十年前曾在百度硅谷 AI 实验室参与 Deep Speech 2,公开履历写着"2015 Q2 百度季度之星"。
原帖 ↗