2026年6月26日 · 周五
GPT-5.6 三档齐发,前沿 AI 进入"政府审批"时代
- OpenAI 预览 GPT-5.6——旗舰 Sol、均衡 Terra、低价 Luna 三档齐发,主攻网络安全与长程推理。
- 但与模型同样抢眼的是治理:美国政府要审查谁能用 GPT-5.6 并要求延期,Anthropic 的 Mythos 5/Fable 5 也在政府指令下暂停又部分恢复,前沿 AI 正被纳入国家安全框架。
本期速览
3 条01OpenAI 预览 GPT-5.6 三档
- 旗舰 Sol、均衡 Terra(对标 5.5、价格腰斩)、低价 Luna
02美国政府将审查谁能用 GPT-5.6 并要求延期
- Anthropic Mythos 5
03Anthropic 指控阿里巴巴非法提取 Claude 模型能力
- Reuters 报道引爆 HN(1297 评论)
On this page
本期导航
Deep Dives
本期重点 · 深度报告
Briefs
快讯 · 已核验与追踪
行业动态
OpenAI 公布自研推理芯片 Jalapeño,联合 Broadcom 量产
- OpenAI 公布首款自研 AI 芯片 Jalapeño,由其从零设计
- 联合 Broadcom 量产,专为驱动 ChatGPT/Codex/API 及未来 agentic 产品的 LLM 推理负载打造,把全栈平台从产品
- 模型进一步延伸到基础设施。
早报判断
- 自研推理芯片是 OpenAI 对 NVIDIA 依赖与推理成本的双重对冲:GPT-5.6 既要上 Cerebras 冲 750 tok/s,又靠自研硅压成本,说明"谁掌握推理经济性谁掌握定价权"已成共识。
- 结合 Terra"比 5.5 便宜一半"的定价,OpenAI 正用垂直整合把成本曲线握进自己手里。
- 短期内 Broadcom 代工、产能爬坡与软件栈成熟度仍是变数,首代自研芯片能承接多少真实流量需观察。
产品上新
Google 在 Gemini 3.5 Flash 中加入 Computer Use
Google 发布 Gemini 3.5 Flash 的 computer use 能力,把屏幕操作/agentic 控制下放到低价快速档,登上 HN(241 分/167 评论)。
早报判断
- 把 computer use 放进最便宜的 Flash 档,意味着"让 agent 直接操作屏幕"正从旗舰能力变成默认能力,价格敏感的批量自动化场景首次有了可负担选项。
- 这与 OpenAI Terra/Luna 压价
- Qwen 开源 OS/Android 环境模型是同一股力量:agentic 能力正在快速平民化。
- 真正要看的是它在真实 GUI 任务上的可靠性与越权风险,而非演示成功率。
融资动态
高通收购 AI 基础设施初创 Modular(Mojo 母公司)
Reuters 报道高通将收购 AI 基础设施初创 Modular——Mojo 语言与统一 AI 编译/推理栈的开发商,HN 讨论 125 条。
早报判断
- Modular 押注的是"跨硬件统一 AI 软件栈",对想绕开 CUDA 锁定的厂商极有价值
- 高通拿下它,是要给自家边缘/移动 AI 芯片配一套不依赖 NVIDIA 生态的软件层。
- 这与 OpenAI 自研 Jalapeño
- NVFP4 在 Blackwell 上跑 GLM 是一条线:2026 年的竞争焦点正从模型转向"谁能让推理在自家硬件上又快又便宜地跑起来"。
产品上新
NVIDIA/vLLM 发布 GLM-5.2 NVFP4 量化版,一行命令本地起服务
- NVIDIA 与 vLLM 官方发布 GLM-5.2 的 NVFP4 4-bit 量化 checkpoint,vllm serve nvidia/GLM-5.2-NVFP4 即可起 OpenAI 兼容 API
- 针对 Blackwell 大幅削减 VRAM,且在推理/编码/1M 上下文上对精度持平。
- GLM-5.2 为 753B 参数 MoE,擅长 agentic 负载。
早报判断
- NVFP4 让 753B 级开源模型在单机 Blackwell 上零云成本跑 agentic 负载成为现实,是开源权重"可用性"的一次实质跃迁。
- 但它也暴露矛盾:开源模型要靠 NVIDIA 官方量化才好用,硬件生态话语权仍握在闭源一方。
- 对照 Mollick"终端用户只想要大牌"的观察,本地自托管仍是少数硬核团队的游戏。
行业动态
Gemma 4 上线 2.5 个月下载破 2 亿次
Google DeepMind 称 Gemma 4 在仅 2.5 个月内达到 2 亿次下载。
早报判断
- 2 亿次下载印证开放权重生态的真实体量,也是 Google 在闭源 Gemini 之外的第二条腿。
- 放在"美国政府能否封禁开放权重"(Mollick)与 GLM/Qwen 开源攻势的同框里,这个数字是 Google 对"开源不能输"的下注。
- 但下载量不等于生产部署量,真实留存与商用占比才是后续看点。
行业动态
美国 AI 股抛售波及全球市场
The Guardian 报道美国 AI 股集中抛售,冲击从华尔街到亚洲的市场情绪。
早报判断
- AI 股回调与 HN 热议的"当前 LLM 成本不可持续"、能力过剩论同时出现,反映市场开始对"巨额资本开支何时变现"施压。
- 一边是 GPT-5.6、自研芯片、超大集群继续烧钱,一边是估值承压——2026 下半年 AI 叙事的关键变量正从"能力"转向"单位经济性"。
- 对仍在融资的初创,窗口可能收紧。
行业动态
法国财政部试用后弃用阿里 Qwen,改投本土 Mistral
- 据法新社,法国经济与财政部证实其财政总局 6 月在约 100 名工作人员中试用阿里 Qwen,数日后因部分涉华议题回答被指"亲中倾向/导向性"而停用,改用本土 Mistral。
- (目前经 X 转述,待官方原文核实)
早报判断
- 这是"模型价值取向"首次成为政府采购的硬否决项,而非性能或价格。
- 叠加 Anthropic 指控阿里蒸馏 Claude
- 美国政府审批 GPT-5.6,主权 AI 的逻辑正在固化:谁训练的
- 价值观偏向谁,比跑分更决定能否进政府与关键行业。
行业动态
AI 质检翻车,福特重新雇回资深检验员
Bloomberg 报道福特因 AI 在质量检测上表现不及预期,重新雇回经验丰富的"gray beard"(资深)检验员,HN 讨论 321 条。
早报判断
- 这是对"AI 能力过剩、变革已锁定"乐观叙事的一记现实校正:在容错率极低的工业质检场景,AI 的长尾错误成本远高于人工。
- 它不否定 AI 价值,而是提醒"人机协同"比"全自动替代"更可落地。
- 当多数报道在谈模型刷榜时,制造业一线的真实采用曲线更值得关注。
#福特#制造业#AI 落地#质检
观点观察
大型 AI 实验室正大量招聘哲学家
The Economist 报道,大型 AI 实验室正招聘越来越多哲学家,参与对齐、价值观与模型行为设计。
早报判断
- 实验室招哲学家不是务虚:当模型的"价值取向"能直接导致法国政府弃用 Qwen、决定能否通过对齐与安全审查,价值判断已成为产品规格的一部分。
- 这与 Anthropic Public Record、AI 政治偏见研究同属一条线——前沿竞争正从"更聪明"延伸到"价值观可被定义与审计"。
#AI 对齐#哲学#价值观#Economist
行业动态
NVIDIA 45°C 液冷设计将数据中心用水降至近零
NVIDIA 公布 45°C 温水液冷设计,称可把 AI 数据中心用水量降至接近零,HN 讨论 424 条。
早报判断
- 在 AI 数据中心因耗水耗电频遭社区与监管阻力时,近零用水的液冷是缓解"许可证风险"的关键工程。
- 它把约束从"能不能建"转回"电从哪来",也是 NVIDIA 锁定 AI Factory 整机柜方案、不止卖芯片的又一步。
- 能否规模化落地、PUE 与综合成本数据是检验点。
社交雷达 · X 讨论
- agent 使用姿势的一次大转变:从「任务拆解 + 用过即弃 + 靠 skills/文档转移经验」的任务型 agent,转向按领域 scope 拆解的长期 agent
- 长期复用同一 session、不抗拒 /compact(例如把一个项目拆成前后端两个 agent)。
- 作者体感长期 agent 划分得当会「越用越跟手」。
- 痛点:当前 agent 的「毁灭式上下文压缩」会完全破坏 trajectory,仍有很大优化空间
原帖 ↗用 Seedance 2.0 以原生 4K 分辨率重跑了一条 Codepilot 宣传片,文字清晰度和材质质感都大幅提升,作者强调这是 1080P 超分根本做不到的效果。
原帖 ↗- 推荐开源 AI 新闻雷达 Horizon(MIT 协议):直接从源头抓一手内容,用 AI 打分/去重/补背景/总结社区讨论,自动生成中英双语每日简报。
- 支持 Hacker News、Reddit、Telegram、RSS、X、GitHub、OpenBB 等几乎所有主流信息源
- 兼容 Claude/GPT/Gemini/DeepSeek/Ollama
- 同一事件跨平台自动合并并补充背景
原帖 ↗- Claude Code 配置不该只塞一个 CLAUDE.md,建议拆成七层:1) CLAUDE.md 项目级上下文与规范
- 2) settings.json 权限/模型/hooks
- 3) rules/ 按主题拆分规则
- 4) commands/ 沉淀可重复工作流
原帖 ↗- NVIDIA 与 vLLM 官方发布 GLM-5.2 的 NVFP4 量化版,一行命令 vllm serve nvidia/GLM-5.2-NVFP4 即可本地起一个 OpenAI 兼容 API。
- 针对 Blackwell 显卡的 4-bit 量化相比 FP8 大幅削减 VRAM 占用,同时在推理/编码/1M 上下文上保持原模型精度。
- 模型为 753B 参数的 MoE,擅长 Agentic 工作负载——意味着开放权重 + 硬件加持能在自家服务器零云成本跑起来。
原帖 ↗谷歌官方放出一套 8 分钟免费课,手把手从零跑通自动化循环架构、教你搭建第一个 AI Agent。
原帖 ↗更多讨论9 条
用 Codex 开发 iOS app 体验很顺:Product Design + 内置浏览器做原型,iOS App Build 做开发,配合内置模拟器预览功能,现在已经不需要打开 Xcode 了。
原帖 ↗- 转译 Recurse Center 的 Nick Bergson-Shilcock 观点:每个程序员都该亲手写一个 agent,只要 50 行代码。
- 两个建议:1) 从零手敲每一行,不用任何 AI(连自动补全都不用)
- 2) 只依赖语言标准库文档和模型 API 文档(如 Anthropic API)。
原帖 ↗看了 Warp 开源仓库的 agent 指导设计,认为最值得学的不是某个 AGENTS.md 写得多好,而是它把开源项目维护做成了一套 agent-native workflow:issue triage、spec、实现、review、CI 诊断全部流程化。
原帖 ↗- 用 Codex 评测各家 PPT skill 的定位结论:职业级、可继续编辑的 PowerPoint→PPT Master 第一
- 视觉上限 + 多格式交付→花叔
- 叙事/路线选择/质量控制→Knowledge Cat
原帖 ↗- 据法新社报道,法国经济与财政部证实,旗下财政总局 6 月在约 100 名工作人员中试用了阿里 Qwen(通义千问)模型
- 几天后因部分涉华议题的回答被认为存在「导向性/偏向」(被指「亲中倾向」)而停用,改用法国本土的 Mistral AI 模型。
原帖 ↗- DeepSeek V4 更新:推出投机解码(Speculative Decoding)框架 DSpark,推理速度提升 80%,且已部署到 DeepSeek-V4(Flash 和 Pro)的真实线上流量。
- 报告题为《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》。
原帖 ↗- 一道 LLM 工程面试题 + 深度解析:在 vLLM 上服务推理模型
- 长轨迹爆显存,加 KV cache 压缩并驱逐 90% token,VRAM 却纹丝不动,为什么?
- 答案:vLLM 用 paged attention 把显存切成固定物理块(每块约 16 token),整块全空才归还分配器
原帖 ↗提醒:Claude Code 新增的自动清理聊天记录功能,会把你超过 30 天没活跃的记录全部删掉,注意提前备份。
原帖 ↗- 千问输入法基本照搬 Typeless——按住说话、自动成文,连交互都像。
- 实测中文识别更快,嘈杂环境吊打微信和豆包输入法,短板只剩「润色成文」偏弱。
- 作者调侃自己 Typeless 会员是不是买早了。
原帖 ↗