2026年6月26日 · 周五

GPT-5.6 三档齐发,前沿 AI 进入"政府审批"时代

  • OpenAI 预览 GPT-5.6——旗舰 Sol、均衡 Terra、低价 Luna 三档齐发,主攻网络安全与长程推理。
  • 但与模型同样抢眼的是治理:美国政府要审查谁能用 GPT-5.6 并要求延期,Anthropic 的 Mythos 5/Fable 5 也在政府指令下暂停又部分恢复,前沿 AI 正被纳入国家安全框架。

本期速览

3 条
  1. 01OpenAI 预览 GPT-5.6 三档
    • 旗舰 Sol、均衡 Terra(对标 5.5、价格腰斩)、低价 Luna
  2. 02美国政府将审查谁能用 GPT-5.6 并要求延期
    • Anthropic Mythos 5
  3. 03Anthropic 指控阿里巴巴非法提取 Claude 模型能力
    • Reuters 报道引爆 HN(1297 评论)
On this page

本期导航

Deep Dives

本期重点 · 深度报告

7 篇
Briefs

快讯 · 已核验与追踪

10 条
行业动态

OpenAI 公布自研推理芯片 Jalapeño,联合 Broadcom 量产

  • OpenAI 公布首款自研 AI 芯片 Jalapeño,由其从零设计
  • 联合 Broadcom 量产,专为驱动 ChatGPT/Codex/API 及未来 agentic 产品的 LLM 推理负载打造,把全栈平台从产品
  • 模型进一步延伸到基础设施。
早报判断
  • 自研推理芯片是 OpenAI 对 NVIDIA 依赖与推理成本的双重对冲:GPT-5.6 既要上 Cerebras 冲 750 tok/s,又靠自研硅压成本,说明"谁掌握推理经济性谁掌握定价权"已成共识。
  • 结合 Terra"比 5.5 便宜一半"的定价,OpenAI 正用垂直整合把成本曲线握进自己手里。
  • 短期内 Broadcom 代工、产能爬坡与软件栈成熟度仍是变数,首代自研芯片能承接多少真实流量需观察。
产品上新

Google 在 Gemini 3.5 Flash 中加入 Computer Use

Google 发布 Gemini 3.5 Flash 的 computer use 能力,把屏幕操作/agentic 控制下放到低价快速档,登上 HN(241 分/167 评论)。

早报判断
  • 把 computer use 放进最便宜的 Flash 档,意味着"让 agent 直接操作屏幕"正从旗舰能力变成默认能力,价格敏感的批量自动化场景首次有了可负担选项。
  • 这与 OpenAI Terra/Luna 压价
  • Qwen 开源 OS/Android 环境模型是同一股力量:agentic 能力正在快速平民化。
  • 真正要看的是它在真实 GUI 任务上的可靠性与越权风险,而非演示成功率。
融资动态

高通收购 AI 基础设施初创 Modular(Mojo 母公司)

Reuters 报道高通将收购 AI 基础设施初创 Modular——Mojo 语言与统一 AI 编译/推理栈的开发商,HN 讨论 125 条。

早报判断
  • Modular 押注的是"跨硬件统一 AI 软件栈",对想绕开 CUDA 锁定的厂商极有价值
  • 高通拿下它,是要给自家边缘/移动 AI 芯片配一套不依赖 NVIDIA 生态的软件层。
  • 这与 OpenAI 自研 Jalapeño
  • NVFP4 在 Blackwell 上跑 GLM 是一条线:2026 年的竞争焦点正从模型转向"谁能让推理在自家硬件上又快又便宜地跑起来"。
产品上新

NVIDIA/vLLM 发布 GLM-5.2 NVFP4 量化版,一行命令本地起服务

  • NVIDIA 与 vLLM 官方发布 GLM-5.2 的 NVFP4 4-bit 量化 checkpoint,vllm serve nvidia/GLM-5.2-NVFP4 即可起 OpenAI 兼容 API
  • 针对 Blackwell 大幅削减 VRAM,且在推理/编码/1M 上下文上对精度持平。
  • GLM-5.2 为 753B 参数 MoE,擅长 agentic 负载。
早报判断
  • NVFP4 让 753B 级开源模型在单机 Blackwell 上零云成本跑 agentic 负载成为现实,是开源权重"可用性"的一次实质跃迁。
  • 但它也暴露矛盾:开源模型要靠 NVIDIA 官方量化才好用,硬件生态话语权仍握在闭源一方。
  • 对照 Mollick"终端用户只想要大牌"的观察,本地自托管仍是少数硬核团队的游戏。
#GLM#NVFP4#vLLM#开源量化
行业动态

Gemma 4 上线 2.5 个月下载破 2 亿次

Google DeepMind 称 Gemma 4 在仅 2.5 个月内达到 2 亿次下载。

早报判断
  • 2 亿次下载印证开放权重生态的真实体量,也是 Google 在闭源 Gemini 之外的第二条腿。
  • 放在"美国政府能否封禁开放权重"(Mollick)与 GLM/Qwen 开源攻势的同框里,这个数字是 Google 对"开源不能输"的下注。
  • 但下载量不等于生产部署量,真实留存与商用占比才是后续看点。
#Google#Gemma#开源#下载量
行业动态

美国 AI 股抛售波及全球市场

The Guardian 报道美国 AI 股集中抛售,冲击从华尔街到亚洲的市场情绪。

早报判断
  • AI 股回调与 HN 热议的"当前 LLM 成本不可持续"、能力过剩论同时出现,反映市场开始对"巨额资本开支何时变现"施压。
  • 一边是 GPT-5.6、自研芯片、超大集群继续烧钱,一边是估值承压——2026 下半年 AI 叙事的关键变量正从"能力"转向"单位经济性"。
  • 对仍在融资的初创,窗口可能收紧。
#AI 股#市场#估值#资本开支
行业动态

法国财政部试用后弃用阿里 Qwen,改投本土 Mistral

  • 据法新社,法国经济与财政部证实其财政总局 6 月在约 100 名工作人员中试用阿里 Qwen,数日后因部分涉华议题回答被指"亲中倾向/导向性"而停用,改用本土 Mistral。
  • (目前经 X 转述,待官方原文核实)
早报判断
  • 这是"模型价值取向"首次成为政府采购的硬否决项,而非性能或价格。
  • 叠加 Anthropic 指控阿里蒸馏 Claude
  • 美国政府审批 GPT-5.6,主权 AI 的逻辑正在固化:谁训练的
  • 价值观偏向谁,比跑分更决定能否进政府与关键行业。
#主权 AI#Qwen#Mistral#法国
行业动态

AI 质检翻车,福特重新雇回资深检验员

Bloomberg 报道福特因 AI 在质量检测上表现不及预期,重新雇回经验丰富的"gray beard"(资深)检验员,HN 讨论 321 条。

早报判断
  • 这是对"AI 能力过剩、变革已锁定"乐观叙事的一记现实校正:在容错率极低的工业质检场景,AI 的长尾错误成本远高于人工。
  • 它不否定 AI 价值,而是提醒"人机协同"比"全自动替代"更可落地。
  • 当多数报道在谈模型刷榜时,制造业一线的真实采用曲线更值得关注。
#福特#制造业#AI 落地#质检
观点观察

大型 AI 实验室正大量招聘哲学家

The Economist 报道,大型 AI 实验室正招聘越来越多哲学家,参与对齐、价值观与模型行为设计。

早报判断
  • 实验室招哲学家不是务虚:当模型的"价值取向"能直接导致法国政府弃用 Qwen、决定能否通过对齐与安全审查,价值判断已成为产品规格的一部分。
  • 这与 Anthropic Public Record、AI 政治偏见研究同属一条线——前沿竞争正从"更聪明"延伸到"价值观可被定义与审计"。
#AI 对齐#哲学#价值观#Economist
行业动态

NVIDIA 45°C 液冷设计将数据中心用水降至近零

NVIDIA 公布 45°C 温水液冷设计,称可把 AI 数据中心用水量降至接近零,HN 讨论 424 条。

早报判断
  • 在 AI 数据中心因耗水耗电频遭社区与监管阻力时,近零用水的液冷是缓解"许可证风险"的关键工程。
  • 它把约束从"能不能建"转回"电从哪来",也是 NVIDIA 锁定 AI Factory 整机柜方案、不止卖芯片的又一步。
  • 能否规模化落地、PUE 与综合成本数据是检验点。
#NVIDIA#液冷#数据中心#能耗
Social Radar

社交雷达 · X 讨论

6 条
yan5xu@yan5xu29 likes
  • agent 使用姿势的一次大转变:从「任务拆解 + 用过即弃 + 靠 skills/文档转移经验」的任务型 agent,转向按领域 scope 拆解的长期 agent
  • 长期复用同一 session、不抗拒 /compact(例如把一个项目拆成前后端两个 agent)。
  • 作者体感长期 agent 划分得当会「越用越跟手」。
  • 痛点:当前 agent 的「毁灭式上下文压缩」会完全破坏 trajectory,仍有很大优化空间
原帖 ↗
op7418@op741830 likes

用 Seedance 2.0 以原生 4K 分辨率重跑了一条 Codepilot 宣传片,文字清晰度和材质质感都大幅提升,作者强调这是 1080P 超分根本做不到的效果。

op7418

作者此前用 Seedance 2.0 重做了 Codepilot 的宣传片。

原帖 ↗
IndieDevHailey@IndieDevHailey305 likes
  • 推荐开源 AI 新闻雷达 Horizon(MIT 协议):直接从源头抓一手内容,用 AI 打分/去重/补背景/总结社区讨论,自动生成中英双语每日简报。
  • 支持 Hacker News、Reddit、Telegram、RSS、X、GitHub、OpenBB 等几乎所有主流信息源
  • 兼容 Claude/GPT/Gemini/DeepSeek/Ollama
  • 同一事件跨平台自动合并并补充背景
原帖 ↗
vincemask@vincemask256 likes
  • Claude Code 配置不该只塞一个 CLAUDE.md,建议拆成七层:1) CLAUDE.md 项目级上下文与规范
  • 2) settings.json 权限/模型/hooks
  • 3) rules/ 按主题拆分规则
  • 4) commands/ 沉淀可重复工作流
原帖 ↗
EngMoElgaraihy@EngMoElgaraihy228 likes
  • NVIDIA 与 vLLM 官方发布 GLM-5.2 的 NVFP4 量化版,一行命令 vllm serve nvidia/GLM-5.2-NVFP4 即可本地起一个 OpenAI 兼容 API。
  • 针对 Blackwell 显卡的 4-bit 量化相比 FP8 大幅削减 VRAM 占用,同时在推理/编码/1M 上下文上保持原模型精度。
  • 模型为 753B 参数的 MoE,擅长 Agentic 工作负载——意味着开放权重 + 硬件加持能在自家服务器零云成本跑起来。
vllm_project

vLLM 官方宣布 GLM-5.2 NVFP4 已可部署:NVIDIA 在 Blackwell 上的官方 NVFP4 checkpoint 相比 FP8 降低内存占用,且在推理、编码、长上下文 benchmark 上精度持平,vllm serve nvidia/GLM-5.2-NVFP4 即可起服务。

原帖 ↗
oragnes@oragnes20 likes

谷歌官方放出一套 8 分钟免费课,手把手从零跑通自动化循环架构、教你搭建第一个 AI Agent。

oragnes
  • Anthropic 一位资深工程师放出 11 页 PDF《Loop Engineering(循环工程)》,核心理念是从「自己去提示 agent」转向「构建一个能自动提示它的系统」。
  • 循环结构 Schedule→Discover→Build→Verify→Repeat,五个关键动作:Discovery(agent 自己去找失败的 CI/开放 issue/最近提交,而非等人派任务)
  • Handoff(每个任务分配独立 git worktree,并行 agent 不互相冲突)
原帖 ↗
更多讨论9 条
chyni@chyni215 likes

用 Codex 开发 iOS app 体验很顺:Product Design + 内置浏览器做原型,iOS App Build 做开发,配合内置模拟器预览功能,现在已经不需要打开 Xcode 了。

原帖 ↗
yibie@yibie20 likes
  • 转译 Recurse Center 的 Nick Bergson-Shilcock 观点:每个程序员都该亲手写一个 agent,只要 50 行代码。
  • 两个建议:1) 从零手敲每一行,不用任何 AI(连自动补全都不用)
  • 2) 只依赖语言标准库文档和模型 API 文档(如 Anthropic API)。
nicholasbs
  • 原文:每个程序员都该写自己的 agent,只需 50 行代码。
  • 两条建议——从空白文件手敲、不用 AI 也不用自动补全
原帖 ↗
mylifcc@mylifcc17 likes

看了 Warp 开源仓库的 agent 指导设计,认为最值得学的不是某个 AGENTS.md 写得多好,而是它把开源项目维护做成了一套 agent-native workflow:issue triage、spec、实现、review、CI 诊断全部流程化。

原帖 ↗
GeekCatX@GeekCatX92 likes
  • 用 Codex 评测各家 PPT skill 的定位结论:职业级、可继续编辑的 PowerPoint→PPT Master 第一
  • 视觉上限 + 多格式交付→花叔
  • 叙事/路线选择/质量控制→Knowledge Cat
dotey
  • PPT Master 确实是最好的 PPT Skill
  • 自己新写的 PPT skill 也不错,能导出可编辑版本、AI 配图,并可在 Agent 内置浏览器中标记编辑。
原帖 ↗
whyyoutouzhele@whyyoutouzhele600 likes
  • 据法新社报道,法国经济与财政部证实,旗下财政总局 6 月在约 100 名工作人员中试用了阿里 Qwen(通义千问)模型
  • 几天后因部分涉华议题的回答被认为存在「导向性/偏向」(被指「亲中倾向」)而停用,改用法国本土的 Mistral AI 模型。
原帖 ↗
frxiaobei@frxiaobei6 likes
  • DeepSeek V4 更新:推出投机解码(Speculative Decoding)框架 DSpark,推理速度提升 80%,且已部署到 DeepSeek-V4(Flash 和 Pro)的真实线上流量。
  • 报告题为《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》。
原帖 ↗
_avichawla@_avichawla540 likes
  • 一道 LLM 工程面试题 + 深度解析:在 vLLM 上服务推理模型
  • 长轨迹爆显存,加 KV cache 压缩并驱逐 90% token,VRAM 却纹丝不动,为什么?
  • 答案:vLLM 用 paged attention 把显存切成固定物理块(每块约 16 token),整块全空才归还分配器
原帖 ↗
vanillaCitron@vanillaCitron42 likes

提醒:Claude Code 新增的自动清理聊天记录功能,会把你超过 30 天没活跃的记录全部删掉,注意提前备份。

原帖 ↗
EvanWritesX@EvanWritesX10 likes
  • 千问输入法基本照搬 Typeless——按住说话、自动成文,连交互都像。
  • 实测中文识别更快,嘈杂环境吊打微信和豆包输入法,短板只剩「润色成文」偏弱。
  • 作者调侃自己 Typeless 会员是不是买早了。
EvanWritesX
  • 千问也上线了输入法,目前仅 Mac 版。
  • 背景:截至目前微信、豆包输入法在嘈杂环境识别精度都打不过 Typeless——尤其微信会把语音导航念出来的字一起塞进转写里。
原帖 ↗