#推理
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 基础设施2026-08-25 · 周二重要度 4/5深度报告 →
NVIDIA用AgentX重算AI工厂效率
NVIDIA 8月24日称Vera Rubin NVL72在AgentX负载上,相对GB300 NVL72最高实现30倍每兆瓦吞吐和35倍更低token成本。
- 这条的增量是把AI工厂指标从固定序列推理切到Agent轨迹。
- 由于结果仍待SemiAnalysis审查,读者应把它视为厂商自测预览而非已定型榜单。
- 研究论文2026-08-13 · 周四重要度 4/5深度报告 →
8月12日解读|Google称事实召回成为瓶颈
Google Research于8月12日发布对2月论文的新解读。研究用2150个事实、13个模型和约450万次回答区分编码与召回,称GPT-5与Gemini-3 Pro已编码95%至98%的事实,但直接召回仍失败26%至34%。
- 该研究把部分幻觉问题从模型没学到改写为模型取不出来,支持按需推理与召回增强。
- WikiProfile来自Wikipedia事实且依赖自动评分,尚不能取代开放域和业务事实性评估。
- 研究论文2026-08-11 · 周二重要度 5/5深度报告 →
Claude研究版把黎曼ζ函数相关下界推至67.2%
Anthropic于8月10日披露,未发布Claude研究版给出一项无条件结果:黎曼ζ函数在临界线上的零点比例下界升至约67.2%。它没有证明黎曼猜想,外部同行评审仍待展开。
- 这项结果的价值在于模型产出与验证制品同步公开,而非只展示答案。
- 当前验证仍以Anthropic员工和短期专家审阅为主
- 行业动态2026-06-26 · 周五
OpenAI 公布自研推理芯片 Jalapeño,联合 Broadcom 量产
OpenAI 公布首款自研 AI 芯片 Jalapeño,由其从零设计、联合 Broadcom 量产,专为驱动 ChatGPT/Codex/API 及未来 agentic 产品的 LLM 推理负载打造,把全栈平台从产品、模型进一步延伸到基础设施。
- 自研推理芯片是 OpenAI 对 NVIDIA 依赖与推理成本的双重对冲:GPT-5.6 既要上 Cerebras 冲 750 tok/s,又靠自研硅压成本,说明"谁掌握推理经济性谁掌握定价权"已成共识。
- 结合 Terra"比 5.5 便宜一半"的定价,OpenAI 正用垂直整合把成本曲线握进自己手里。
- 研究论文2026-06-23 · 周二重要度 4/5深度报告 →
Confident Decoding:别只信最后一层,Qwen 用「熵谷」选层,训练免改还涨分
Qwen 团队联合清华、NTU 挑战『最后一层表征最优』:模型存在『先猜—精化—扰动』动态,末层可能把已经想清楚的预测推向对齐偏好 token(『对齐税』)。Confident Decoding 训练免改、保留完整前向,用熵在『熵谷』动态选层喂给采样器。实测 FLOPs 增量不到 1%、零额外 KV 显存;gpt-oss-20b 在 Omni-MATH 最难档 +22.4 分。
- 这篇的杀伤力在于『几乎零成本』:不用重训、不加显存、延迟增加不到 2%,却能在硬核推理任务上拿到两位数百分点提升。
- 它把『对齐税』具象化为末层把预测拉向安全/通用 token 的现象,并用最优停止理论给出选层的 minimax 最优性。
- 研究论文2026-06-22 · 周一重要度 3/5
Reflective Masking:用反思式掩码激发掩码扩散模型的推理能力
Reflective Masking(arXiv 2606.16700,14 upvotes,UMD/Virginia Tech 等)提出一种轻量后训练方法,让掩码扩散模型(MDM)按位置做 keep/re-mask/reveal 决策,迭代式局部修订自身输出,实现扩散模型独有的测试时扩展;配合参数无关的 History Reference 维持去噪轨迹状态。覆盖图像编辑、数独纠错与文本推理(数学/代码),约 2 张 H100 训练 5 小时。
- 这与同日的 PerceptionDLM 互为呼应,共同指向一个判断:2026 年中扩散语言模型正从『能生成』走向『会推理、会改错』。
- Reflective Masking 把『像人一样迭代局部纠错』变成 MDM 的原生能力,无需改架构