最新一期第 38 期 · 共 6 条信号
2026年7月30日
周四 · 过去 24 小时的 AI 世界

科研开放扩容,评测设置受审

  • OpenAI 启动学术研究者免费计划,今年夏天先覆盖 1 万人,并计划到 2027 年扩展至 10 万人。
  • 另一项官方单源实验称,两项 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 公开集得分从 13.3% 升至 38.3%。
本期判断
  • 今天影响最广的是前沿模型访问开始制度化扩容。
  • 与此同时,评测 harness 与推理精度合同正在成为能力复现和规模化的必要组成。

本期速览

3 条
  1. 01科研免费计划分阶段扩容
    • 今年夏天先覆盖 1 万名研究者。
  2. 02评测设置改变结果
    • ARC-AGI-3 公开集得分从 13.3% 升至 38.3%。
  3. 03效率优化进入生产栈
    • OpenAI 自报服务成本降低 20%。

编辑总结

今天最关键的变化,是评测结果越来越依赖完整系统配置。模型权重没有变化时,推理保留、上下文整理和工具编排也足以改变分数与成本。

科研访问扩容与推理效率披露指向同一约束:前沿能力只有进入可治理、可负担的工作流,才会形成实际影响。首批规模、未来目标和不同优化口径必须分开理解。

其余更新更适合作为工程线索。多模态控制、低精度强化学习与语音产品都需要后续开放范围、复现数据或完整原文来确认边界。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

研究者首批规模

今年夏天的起步规模,不是 10 万人已即时获得权限

来源:OpenAI →
1 万人

ARC-AGI-3 公开集得分

同一 GPT-5.6 Sol;官方 harness 对比保留推理并启用 compaction

来源:OpenAI →
13.3% → 38.3%

输出 token 变化

OpenAI 对公开任务集两种 harness 配置的比较

来源:OpenAI →
约减少 6 倍

端到端服务成本

生产 GPU 内核及更广泛内核改进的合计自报结果

来源:OpenAI →
降低 20%

token 生成效率

改进 speculative decoding draft model 的自报结果

来源:OpenAI →
提高超过 15%
Briefs

快讯 · 已核验与追踪

2 条
模型发布重要度 3/5中置信官方源

Google 在 Flow Music 推出 Lyria 3.5

Google 于 7 月 29 日开始在 Flow Music 推出 Lyria 3.5,称新版改进音乐性、歌词、人声与发音,并增加节奏和时长控制。

要点拆解展开
Why

音乐生成的产品价值依赖可编辑性与稳定控制。节奏、时长和歌词结构比单次样例更接近生产工作流。

Impact

创作者获得更细的生成控制。企业用户仍需核对地区可用性、训练数据政策与商用授权。

Numbers
推出日期
2026-07-29Google 公告称当天开始在 Flow Music 推出Google
早报判断

发布重点是把音乐模型嵌入可控创作界面,而非公布新榜单。质量改进均来自厂商描述,尚缺盲测与版权边界数据。

接下来看
  • Lyria 3.5 的地区与账号开放范围
  • Google 是否发布人声与歌词盲测
#Google#Lyria 3.5#Flow Music#音乐生成
工程实践重要度 3/5中置信已核验

LMSYS 将 MXFP8 与 NVFP4 接入强化学习

  • LMSYS 团队在 Miles 中实现端到端 MXFP8 与逐 token NVFP4 强化学习。
  • 8 张 B200 的 Qwen3-30B-A3B 消融显示低精度奖励曲线接近 BF16。
要点拆解展开
Why
  • 低精度 RL 的风险不只在单个矩阵乘法,而在采样策略与训练策略漂移。
  • 端到端合同为 Blackwell 上的规模化训练提供工程基线。
Impact
  • 训练平台可评估 rollout 加速与显存收益。
  • 模型团队需要保留高精度例外,并监控 train-inference mismatch。
Numbers
消融硬件
8 张 B2004 张用于 rollout,4 张用于训练LMSYS
测试模型
Qwen3-30B-A3B固定 GRPO 风格负载,不是通用训练基准LMSYS
早报判断
  • 价值在于训练、rollout、权重更新和量化器共享精度合同。
  • 测试仍是单一模型与固定负载,不能外推为所有强化学习任务无损。
接下来看
  • NVFP4 训练侧融合内核何时接入 TransformerEngine
  • 更大 MoE 模型是否保持奖励曲线
#LMSYS#Miles#MXFP8#NVFP4
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

模型发布重要度 2/5低置信发展中

单源称|xAI 推出 Grok Voice Think Fast 2.0

  • xAI 新闻列表显示,Grok Voice Think Fast 2.0 于 7 月 29 日发布,并称其为公司能力最强的语音到语音模型。
  • 采集时正文受 Cloudflare 阻断。
要点拆解展开
Why

原生语音模型是实时助手的重要入口,但单一列表摘要不足以证明能力提升或实际可用性。

Impact

开发者暂不应据此调整选型。需要等待可访问文档、API 说明或独立测试。

Numbers
页面日期
2026-07-29来自 xAI News 列表;正文在本次采集被 Cloudflare 阻断xAI News
早报判断

目前只能确认标题、日期和厂商定位,无法核对延迟、语言、价格与开放范围。它应被视为待补原文的产品信号。

接下来看
  • xAI 是否公开延迟和语音质量指标
  • 模型是否进入 API 及具体开放地区
#xAI#Grok Voice#语音模型#待验证
Social Radar

社交雷达 · X 讨论

6 条
NousResearch@NousResearch1864 likes
  • Hermes Agent 新增语音唤醒:说出唤醒词即可在 CLI、TUI 或桌面端开启新会话并接收命令。
  • 检测在本地完成,且默认关闭。
原帖 ↗
UnslothAI@UnslothAI994 likes
  • Unsloth 用同一提示词比较 1-bit Kimi K3、Claude Opus 5 和 GPT 5.6
  • 量化版 K3 在 4 张 B200 上本地运行,速度为每秒 36 token。
UnslothAI
  • 1-bit Kimi K3 从 1.56TB 压缩到 594GB,体积减少 62%,保留约 78.9% 准确率
  • 官方称可在配备 128GB 内存的 Mac Studio 上运行。
原帖 ↗
OpenRouter@OpenRouter353 likes
  • OpenRouter 上线 Qwen3.7-Flash。
  • 该视觉推理模型面向多模态智能体、视觉编程、搜索和电脑操作,支持工具调用与 100 万 token 上下文。
原帖 ↗
CodexReleases@CodexReleases261 likes
  • 非官方 Codex 更新账号称,“使用 ChatGPT 登录”开始在部分插件与合作站点测试。
  • 首批包括 Airtable、GitLab、HubSpot、Notion、Supabase 和 Vercel
  • 插件权限仍需单独批准。
原帖 ↗
EmperoAI@EmperoAI297 likes

EmperoAI 发布 Qwythos-27B-v1,保留原生 MTP 头和完整视觉塔,提供 100 万 token 上下文,并采用 Apache-2.0 许可。

原帖 ↗
Ryrenz@Ryrenz43 likes
  • LangChain 的 agents-from-scratch 教程用邮件助手串起四个生产要点:基础分类与回复
  • LangSmith 和 Pytest 评估
  • 关键动作人工确认,以及从用户修改中学习偏好的记忆。
原帖 ↗
更多讨论4 条
gkxspace@gkxspace11 likes
  • 开源工具 ywcrew 可从 Codex 等客户端调度 Grok、Kimi、Claude 等本地订阅,支持并行生成、跨模型评审和偏好路由
  • 任务在独立 worktree 中运行并以补丁交回。
gkxspace
  • ywcrew 支持 Claude、Codex、Grok、Kimi 和 Antigravity
  • 无需额外 API 费用,严格模式只向被调模型暴露白名单文件。
原帖 ↗
Pluvio9yte@Pluvio9yte33 likes
  • LangChain 的《智能体 Harness 解剖》从“让模型完成有用工作”出发,梳理文件系统
  • 沙箱和记忆等运行时组件,重点讨论模型之外的工程结构。
Pluvio9yte

被引用帖只含文章短链;具体内容来自同帖附带的 LangChain 文章卡片。

原帖 ↗
MANISH1027512@MANISH102751275 likes
  • 一名 Codex 用户发现约 2449 条 archived_sessions 任务记录占用约 80GB。
  • 批量生图的 Base64 数据会进入 JSONL,且可能重复两次,单清 generated_images 不会释放这些空间。
MANISH1027512

此前该用户观察到 Codex 长时间运行会持续膨胀临时磁盘占用,单日可超过 50GB。

原帖 ↗
Xudong07452910@Xudong0745291053 likes
  • 游凯超在访谈中讨论 vLLM、开源社区及模型与推理基础设施协同设计
  • 核心比喻是硬件如自然资源、模型如发电机、推理引擎如电网。
zhang_benita

访谈把 token 比作电力:模型负责发电,推理引擎负责电网,二者协同设计决定整体效率。

原帖 ↗
Previous Editions

往期早报

全部归档 →