最新一期第 40 期 · 共 8 条信号
2026年8月1日
周六 · 过去 24 小时的 AI 世界

开放权重领跑,官方披露待复核

  • 过去 24 小时,DeepSeek 发布 V4-Flash-0731 权重并开放 API 公测。
  • OpenAI 连发四篇官方说明,但其中多项数字属于厂商自报或对前一日事件的阐释。
本期判断
  • 竞争焦点正在从单次模型发布扩展到可部署权重、单位任务成本和安全修复吞吐。
  • 公开权重与自动化安全同时加速,也把评测口径和人类验收推到更关键的位置。

本期速览

3 条
  1. 01今日最重要:开放权重升级
    • DeepSeek 同日发布权重并开放 API 公测
  2. 02重要但待验证:厂商自报
    • OpenAI 自报服务成本降低 20%
  3. 03社区工具:论文与工程讨论
    • Qwen GUI 智能体论文入选 HF 日榜

编辑总结

过去 24 小时的共同主线,是模型发布开始与部署、成本和安全运营同时发生。开放权重让验证门槛下降,但官方自报与独立评测仍需分开。

OpenAI 四篇文章的信息强度并不相同:成本文给出新运营数字,安全文首次公开旧处置,欧洲稿整理合规路径,客户案例提供采用漏斗。日期、分母与状态词决定这些材料能支持多强的结论。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

6 篇

Key Numbers

OpenAI 服务成本

OpenAI 自报生产服务端到端降幅,未公开硬件和流量基线

来源:OpenAI →
降低 20%

Qwen 医疗术语召回

Qwen-Audio-3.0-ASR-Flash 内部测试结果,测试集未公开

来源:Qwen →
95.36%
Briefs

快讯 · 已核验与追踪

1 条
研究论文重要度 3/5中置信已核验

7月30日论文跟进|Qwen GUI 智能体入选 HF 日榜

  • Qwen-UI-Agent 论文原始提交早于窗口,7 月 31 日入选 Hugging Face Daily Papers。
  • 团队自报其使用 100 多台真机,并支持超过 100 轮在线强化学习轨迹。
要点拆解展开
Why

GUI 智能体正从单一屏幕点击转向跨设备工作流。真机训练和用户接管机制更接近生产约束。

Impact

研究者可核对真实设备与模拟环境差距。开发者仍需等待模型、数据和测试 harness 的开放程度。

Numbers
真实移动设备
超过 100 台团队技术报告自报的训练与评测基础设施Qwen-UI-Agent 论文
并发环境
超过 1 万个用于加速在线强化学习 rolloutQwen-UI-Agent 论文
早报判断
  • 当天增量是 HF 策展与社区关注,不是论文首次发布。
  • 论文把 GUI、CLI 和批量动作统一到同一轨迹,但 benchmark 仍主要由团队自报。
接下来看
  • 模型权重与训练数据是否开放
  • 自建 benchmark 能否由第三方复现
#Qwen#GUI Agent#强化学习#真机评测
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

产品上新重要度 2/5低置信发展中

官方单源|Qwen 发布 Audio 3.0 ASR Flash

  • Qwen 官方账号发布 Qwen-Audio-3.0-ASR-Flash,新增上下文一致性、术语识别和热词等能力。
  • 官方内部测试称医疗术语召回率为 95.36%。
要点拆解展开
Why

语音转写竞争正在从通用字错率转向领域术语和结构化输出。当前证据仍不足以判断真实生产效果。

Impact

医疗和工业团队可小规模测试热词与术语识别。采购前应要求测试集口径、延迟和错误分布。

Numbers
医疗术语召回
95.36%Qwen 内部测试自报,测试集和比较基线未公开Qwen
工业术语召回
93.24%Qwen 内部测试自报,不能等同整体转写准确率Qwen
早报判断
  • 这是一条官方单源产品信号,文档页未给出同等清晰的发布日期。
  • 两个召回率缺少测试集、基线和第三方复现,不能写成通用准确率。
接下来看
  • Qwen 是否公开术语测试集与基线
  • 流式和录音文件模式的延迟差异如何
Social Radar

社交雷达 · X 讨论

6 条
OpenAIDevs@OpenAIDevs491 likes
  • OpenAI Developers 表示,自 2026 年 8 月 31 日起,GPT-5.4 和 GPT-5.4 mini 将不再向已登录 ChatGPT 的用户提供
  • 两款模型仍会保留在 OpenAI API,以及使用 API Key 认证的 Codex 会话中。
原帖 ↗
Jason@Jason1766 likes
  • Jason 据 DeepSeek-V4-Flash 发布信号判断,开源模型正在扩大优势。
  • 他预测未来 24 个月 token 成本或降至百分之一,约半数 token 会在本地运行
  • 这是个人预测。
deepseek_ai
  • DeepSeek-V4-Flash API 已公开测试。
  • 官方称其智能体基准超过 V4-Pro-Preview,并支持 Responses API 与 Codex
  • 公告没有成本降百倍或本地运行占比承诺。
原帖 ↗
GeminiApp@GeminiApp452 likes
  • Google 正在向美国以外的 Google AI Pro 用户推出 Gemini Spark。
  • 官方将其描述为可在用户指挥下全天候后台执行任务的个人 AI Agent
  • 措辞是“正在推出”,并非所有地区已经全部可用。
GeminiApp
  • 此前公告称,Gemini Spark 已开始向美国的 Google AI Pro 订阅用户推出,并将陆续扩展到更多国家
  • 本次新帖的增量是美国以外地区开始获得该能力。
原帖 ↗
Azure@Azure784 likes
  • 微软 Azure 宣布,月之暗面的 Kimi K3 已通过 Fireworks AI 接入 Microsoft Foundry。
  • 官方帖称该开放权重模型总参数为 2.8 万亿,上下文窗口为 100 万 token。
原帖 ↗
NousResearch@NousResearch932 likes
  • Nous Research 已把 FLUX 3 Preview 免费试用扩大到全部 Nous Portal 用户,包括免费层
  • 测试该模型不再要求订阅。
  • 这里是访问范围扩大,不是模型再次发布。
NousResearch
  • 此前公告仅向付费订阅提供 48 小时免费使用,并设置短片活动:截至太平洋时间 8 月 1 日晚 7 点,前三名可获不同额度奖励
  • 本次新帖把免费访问进一步扩展到免费层。
原帖 ↗
krea_ai@krea_ai1680 likes
  • Krea 介绍 MiniMax H3,称其能以更低成本覆盖 Seedance 的相关功能,并表示模型权重将于之后开放。
  • 当前状态是“即将开放权重”,不能写成已经开源。
原帖 ↗
更多讨论3 条
OkhayIea@OkhayIea56 likes
  • Frontis 团队自报:单张 RTX 4090、12GB 显存、每项任务 12 小时下,MA1-35B 在 MLE-Bench Lite 得 71.21%。
  • NatureBench 的 Match-SOTA 由 50% 升至 70%,仍待独立复核。
原帖 ↗
seekjourney@seekjourney87 likes
  • OptMem 用一个 Python 脚本和一段 333-token 提示词为 Agent 提供持久记忆协议,由模型自行记录
  • 压缩和检索,不依赖向量数据库
  • Embedding 或常驻后台服务。
原帖 ↗
williamlong@williamlong72 likes
  • 据导演菲菲飞介绍,抖音 AI 短剧《被裁掉的女孩》累计播放量已超过 2 亿,女主角方桃子的账号粉丝接近 40 万。
  • 其披露的制作成本为数万元、单集约 1 万多元,每集平均耗时两到三天
  • 最耗时的环节是场景、服装、妆造与视觉基调的建立。
原帖 ↗
Previous Editions

往期早报

全部归档 →