开放权重领跑,官方披露待复核
- 过去 24 小时,DeepSeek 发布 V4-Flash-0731 权重并开放 API 公测。
- OpenAI 连发四篇官方说明,但其中多项数字属于厂商自报或对前一日事件的阐释。
- 竞争焦点正在从单次模型发布扩展到可部署权重、单位任务成本和安全修复吞吐。
- 公开权重与自动化安全同时加速,也把评测口径和人类验收推到更关键的位置。
本期速览
3 条01今日最重要:开放权重升级
- DeepSeek 同日发布权重并开放 API 公测
02重要但待验证:厂商自报
- OpenAI 自报服务成本降低 20%
03社区工具:论文与工程讨论
- Qwen GUI 智能体论文入选 HF 日榜
编辑总结
过去 24 小时的共同主线,是模型发布开始与部署、成本和安全运营同时发生。开放权重让验证门槛下降,但官方自报与独立评测仍需分开。
OpenAI 四篇文章的信息强度并不相同:成本文给出新运营数字,安全文首次公开旧处置,欧洲稿整理合规路径,客户案例提供采用漏斗。日期、分母与状态词决定这些材料能支持多强的结论。
本期导航
本期重点 · 深度报告
Key Numbers
快讯 · 已核验与追踪
7月30日论文跟进|Qwen GUI 智能体入选 HF 日榜
- Qwen-UI-Agent 论文原始提交早于窗口,7 月 31 日入选 Hugging Face Daily Papers。
- 团队自报其使用 100 多台真机,并支持超过 100 轮在线强化学习轨迹。
要点拆解展开
GUI 智能体正从单一屏幕点击转向跨设备工作流。真机训练和用户接管机制更接近生产约束。
研究者可核对真实设备与模拟环境差距。开发者仍需等待模型、数据和测试 harness 的开放程度。
- 真实移动设备
- 超过 100 台团队技术报告自报的训练与评测基础设施Qwen-UI-Agent 论文
- 并发环境
- 超过 1 万个用于加速在线强化学习 rolloutQwen-UI-Agent 论文
- 当天增量是 HF 策展与社区关注,不是论文首次发布。
- 论文把 GUI、CLI 和批量动作统一到同一轨迹,但 benchmark 仍主要由团队自报。
- 模型权重与训练数据是否开放
- 自建 benchmark 能否由第三方复现
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
官方单源|Qwen 发布 Audio 3.0 ASR Flash
- Qwen 官方账号发布 Qwen-Audio-3.0-ASR-Flash,新增上下文一致性、术语识别和热词等能力。
- 官方内部测试称医疗术语召回率为 95.36%。
要点拆解展开
语音转写竞争正在从通用字错率转向领域术语和结构化输出。当前证据仍不足以判断真实生产效果。
医疗和工业团队可小规模测试热词与术语识别。采购前应要求测试集口径、延迟和错误分布。
- 医疗术语召回
- 95.36%Qwen 内部测试自报,测试集和比较基线未公开Qwen
- 工业术语召回
- 93.24%Qwen 内部测试自报,不能等同整体转写准确率Qwen
- 这是一条官方单源产品信号,文档页未给出同等清晰的发布日期。
- 两个召回率缺少测试集、基线和第三方复现,不能写成通用准确率。
- Qwen 是否公开术语测试集与基线
- 流式和录音文件模式的延迟差异如何
社交雷达 · X 讨论
- OpenAI Developers 表示,自 2026 年 8 月 31 日起,GPT-5.4 和 GPT-5.4 mini 将不再向已登录 ChatGPT 的用户提供
- 两款模型仍会保留在 OpenAI API,以及使用 API Key 认证的 Codex 会话中。
原帖 ↗- Jason 据 DeepSeek-V4-Flash 发布信号判断,开源模型正在扩大优势。
- 他预测未来 24 个月 token 成本或降至百分之一,约半数 token 会在本地运行
- 这是个人预测。
原帖 ↗- Google 正在向美国以外的 Google AI Pro 用户推出 Gemini Spark。
- 官方将其描述为可在用户指挥下全天候后台执行任务的个人 AI Agent
- 措辞是“正在推出”,并非所有地区已经全部可用。
原帖 ↗- 微软 Azure 宣布,月之暗面的 Kimi K3 已通过 Fireworks AI 接入 Microsoft Foundry。
- 官方帖称该开放权重模型总参数为 2.8 万亿,上下文窗口为 100 万 token。
原帖 ↗- Nous Research 已把 FLUX 3 Preview 免费试用扩大到全部 Nous Portal 用户,包括免费层
- 测试该模型不再要求订阅。
- 这里是访问范围扩大,不是模型再次发布。
原帖 ↗- Krea 介绍 MiniMax H3,称其能以更低成本覆盖 Seedance 的相关功能,并表示模型权重将于之后开放。
- 当前状态是“即将开放权重”,不能写成已经开源。
原帖 ↗更多讨论3 条
- Frontis 团队自报:单张 RTX 4090、12GB 显存、每项任务 12 小时下,MA1-35B 在 MLE-Bench Lite 得 71.21%。
- NatureBench 的 Match-SOTA 由 50% 升至 70%,仍待独立复核。
原帖 ↗- OptMem 用一个 Python 脚本和一段 333-token 提示词为 Agent 提供持久记忆协议,由模型自行记录
- 压缩和检索,不依赖向量数据库
- Embedding 或常驻后台服务。
原帖 ↗- 据导演菲菲飞介绍,抖音 AI 短剧《被裁掉的女孩》累计播放量已超过 2 亿,女主角方桃子的账号粉丝接近 40 万。
- 其披露的制作成本为数万元、单集约 1 万多元,每集平均耗时两到三天
- 最耗时的环节是场景、服装、妆造与视觉基调的建立。
原帖 ↗