AI 使用数据扩围,语音入口集体升级
- Google 首次用 1500 万次去标识化交互描画 AI 的工作与生活用途。
- OpenAI 把健康记录接入 ChatGPT,但目前仅向美国成年用户滚动开放。
- 今天的增量集中在入口与使用证据:厂商开始用大样本解释 AI 被怎样使用,也把语音从问答界面推进到资料理解和工具执行。
- 覆盖规模很大,但厂商自有样本、滚动开放和单源发布仍限制结论外推。
本期速览
3 条01大样本揭示使用广而任务浅
- ATLAS 汇总 1500 万次交互。
02健康数据进入对话上下文
- ChatGPT Health 向美国成年人滚动开放。
03语音从快问答走向执行
- Claude 语音新增 Opus 与 Sonnet。
编辑总结
Google ATLAS 提供了过去 24 小时最扎实的新证据:AI 使用已跨越多数职业,但在典型职业内仍只触及部分任务。这个结论来自 Google 自有产品,适合描述用途结构,不足以证明整体生产率或就业变化。
语音入口同时扩张。Claude 已把更强模型和获许可工具接入语音;OpenAI 桌面语音、Grok 4.5 与 Qwen TTS 仍主要依赖官方 X 的发布口径,因此按低置信线索呈现,等待非 X 文档与独立验证。
本期导航
本期重点 · 深度报告
Key Numbers
ATLAS 覆盖职业
数据覆盖 4000 项任务,并映射到 800 个职业
来源:Google ATLAS v1.0快讯 · 已核验与追踪
AREX 用递归核查训练深度研究智能体
AREX 论文于 7 月 23 日首次提交 arXiv,提出内层研究与外层逐约束审计循环。团队训练了 4B 稠密模型和 122B-A10B MoE 模型。
要点拆解展开
递归核查和上下文压缩直接针对深度研究智能体在长任务中的证据遗失与方向漂移。
研究者获得新的训练与评测思路。应用团队仍需衡量多轮核查带来的延迟和成本。
- 稠密模型规模
- 4B论文披露的较小 AREX 实例参数规模arXiv 2607.21461
- MoE 总参数
- 122B混合专家实例总参数规模,每次激活 10BarXiv 2607.21461
- 论文把长时研究的关键问题定义为持续保存已验证证据并定位未解约束。
- 性能仍来自作者评测,成本、数据合成偏差和独立复现尚待公开。
- 代码、训练数据与完整轨迹何时公开?
- 递归审计的 token 与时延成本相对基线增加多少?
OneCLI 1.42.0 修复智能体凭据注入绕过
OneCLI 于 7 月 23 日发布 1.42.0,加入首个匹配即生效的统一策略引擎,并修复凭据注入中的主机校验绕过。Show HN 同日获得 85 分。
要点拆解展开
凭据代理是智能体执行外部操作的关键边界,这次安全修复具有直接工程参考价值。
采用 OneCLI 的团队应升级并复核主机策略。其他平台也应检查凭据注入前的目标绑定。
- 发布版本
- 1.42.0GitHub 在 7 月 23 日发布的版本OneCLI GitHub
- Show HN 分数
- 85 分采集时的 Hacker News 社区热度,不代表产品质量Hacker News
更新把智能体凭据代理从规则拼接推进到更明确的策略决策,同时用安全修复提醒开发者:秘密不进上下文并不等于注入链路天然安全。
- 使用旧版本的部署是否会收到明确安全通告?
- 策略引擎是否会增加冲突检测与审计输出?
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
单源称|OpenAI 把桌面语音接入 Work 与 Codex
- OpenAI 官方 X 称 ChatGPT Voice 于 7 月 23 日开始全球推出,可在 macOS 与 Windows 控制电脑并协调 Work 或 Codex 智能体。
- 官方帮助页尚未提供同步说明。
要点拆解展开
如果按公告落地,用户可从口头指令直接进入电脑操作和多智能体协调,交互边界明显扩大。
桌面用户获得免手操作入口。安全团队需要验证权限提示、屏幕控制范围和误操作恢复。
- 桌面平台
- 2 个官方 X 列出的 macOS 与 WindowsOpenAI 官方 X
- 覆盖方案
- 5 类Plus、Pro、Business、Edu 与 EnterpriseOpenAI 官方 X
语音正在成为多智能体调度入口,但当前证据只有官方 X。覆盖方案、远程控制边界与分批节奏仍需产品文档确认。
- OpenAI 帮助中心何时补充桌面语音发布说明?
- 全球推出是即时全量还是分批开放?
单源称|Qwen-Audio-3.0-TTS 支持 16 种语言
- 通义千问官方 X 于 7 月 23 日发布 Qwen-Audio-3.0-TTS,项目页称其支持 16 种语言
- 86 个细粒度标签和最长 3 分钟单次长文本生成。
- 页面未标发布日期。
要点拆解展开
多语言、长文本和细粒度控制同时影响语音产品的可部署性,但核心效果尚缺独立复现。
语音开发者可评估更细的情绪与局部控制。采购方需要复核延迟、稳定性和授权条件。
- 支持语言
- 16 种项目页列出的多语言覆盖范围,其中 7 种为新增Qwen 项目页
- 细粒度标签
- 86 个用于局部情绪、停顿和非语言事件控制的新增标签Qwen 项目页
- 项目把自由文本控制、局部标签和低帧率 tokenizer 放进同一生产型 TTS 系统。
- 排行榜第一仍需按参评模型、测试时间与人评口径理解。
- 是否会发布带日期的技术报告、权重或模型卡?
- Artificial Analysis 排名在更多参评模型加入后是否保持?
单源称|Grok 4.5 已覆盖网页、X 与移动端
- Grok 官方账号于 7 月 23 日称 Grok 4.5 已在 grok.com、X、iOS 与 Android 应用可用,并称其为当前能力最强版本。
- xAI News 页面未提供对应公告。
要点拆解展开
Grok 的跨端模型切换影响大量 X 与移动端用户,但缺少技术材料使能力判断无法核验。
消费者可在多个入口尝试新版本。开发者仍需等待 API、价格与模型卡。
- 明确覆盖入口
- 4 类grok.com、X、iOS 与 AndroidGrok 官方 X
- 跨端可用是明确增量,但官方推文没有模型卡、基准、价格或 API 状态。
- 现阶段只能确认消费端发布口径,不能外推出性能领先。
- xAI 何时发布 Grok 4.5 模型卡与安全评估?
- API 名称、价格、上下文长度和地区范围何时公开?
社交雷达 · X 讨论
- Grok 官方宣布 Grok 4.5 已在 grok.com
- X 以及 iOS 和 Android 应用上线,并称其为目前能力最强的 Grok 模型。
原帖 ↗- Thibault Sottiaux 推荐用户在离开键盘时,以 ChatGPT 桌面应用中的语音功能继续指挥工作
- 该功能现已可用。
原帖 ↗- Gemini Spark 也开始向美国 Google AI Pro 订阅者推出
- Google 表示随后会扩展至更多国家,但未给出具体时间。
原帖 ↗- Sakana AI 发布 Fugu-Ultra v1.1:引入最新前沿模型后
- 在其展示的每项基准上均优于 v1.0
- 最高提升 7.9 分
- ProgramBench 与 Terminal Bench 2.1 表现尤其突出
原帖 ↗- Codex 应用 26.715 更新加入 GPT-Live 语音和多文件夹本地项目
- 指定的主文件夹负责新聊天、Git 操作及 AGENTS.md、skills、config.toml 的发现,其他文件夹仍可参与项目。
原帖 ↗- Baseten 推出面向高要求实时场景的 GLM-5.2 Fast 模型 API
- 其称 Fast 层的每秒 token 吞吐量为标准 GLM-5.2 MAPI 的 2 至 3 倍。
原帖 ↗更多讨论5 条
- Together AI 预告 Kimi K3 将于 7 月 27 日发布当天接入其推理服务,定位于编程、智能体与生产工作负载
- 目前是上线预告,并非已经可用。
原帖 ↗一则讨论将 meta-agent 定义为任务进行中管理其他智能体的上层系统:它能介入、回退、分叉和审计执行过程,类似面向智能体的 Git,并可能成为人机交互的新界面。
原帖 ↗《深入理解 AI Agent:设计原理与工程实践》全书开源,配有 28 个可运行项目,覆盖上下文、工具调用、Coding Agent、自我进化、多智能体协作和多模态交互,并含 0.6B 小模型的本地工具调用示例。
原帖 ↗《Build Your Own Pi》教程从真实运行轨迹出发,用 TypeScript 搭建类 Pi 智能体,重点覆盖工具调用配对、流式中断恢复、会话树分支、上下文压缩,以及模型或工具失败后的状态与协议处理。
原帖 ↗- Waza 更新把常见工程习惯整理为智能体可执行的 8 项技能,同时删减重复指引
- 加入确定性的发布前检查,并强化调试与质量检查,以给实际工作保留更多上下文。
原帖 ↗