产品上新

Claude 语音模式接入 Opus、Sonnet 与工具

语音模式从 Haiku 快问答扩展到按方案选模型,并把获许可的工具动作接入口头对话。

2026年7月24日 · 周五深度报告高置信重要度 4/5

本文要点

  • 语音从仅 Haiku 变为按方案可选 Opus、Sonnet、Haiku。
  • 付费方案可在语音中使用全部已连接工具,Free 限一个工具。
  • 语言扩展至 11 种,但切换仍需口头要求或手动设置。

阅读辅助

先看数字、证据和来源,再读正文。

7 月 23 日更新日期
3 个语音模型家族
4 条 Claim Audit

Claude 语音模式从仅 Haiku 扩展到 Opus、Sonnet、Haiku,但模型可用性继续跟随方案。

4 个时间点

2026-07-23 之前 · Claude 语音模式仅运行 Haiku,以响应速度为优先,复杂问题的模型选择受限。

6 个来源6 个非 X 来源

7 月 23 日的更新把 Claude 语音模式从“只能用 Haiku 的快速对话”扩展成按方案选择模型、在许可后调用连接工具的任务入口。变化集中在一条连续链路上:用户先用语音梳理问题,再在同一段对话里选择更强模型,最后把明确动作交给已经连接的日历、邮件、文档或协作工具。

可确认的范围很具体。Claude Opus、Sonnet、Haiku 都进入了语音模式,但可选模型仍跟随订阅方案;Free 用户仍是 Haiku。付费方案可以访问扩展模型,并在语音中使用全部已经连接的工具;Free 方案可连接 1 个工具。Claude 在执行连接工具前会请求许可,语音对话也会计入相应方案的常规用量限制。

这次发布没有承诺所有用户都可用 Opus、Sonnet,也没有把“更多语言”变成自动识别。官方列出 11 种可选语言,覆盖所有方案;用户需要口头要求 Claude 切换,或在语音设置中手动选择。Claude 不会自动检测语言,原有语言设置也不会自动带入语音模式。

对个人用户,语音开始能从讨论跨到执行;对团队和企业,风险点也从回答是否准确扩展到“谁授权了哪个外部动作”。模型更强并不会取消方案边界,工具接入也不等于后台自动执行。真正影响落地质量的是延迟、用量、许可粒度和审计记录。

从 Haiku 快答到按方案选择模型

Anthropic 对更新前状态的描述很清楚:语音模式此前只运行 Claude Haiku,选择它是为了速度。这个取舍让对话保持轻快,却不总能承接需要较长推理、反复澄清或多步比较的问题。7 月 23 日起,Opus 与 Sonnet 也可进入语音对话;用户可以在对话过程中通过模型选择器切换,语音模式会使用所选模型的快速版本。

帮助中心补充了一条不能省略的限制:语音模式里的可用模型遵循用户方案。也就是说,“Opus、Sonnet 已进入语音模式”描述的是产品能力池扩大,不是把这两类模型发给每一位用户。Free 方案仍使用 Haiku;付费方案访问扩展模型时,也要以该方案实际提供的模型为准。

语音与文字可以在同一个会话中切换,上下文继续保留。语音启动时会继承用户上次在文字聊天中使用的模型,并自动切到该模型的最新一代;用户也可在语音对话中途换模型。这让“先口头发散、再文字核对细节、最后回到语音推进”的流程保持在单一会话中,无需另开一个缺少上下文的语音窗口。

官方同时说明,语音交互仍采用轮流对话:Claude 听取用户表达,停顿思考,再作答。更强模型带来的是处理复杂问题的能力扩展,不等于持续抢话式的全双工承诺,也不意味着所有任务都能保持 Haiku 的响应速度。不同模型在语音中的端到端延迟和用量消耗,官方尚未给出横向数字。

能力范围与方案边界

维度7 月 23 日前或基础状态本次更新后的范围必须保留的边界
模型语音仅运行 HaikuOpus、Sonnet、Haiku 进入语音模式可用模型跟随方案;Free 仍为 Haiku
工具语音侧能力有限可调用 Gmail、Slack、日历、文档等已连接工具执行前请求许可;“全部”仅指已连接工具
Free 方案HaikuHaiku、1 个连接工具、全部可用语言不包含 Opus、Sonnet 的统一权益
付费方案按方案使用 Claude可访问扩展模型与全部已连接工具语音对话计入常规用量
语言以英语为主要入口11 种语言面向所有方案不自动检测,必须口头或手动切换
客户端语音以移动使用为主beta 覆盖 mobile、desktop、web官方仍称手机体验最佳

这张表里最容易被误读的是“all chat users”。官方说测试版面向所有 chat 用户开放,指的是三端均有进入语音模式的资格,不是所有人获得相同的模型、工具数量与用量额度。准入范围是全体,权益范围仍分层。

第二个易混淆点是“paid plans can access expanded models”。准确中文应是“付费方案可访问扩展模型”,并结合帮助中心的“模型跟随方案”理解。不能把它改写成“所有付费用户默认使用 Opus”,也不能假设 Opus、Sonnet 在每个付费层级中的额度和优先级完全相同。

口头意图如何跨到获许可动作

模型扩展解决“能否把问题想深”,工具接入解决“想清楚后能否做事”。官方示例包括:让 Claude 把 Google Calendar 上的会议推迟 30 分钟;把关于客户提案的讨论整理成 Canva 单页;汇总当天邮件,并为最关键的邮件起草回复。这些例子横跨读取、内容生成与可能改变外部状态的操作。

语音入口降低了发起动作的成本,也增加了误听、指代不清和环境噪声的风险。Anthropic 给出的最低授权承诺是:Claude 在使用已连接工具之前会请求许可。由此可以确认,工具不会因为一句口头提及就在无确认状态下自动执行;但公告没有进一步披露许可是否对每个动作逐项弹出、读操作与写操作是否分级、一次许可能覆盖多长会话。

“全部已连接工具”也需要按字面理解:付费方案可以在语音模式中使用用户已经完成连接的工具,Claude 不会自动获得连接器目录中所有服务的访问权。连接器目录显示,这些集成由 Model Context Protocol 支持,并可能具有只读、读写或交互等不同能力;连接器提供方还可能有各自的条款和隐私政策。用户是否连接、连接了哪个账户、授予何种权限,仍是执行链的前置条件。

一个更稳妥的治理链条应包含四个节点:识别用户口头意图,向用户复述准备执行的动作,请求许可,完成后返回可核对的结果。前两步和后一步的具体产品形态并未在公告中完整承诺,因此本文不把它们写成现有功能;但对涉及发信、改日历或更新外部文档的企业工作流,这些节点会直接决定语音工具调用能否进入生产环境。

帮助中心还提醒,语音模式同时使用多个工具可能带来短暂延迟,而且并非所有结果都能在语音界面完整显示。这意味着语音适合发起与推进任务,却不一定适合检查长表格、复杂权限差异或大段修改结果。高风险动作仍需要回到屏幕,确认对象、时间、收件人和最终内容。

多语言扩展不等于自动识别

官方列出的语言共有 11 种:英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、巴西葡萄牙语、拉丁美洲西班牙语和西班牙西班牙语。其中英语之外的语言支持仍处于 beta 范围。

所有方案都能使用这些可用语言,Free 用户并未因模型限制而只获得英语。但切换机制是显式的:用户可以在对话中口头告诉 Claude 从英语换到目标语言,也可以在语音设置的语言选择器中手动选择。Claude 不会自动检测正在说哪一种语言;此前应用或聊天中的语言设置也不会自动带入语音模式,需要单独设置。

因此,“speaks many more languages”可以翻译为“支持更多可选语言”,不能翻译为“自动识别更多语言”。前者是语言清单扩大,后者是未提供的路由能力。两者对体验差异很大:在多人、多语言或临时切换场景中,用户仍需先发出切换指令;如果系统识别错当前语言,不能假设它会自行纠正。

语言数量也不能替代质量指标。官方没有提供各语言的语音识别错误率、口音覆盖、响应延迟或代码切换成功率。11 种说明可用范围,不说明等质量。尤其在邮件、会议安排和外部文档这类工具动作中,人名、日期与专有名词的识别错误会从对话瑕疵变成执行风险。

用量、端侧与聊天记录

这次 beta 面向所有 chat 用户,覆盖 mobile、desktop、web 3 类入口,官方称在手机上体验最佳。移动端适合通勤、走动和双手被占用的场景;桌面端与 Web 则让语音可以贴近邮件、日历和文档工作流。覆盖三端并不改变方案权益:Free 仍是 Haiku 与一个连接工具,付费方案才可访问扩展模型和全部已连接工具。

语音对话计入常规用量限制,不是独立于文本额度之外的免费通道。更强模型、长对话和多个工具会如何折算用量,官方页面没有公布统一换算表。用户在达到方案用量限制后,语音模式也可能停止响应;因此,复杂语音任务能否稳定完成,既取决于模型能力,也取决于方案额度。

帮助中心说明,音频对话的文字转录会像普通文本聊天一样保存在聊天历史中。对个人用户,这有助于语音和文字之间延续上下文;对企业用户,它同时带来记录保留、敏感信息和访问控制问题。团队需要明确哪些口头信息可以进入聊天历史,连接工具返回的数据是否被写入转录,以及管理员能否检索工具调用记录。

Enterprise 所需的控制仍有公开缺口。帮助中心称企业所有者若希望禁用语音模式,需要联系支持;公告没有给出管理员自助开关、连接器白名单、按工具风险分级或可导出审计日志的完整说明。对消费级 beta,这些缺口不妨碍试用;对受监管团队,它们会决定语音工具调用能否从个人效率功能进入组织工作流。

早报观点

Claude 这次更新的关键价值,是把语音对话、模型选择和工具动作接成一条可持续推进的工作链。此前只用 Haiku 时,语音更适合快速问答;加入按方案可用的 Opus 与 Sonnet 后,用户可以在同一会话里处理更复杂的比较、推演和决策,再把明确动作交给已连接工具。语音由此获得了从思考到执行的连续性。

但连续性不能以模糊授权为代价。口头表达天然包含停顿、改口、代词和环境噪声;当输出只是回答时,错误通常还能通过追问修正,一旦落到发信、改日历或更新文档,错误会改变外部状态。Anthropic 承诺工具执行前请求许可,这是必要门槛;后续更值得看的,是许可能否按读取、写入、发送等风险分级,以及企业能否得到完整审计记录。

模型和语言的范围也必须按方案与设置解读。Opus、Sonnet 进入语音模式,不代表所有用户都获得它们;11 种语言面向所有方案,也不代表 Claude 会自动检测语言。把这些边界写清楚,比笼统宣称“语音全面升级”更能说明产品当前处在哪一步。

后续验证重点

  • 比较 Opus、Sonnet、Haiku 在同一语音任务中的首字延迟、打断恢复、总用量与完成质量,判断扩展模型的实际代价。
  • 观察工具许可是否会显示目标账户、动作类型和关键参数,尤其是发信、改日历与写入文档之前的确认信息。
  • 核对企业管理员能否直接禁用语音、限制连接器、导出工具调用日志,并设置敏感数据保留策略。
  • 等待 Anthropic 公布非英语语音评测,至少包括识别错误率、口音覆盖、语言切换成功率和专有名词表现。
  • 跟踪 beta 转稳定版本的时间,以及自动语言检测是否上线;在此之前,多语言使用仍依赖口头或手动切换。