Anthropic 推出 Opus 5,维持 Opus 4.8 价格
基础价不变、任务成本下降与安全回退并行,真实采购价值仍要看任务级复现。
本文要点
- Opus 价位从 4.8 迁移到 5,基础输入输出单价维持不变。
- Max 默认模型与 Pro 最强模型切换到 Opus 5。
- Fast mode 把速度与价格拆成独立档位,约 2.5 倍速度对应两倍基础价。
阅读辅助
先看数字、证据和来源,再读正文。
Opus 5 维持 Opus 4.8 的基础价格,不应被表述为基础单价再次下降。
2026-07-24 · Anthropic 公布 Opus 5,并称当日覆盖所有平台;官方页面只给日期,未给精确小时。
2026 年 7 月 24 日,Anthropic 发布 Claude Opus 5,并把基础单价维持在 Opus 4.8 原有的 每百万输入 token 5 美元、输出 token 25 美元。同一公告还出现了相对 Fable 5 的“半价”产品档位,以及限定在特定评测和 effort 下的每任务成本比较,三种口径需要分别阅读。
发布状态本身很清楚。Anthropic 在 7 月 24 日宣布 Opus 5 当日覆盖所有平台,API 模型名为 claude-opus-5;它成为 Claude Max 的默认模型,并被称为 Claude Pro 上能力最强的模型。Fast mode 约为 Opus 5 默认速度的 2.5 倍,在 Claude Platform 按基础价格的 2 倍提供。
需要保留的疑问主要来自评测可比性。大量结果是 Anthropic 的内部运行或合作方自有基准;不同图表使用不同 effort、任务、成本和回退条件。第三方 Artificial Analysis 的结果支持“任务成本更优”的方向,却也显示高 effort 任务可能花更长时间。因而,基础单价、每任务成本和交付时延不能互相替代。
开发者得到的是一个更细的采购组合:默认模式控制价格,Fast mode 购买速度,effort 调节推理强度,被安全分类器标记的请求还能按产品或 API 配置回退。企业买方则需要把模型身份、回退记录、总耗时和任务成功率放进同一张账单,否则“同价更强”仍可能掩盖长任务的时间成本。
先拆清三种“便宜”
Anthropic 公告同时出现了“与前代同价”“Fable 5 半价”和“更低每任务成本”。它们分别回答基础计费、产品档位和基准任务效率,不能合并成一句“Opus 5 再次降价”。
| 比较维度 | Opus 5 的公开口径 | 比较基准 | 可以得出的结论 |
|---|---|---|---|
| 基础输入价 | 5 美元/百万 token | Opus 4.8 | 价格维持不变,不是再次下调 |
| 基础输出价 | 25 美元/百万 token | Opus 4.8 | 价格维持不变,任务总价仍由用量决定 |
| 产品定位 | 接近 Fable 5 的前沿智能,价格为其一半 | Fable 5 | 是产品档位比较,不等于每个任务都省一半 |
| CursorBench 3.2 | max effort 与 Fable 5 峰值相差不到 0.5% | Fable 5 峰值 | 官方称该设置下每任务成本为后者一半 |
| Fast mode | 约为默认速度的 2.5 倍 | Opus 5 默认模式 | 在 Claude Platform 按基础价 2 倍计费 |
| AA-Briefcase | max effort 为 17.79 美元/任务 | Fable 5 的 22.30 美元/任务 | 第三方自有基准中成本低约 20%,不代表通用生产成本 |
基础 token 价格只是一项费率。Agent 任务会反复读取文件、调用工具、写入缓存、重试或回退,最终账单取决于输入输出规模、cache write、cache hit、effort 和轮次数。Anthropic 在 Frontier-Bench 的脚注还说明,该内部运行采用 mini-SWE-agent 与 GKE 后端,每项任务取 5 次尝试的平均奖励;Opus 5 与 Fable 5 遇到安全分类器拒绝时,使用 Opus 4.8 回退。这些条件都会影响成功率和成本。
Artificial Analysis 官方 X 帖提供了一组有用的反向约束,也是本文所用 AA-Briefcase 数字的唯一直接来源。其 AA-Briefcase 是自有的 Agent 知识工作基准;Opus 5 在 max effort 获得 1720 Elo,比 Fable 5 的 1574 Elo高 146 分,每任务成本从 22.30 美元降到 17.79 美元。但 max effort 平均任务耗时为 36.2 分钟,约比 Opus 4.8 的 24.1 分钟长 50%,平均轮次也从 55 轮增至 103 轮。GDPval-AA 是另一项评测,只作为呈现方法背景,不能验证这些数字。这组数据说明,模型可能通过更长的执行链换取更高完成质量;“更省钱”不自动等于“更快交付”。
榜单增量要逐项保留分母
Anthropic 把 Opus 5 的主要增量放在软件工程、知识工作、问题求解和计算机操作。公告称,Frontier-Bench v0.1 中 Opus 5 的表现超过其他受测模型,相对 Opus 4.8 提升超过 2 倍,同时每任务成本更低。这个“超过 2 倍”只对应该版本评测与官方运行条件,不能扩展成通用编码能力翻倍。
CursorBench 也存在两种容易混淆的设置。Anthropic 公告谈的是 max effort:Opus 5 与 Fable 5 峰值相差不到 0.5%,每任务成本为后者一半。Cursor 官方账号则在发布当日给出默认 effort 的 66.7 对 66.5。前者比较峰值与任务成本,后者比较默认设置得分;它们可以互相补充,不能拼成同一行结论。
问题求解基准同样需要保留对象。Anthropic 称 Opus 5 在 ARC-AGI 3 的得分是第二名模型的 3 倍;ARC Prize 当日公告给出的分数是 30.2%,并以 GPT-5.6 Sol(Max)此前的 7.8%为历史最高分参照。这里的“第二名模型”和“此前最高分”不是天然相同的分母,报道不应拿 30.2 ÷ 7.8反推官方“三倍”的口径。
AutomationBench 的表述则包含成本约束:按相同每任务成本比较,Opus 5 的通过率约为第二名模型的 1.5 倍;即使最低 effort,官方也称它通过的任务多于其他模型。OSWorld 2.0 中,官方说 Opus 5 在各成本点均领先,并以略高于 Fable 5 三分之一的成本超过后者最佳结果。这些都是“在给定成本下的表现”,不是无条件的绝对能力倍数。
生命科学数据来自 Anthropic 内部评测。相对 Opus 4.8,Opus 5 在光谱数据推断分子结构任务上高 10.2 个百分点,在蛋白质序列变化影响功能的任务上高 7.7 个百分点。百分点与百分比不是一回事;公告也没有把这两项结果表述为全部科学研究任务的平均提升。相关外部复现与任务集细节仍需结合 System Card继续核对。
评测数字的可比性清单
- Frontier-Bench 的结果来自 Anthropic 内部运行,并使用特定 Agent harness、后端与每任务 5 次尝试。
- CursorBench 的“不到 0.5%”对应 max effort 与 Fable 5 峰值;Cursor 的 66.7 对 66.5对应默认 effort。
- ARC-AGI 3 的“3 倍”以官方公告所称第二名模型为基准;30.2% 对 7.8%来自 ARC Prize 的历史最高分对照。
- AutomationBench 的“约 1.5 倍”限定为相同每任务成本下的通过率。
- AA-Briefcase 是 Artificial Analysis 的自有基准,其成本、Elo、耗时和轮次应成组阅读。
安全变化不是“能力再次下降”
Anthropic 对高风险双用途能力的核心句子是:Opus 5 “does not advance the frontier”,并且在生物研究与进攻性网络安全两方面 “remains behind Mythos 5”。remains behind 表示相对落后状态仍然存在,不能改写为 Opus 5 的能力再次下降,也不能据此推断 Mythos 5 在本次发布中再次提高。
| 官方措辞 | 忠实中文 | 不能写成 |
|---|---|---|
| the same as Opus 4.8 | 与 Opus 4.8 基础价格相同 | Opus 5 再次降价 |
| remains behind Mythos 5 | 仍落后于 Mythos 5 | Opus 5 的相关能力再次下降 |
| expect classifiers to intervene around 85% less often | 预计分类器介入频率比 Fable 5 少约 85% | 安全性提高 85%或能力提高 85% |
| available today on all platforms | 当日覆盖所有平台 | 两项 beta 配套功能也已全面正式可用 |
| releasing two updates in beta | 发布两项 beta 更新 | 所有部署环境默认启用且已稳定 |
网络安全部分还有更细的能力拆分。Anthropic 称 Opus 5 没有专门训练网络攻击任务,但随着通用能力增强,它在寻找漏洞方面接近 Mythos 5;在 OSS-Fuzz 评估中,两者发现漏洞的成功率接近,Opus 5 在把漏洞转化为实际利用程序方面则明显落后。因而,“仍落后”主要不能被省略成“网络安全更弱”这一句笼统判断:漏洞发现、渗透测试与利用开发是不同阶段。
护栏也按任务类别区分。Opus 5 允许源代码漏洞查找,但会阻断更可能关联恶意行为的二进制漏洞扫描、渗透测试和利用生成。Anthropic 根据测试预计,其分类器比 Fable 5 少约 85%介入。该数字的分母是 Fable 5 分类器介入频率,动词是“预计”;它既不是用户实流量的已观测结果,也不是安全误判率降低 85%,更不是模型能力提升幅度。
当请求被标记时,Claude.ai、Claude Code 与 Claude Cowork 默认回退到 Opus 4.8。API 用户可以选择启用回退,但 Claude Platform 文档明确把服务端回退标为 beta:一次调用最多可指定 3 个回退模型,响应会标出实际回答的模型;Message Batches API 不支持该参数,Amazon Bedrock、Google Cloud 和 Microsoft Foundry 也不能直接使用服务端回退,需要客户端中间件。
这组限制意味着“请求有答案”和“由 Opus 5 回答”不是同一件事。企业若把模型输出用于代码审查、安全研究或受监管流程,需要记录原始模型、分类器拒绝、回退模型、计费抵扣和最终响应。否则,汇总成功率可能混合 Opus 5 与 Opus 4.8,既影响能力评估,也影响审计。
正式模型与 beta 配套功能分开看
Opus 5 本体的状态是当日可用并覆盖所有平台。两项配套更新则被 Anthropic 单独放在 beta 下:其一是在 Claude Platform 的对话中途改变 Claude 可以使用的工具,而不让已有 prompt cache 失效;其二是 API 自动回退,让被 Opus 5 或 Fable 5 安全分类器标记的请求改由其他模型处理。
对话中途更新的工程价值在长会话里更明显。稳定的系统指令与历史消息可以保留在缓存前缀中,只有后来才需要的指令或工具权限在对应位置加入,避免为了修改工具集合而让整段前缀重新计算。Claude Platform 的配套文档解释了中途追加系统消息、保持已缓存前缀的机制背景。不过,文档能力与公告中的工具变更仍应按 beta 边界使用,不应直接推导为所有 SDK 和云平台都已稳定支持。
一般访问的数据保留政策同样是“维持”而非新增加码。公告写明,与此前 Opus 模型一致,Opus 5 的 general access 不设数据保留要求。适用范围必须保留为一般访问;这句话不能扩大成所有合同、所有云平台、所有日志与所有企业部署都没有数据保留安排。
Fast mode 则是正式模型上的价格速度档。约 2.5 倍的比较基准是 Opus 5 默认速度,价格基准是 Opus 5 基础价;“As with Opus 4.8”说明这项定价结构沿用前代,而不是本次首次加速或再次提价。Claude Platform 按基础价 2 倍提供,Claude Code 可通过 usage credits 使用。对需要低延迟的人机协作,它可能有价值;对几十分钟的异步 Agent,是否值得支付溢价要由端到端完成时间而非 token 吞吐单独决定。
Opus 5 真正改变的不是 Opus 基础单价,而是高端模型的采购单位。Anthropic 试图把比较从“每百万 token 多少钱”推进到“一个真实任务花多少钱、多久完成、是否需要回退”。维持 Opus 4.8 的 5 美元输入、25 美元输出价格只是入口;决定模型能否成为日常默认项的,是它能否用更少返工完成更长的 Agent 链路。
这也解释了为什么官方评测集中使用 effort 与成本曲线,而不是只给一个最高分。Opus 5 可以在默认模式、Fast mode 和多档 effort 之间移动,安全请求还可能回退到 Opus 4.8。模型产品正在从单一端点变成一个带速度、推理预算和安全路由的执行系统。对开发者有利的是选择更多;对采购和治理不利的是,同一个模型名背后的实际执行路径更难用一行价格描述。
现阶段最有说服力的正面信号,是官方和第三方都观察到任务成本改善;最需要压住的乐观推论,是把特定 benchmark 的优势当成所有工作负载的通用节省。AA-Briefcase 中 max effort 的成本下降伴随平均耗时增加到 36.2 分钟,说明高质量可能来自更长、更主动的执行。若企业只看 token 账单,可能低估等待时间、并发占用和人工复核成本。
安全路由是这次发布中容易被榜单遮住的产品变化。分类器预计比 Fable 5 少约 85%介入,有望减少合法安全研究被阻断;但真实流量结果尚未公布。默认回退能提升可用性,也会模糊模型身份。最佳实践不是关闭回退,而是把拒绝、回退与最终模型纳入可观察性,让“任务完成”与“由哪个模型完成”同时可查。
因此,Opus 5 可以被视为 Anthropic 对“日常高端模型”的一次更完整报价,而不是一次简单降价。它对 Opus 4.8 用户的吸引力来自同基础价下的能力增量;对 Fable 5 用户的吸引力来自部分任务中的成本接近一半;对企业的最终价值仍取决于独立复现、延迟预算和回退审计。三类比较对象必须分开,才能判断迁移是否真的划算。
接下来的验证应围绕任务账单
公开复现首先要把成功率、总 token、缓存、工具调用、重试、回退、耗时和人工复核一起报告。只公布得分会隐藏成本,只公布成本会隐藏任务难度,只公布平均速度又会掩盖长尾失败。尤其是 Frontier-Bench 这类 Agent 任务,应明确每项任务的尝试次数以及回退是否计入最终成绩。
Fast mode 需要真实负载曲线。官方的约 2.5 倍是相对默认速度的概括值;代码仓库检索、浏览器操作、长文档分析和多工具工作流是否都能接近这一增幅,目前没有统一答案。企业应比较端到端完成时间与失败重试,而不是只测首 token 或生成吞吐。
分类器应公开至少三类指标:介入率、合法任务误判率、危险任务漏放率。少约 85%介入只有与任务构成和结果质量结合才有解释力。回退链还应报告原模型拒绝原因、实际回答模型、是否使用 fallback credit,以及不同云平台采用服务端还是客户端回退。
最后是迁移决策。Opus 4.8 用户要看同价下的完成率和返工下降;Fable 5 用户要验证“半价接近峰值”是否落在自己的任务上;Max 与 Pro 用户则要观察默认模型变化后的限额、速度与稳定性。只有当这些结果在生产数据中稳定复现,Opus 5 才能从发布日的榜单领先,变成可审计的日常模型。