Claude Mythos 5向更多防御者开放
新增落点是受控防御输出,而非直接开放模型。
本文要点
- Claude Security扫描现在可运行Claude Mythos 5。
- 伙伴防御工具仍是coming soon,不是已经普遍上线。
- 0xDAF新增3500万美元Claude credits。
阅读辅助
先看数字、证据和来源,再读正文。
Mythos 5已经进入Claude Security扫描,但伙伴工具仍是coming soon。
2026-04-07 · Anthropic宣布Project Glasswing,让少数伙伴用Mythos Preview做防御研究。
发生了什么
Anthropic在8月21日给Claude Mythos 5开了一条更宽但仍受控的防御通道。公告的三件新增事项很明确:Claude Mythos 5现在可用于Claude Security扫描;它将进入合作伙伴的网络防御产品和服务,但状态是coming soon;Anthropic同时推出Defender Advantage Fund,提供3500万美元Claude credits,面向开源软件安全组织、维护者和自动化修补项目。
这不是一次普通模型开放。Anthropic没有宣布用户可以在Claude.ai、API或Claude Code里直接调用Mythos 5做任意安全任务。相反,公告把访问路径拆成了三层:企业用户在Claude Security里拿到漏洞发现和建议补丁;安全产品伙伴在自家工具里调用模型生成限定产物;通过Cyber Verification Program获准的团队,在未来数周会先看到Opus和Sonnet的双用能力扩大,Mythos-class access仍是后续跟进。
不确定部分也需要前置。官方没有公布Claude Security扫描在真实企业代码库中的误报率、漏报率、样本规模和第三方复现结果。0xDAF也尚未公布首批受助者,只说明会从少数较大pilot grants开始。伙伴工具接入仍是路线图,不应写成已经上线。
对读者而言,这条新闻把前沿模型厂商的高风险能力放进了产品化防御输出。安全团队得到的是finding、CWE分类、confidence和severity评级、建议补丁;模型本身仍被放在后台,补丁仍需人工审查批准。
状态语义核对
这次公告容易被误写,尤其是“coming soon”“maintaining”“reduced safeguards”几个词。下面是本文采用的翻译口径:
| 原文措辞 | 本文表述 | 不能写成 |
|---|---|---|
| Claude Mythos 5 is now available in Claude Security | Mythos 5现在可用于Claude Security扫描 | Mythos 5全面开放 |
| coming soon to partners’ cyber defense tools | 将进入伙伴防御工具,尚未上线 | 已经接入所有伙伴产品 |
| maintaining appropriate guardrails | 维持适当护栏 | 再次提高限制 |
| currently in public beta for Claude Enterprise customers | Claude Security仍面向Enterprise客户公测 | 所有Claude用户都能使用 |
| billed as standard token usage under your existing plan | 按现有计划的标准token使用计费 | 免费或另有固定套餐 |
| reduced safeguards on Opus and Sonnet models | 已验证团队在Opus和Sonnet上减少拦截 | 完全取消安全限制 |
这张表决定了整篇的事实边界。Anthropic的当天新增是“防御结果可用性”扩大,而不是“直接模型权限”扩大。公告还特别说明,用户在Claude Security里扫描仓库后,可以打开Web版Claude Code实施修补,但交互式patching使用的是组织在Claude Code中本来可用的模型;Mythos扫描本身不会把Mythos访问扩展到其他surface。
产品边界从模型访问转向产物访问
Anthropic给出的安全逻辑是:当用户能直接和模型交互时,恶意行为者可以尝试把模型引向有害用途;如果用户只能收到特定输出,例如漏洞补丁或安全告警,风险会低得多。因此,Mythos 5这次进入的是已定义任务的产品流程,而非通用聊天窗口。
Claude Security的流程也体现了这点。企业管理员在admin console启用Claude Security,用户从claude.ai/security选择仓库,扫描结果返回每个finding的CWE类别、confidence评级、severity评级和建议修复。产品页还强调Claude Security会理解跨文件数据流和业务逻辑,目标是找出传统模式匹配工具可能漏掉的复杂漏洞。与此同时,产品页和公告都保留了人工控制线:Claude可能出错,关键系统的补丁必须审查后再应用。
这类设计把“能力强”变成“交付物受限”。一个修补工具可以返回建议patch,却不给终端用户提示模型写exploit的入口;一个告警工具可以返回安全alert,却不把原始模型能力暴露出来。对企业买方来说,好处是采购对象更接近已有安全工作流,坏处是可观测性会更重要:如果没有误报率、漏报率、审计日志和补丁质量数据,团队很难判断扫描结果是减少安全债,还是把人工复核压力换了一个形态。
| 入口 | 公告状态 | 用户拿到什么 | 明确边界 |
|---|---|---|---|
| Claude Security | 8月21日起可用Mythos 5扫描 | 漏洞finding、评级、建议补丁 | Enterprise public beta,补丁需人工批准 |
| 伙伴防御工具 | coming soon | 伙伴产品中的限定安全产物 | 尚未公布上线名单和时间 |
| Cyber Verification | 未来数周扩展 | Opus和Sonnet减少部分拦截 | Mythos-class access后续跟进 |
| Project Glasswing | 4月以来持续推进 | 受信伙伴用于关键软件防御 | 仍是严格控制下的项目访问 |
0xDAF补的是开源安全的执行预算
Defender Advantage Fund的金额是3500万美元,形式是Claude credits。公告把资金用途限定在三类:修补广泛使用项目中的live vulnerabilities;自动化扫描和修补流程,让其他项目可以复用;支持项目尝试更主动的安全方法,使软件能抵抗一整类攻击。
这和4月Project Glasswing的资金安排不同。Glasswing当时承诺的是最高1亿美元Mythos Preview模型使用额度,并称已向开源安全组织直接捐助400万美元,其中包括给Linux Foundation旗下Alpha-Omega和OpenSSF的250万美元,以及给Apache Software Foundation的150万美元。8月21日的0xDAF是在此基础上增加一个面向开源防御工作的credits基金。
开源安全的问题不只是“有没有强模型”。维护者最缺的是把漏洞发现变成修补、回归测试、协调披露和版本发布的时间。Anthropic把credits给到组织和项目,实际押注的是流程自动化能扩展维护者能力:模型扫描能发现候选漏洞,自动化工具能生成候选补丁,但最终仍要有人判断可利用性、兼容性、回归风险和披露节奏。
White House在7月14日宣布的Gold Eagle提供了另一个背景。该计划被描述为漏洞协调clearinghouse,目标是接收、优先排序并协调关键基础设施相关漏洞的验证和修补。Anthropic在8月公告中把Gold Eagle列为Project Glasswing支持的协调修补努力之一。因此,Gold Eagle不是当天新增新闻主体;它说明美国政府与行业正在把AI辅助漏洞发现纳入更制度化的响应链条。
Mythos能力为何仍被限制
Anthropic对Mythos的早期介绍给出了限制访问的原因。Mythos Preview被描述为通用、未发布的前沿模型,在漏洞发现和利用方面已经接近或超过除顶尖专家外的大多数人类水平。Glasswing页面称,它曾发现数千个高严重性漏洞,并举了OpenBSD、FFmpeg和Linux kernel等例子;相关漏洞已报告给维护者并修补。
基准数字也解释了为什么Anthropic不愿直接开放。Glasswing页面中,CyberGym漏洞复现一项显示Mythos Preview为83.1%,Opus 4.6为66.6%。同页还列出SWE-bench Verified 93.9%、Terminal-Bench 2.0 82.0%、SWE-bench Pro 77.8%等官方自报结果,并附有脚注说明部分评测存在memorization screen或内部实现口径。这里的数字能证明Anthropic自称Mythos-class能力很强,但不能替代独立第三方评测。
6月9日的Mythos产品页也延续了相同口径:Claude Mythos 5面向小范围初始测试伙伴,用于网络安全,并很快用于生物研究;定价从每百万输入token 10美元、每百万输出token 50美元起;使用Mythos 5需要接受30天数据保留政策用于安全监控。这些都是背景事实,不能当成8月21日的新发布。当天新变化是把这种能力放进Claude Security扫描和未来伙伴工具,而不是改变Mythos 5本身的基础定价或安全政策。
HN同日收录后的讨论也集中在这条边界。一类评论认为平均用户仍拿不到直接能力,另一类评论追问伙伴工具的合同和交付形态,还有评论质疑真实应急场景下的安全拦截是否会妨碍合法防御。社区讨论不能证明产品效果,但能指出Anthropic路线的核心摩擦:厂商认为受控产物能降低滥用风险,用户则会要求在事故响应中获得更少摩擦、更可解释的放行路径。
这次更新的核心,是Anthropic把Mythos 5的网络能力拆成两种商品形态:受限模型访问仍留在Project Glasswing和Cyber Verification这类准入计划里;可审计的防御结果则进入Claude Security、伙伴产品和开源credits计划,变成企业安全团队更容易采购和治理的工作流。
这一路线对Anthropic有明显好处。它既能让高能力模型产生商业和公共安全价值,又能避免在最敏感的网络能力上承担完全开放的外部风险。更重要的是,产品界面天然可以收窄任务空间:扫描仓库、输出CWE、给出severity、建议patch,这些都比“让模型任意回答安全问题”更容易记录、审计和风控。
风险也同样清楚。漏洞扫描和补丁建议不是只看“能不能找到问题”,还要看误报如何处理、修复是否引入回归、维护者是否有时间合并,以及厂商是否愿意公开失败样本。若0xDAF只变成credits发放清单,而没有可复用的修补流程和公开复盘,它对开源安全的实际增量会被高估。
因此,早报判断是:Mythos 5的8月21日进展标志着前沿模型安全能力进入“受控交付”阶段。行业接下来要比较模型能力怎样转化为可追责、可复核、可规模化的漏洞修补系统,而不能只比较exploit生成能力。
读者该如何理解影响
对企业安全团队,Claude Security的价值在于把前沿模型放进已有仓库扫描流程。团队可以把它当作第二层高语义扫描器,特别关注跨文件数据流、身份认证绕过、注入、内存错误和复杂业务逻辑漏洞。但采购和试点时应要求四类材料:误报与漏报统计、严重性分级校准方式、补丁review流程、以及扫描数据和日志的保留政策。
对开源维护者,0xDAF的价值取决于credits是否能转换成合并后的修补,而不是扫描报告数量。维护者真正需要的是能进入issue triage、复现、测试、release note和协调披露的完整链路。如果基金只补模型调用额度,没有补人力、CI资源和安全响应协调,最容易出现的结果是报告堆积而修复吞吐没有同步提高。
对AI平台方,Anthropic给出的样板是“高风险能力不直接裸奔”。同一底层能力可以通过Fable 5面向一般知识工作和编码场景,也可以通过Mythos 5在验证计划和产品后台承担安全任务。这意味着未来模型发布不再只看参数、榜单和价格,还会看访问层级、用途分类、数据保留、审计与人工批准机制。
对政策和监管方,Gold Eagle背景说明AI辅助漏洞发现正在和政府协调机制接上。真正要验证的是优先级排序是否透明,私营厂商发现的漏洞如何进入公共协调流程,以及关键基础设施修补是否会因为模型扫描规模扩大而更快。没有这些数据,“AI让防御者领先攻击者”仍然只是目标,不是已经完成的结果。
接下来看什么
短期最值得看的信号先落在0xDAF首批受助名单和成果披露:哪些项目拿到credits,修了哪些漏洞,修复周期是否缩短,是否有公开CVE、commit或release作为证据。
Claude Security还需要产品质量数据来证明价值。高严重性finding的确认率、被拒绝补丁的比例、人工review耗时,以及它和传统SAST、DAST工具叠加后是否减少噪声,都会影响企业是否扩大试点。
Cyber Verification的准入细则也会决定防御者实际能拿到多少能力。需要继续看哪些组织能获得Opus和Sonnet的更低拦截,Mythos-class access何时跟进,以及是否要求授权证明、审计日志和安全控制。
还要留意伙伴工具。公告说Anthropic正在和网络安全技术及服务伙伴合作,把Claude Mythos 5集成进防御者已经使用的产品和服务;但它没有公布具体伙伴名单、集成日期和商业条款。等真正上线后,行业才能判断这是传统token消耗模式、OEM授权,还是更深的托管安全服务能力。
还有一个较隐蔽的验证点是数据治理。Mythos产品页写明使用Mythos 5需要接受30天数据保留政策,用于安全监控。Claude Security场景又涉及企业私有代码和漏洞材料,因此后续文档若能明确扫描数据、生成补丁、审计记录与合作伙伴集成之间的隔离方式,会直接影响安全团队是否愿意把它放进高敏仓库。
最后,所有关于Mythos能力的数字都应保持口径意识。Glasswing里的CyberGym、SWE-bench和Terminal-Bench数字是Anthropic自报,部分还带有内部实现、token预算和memorization screen说明。它们足以解释为什么模型需要受控访问,却不足以证明Claude Security在每个企业代码库上都能稳定复现同等收益。8月21日的新闻成立点是分发路径变化;效果结论仍要等用户案例和第三方复核。