本文要点
- HAWK的已知密钥恢复路径首次利用特定自同构,把核心格问题维度约减半。
- 七轮AES攻击用Möbius Bridge消去一个猜测字节,运行时间降低约8至10个比特。
- 模型产出从实现漏洞扩展到算法分析,人类验证成本成为公开的研究约束。
阅读辅助
先看数字、证据和来源,再读正文。
Claude参与找到的HAWK攻击削弱候选参数,但HAWK尚未部署,也未影响其他NIST候选方案。
2001 · NIST发布AES标准;AES-128以十轮处理128位数据块,并使用128位密钥。
Anthropic 在 2026 年 7 月 28 日 17:00 UTC 公布了两项由 Claude Mythos Preview 参与完成的密码分析结果。第一项针对尚在 NIST 评估中的后量子签名候选 HAWK;第二项针对 AES-128 的七轮弱化版本。二者都产生了可写入论文的算法改进,但都没有让当前生产系统进入紧急迁移状态。
可确认的硬事实分为两组。HAWK 研究从发现、开发到验证约用 60 小时,发布方估算 API 成本约 10 万美元,并提供了能恢复 HAWK-256 等价签名密钥的端到端代码。AES 研究把先前七轮攻击的运行时间降低 200 至 800 倍,研究对象只有完整 10 轮中的 7 轮,且仍要求约 2^105 个选择明文。
证据强度并不均匀。HAWK-256 有实际密钥恢复、参考实现签名与验证回环;七轮 AES 的完整攻击规模远超现有商用硬件,论文验证的是代数恒等式、组件、真实 AES-128 上的单位成本,以及小尺度密码上的端到端恢复。两篇论文和代码均来自 Anthropic 团队,尚未看到独立复现或正式同行评审,因此本稿维持 medium confidence。
对密码研究者,变化是模型已能在文献搜索、提出假设、计算实验和实现验证之间持续工作。企业安全团队目前无需轮换 AES 密钥或替换生产协议,应关注候选密码方案的评估流程会否加入模型辅助审计。对标准机构,最紧迫的问题变成如何接收大量机器生成的攻击候选,并为创新性、正确性与实际影响建立分层验收。
两项结果的证据边界
先把发布包能证明和不能证明的内容拆开,能避免“Claude 攻破 AES”这类错误外推。
| 证据 | 能证明什么 | 不能证明什么 |
|---|---|---|
| Anthropic 研究公告 | 发布时间、研究流程、厂商估算成本、影响边界与协调披露说法 | 独立复现已经完成,或成本能被第三方按同价复购 |
| HAWK 技术论文 | 针对特定环结构的密钥恢复归约、参数复杂度与 HAWK-256 实验 | 所有格密码或其他 NIST 候选都受影响 |
| HAWK 演示代码 | 对 HAWK-256 公钥恢复可用于签名的等价私钥,并通过参考实现验证 | HAWK-512、HAWK-1024 已按论文上界完成现实攻击 |
| 七轮 AES 论文 | Möbius Bridge 消去一个猜测字节,并给出多种计时口径 | 完整十轮 AES-128 被破解,或完整七轮攻击已经跑完 |
| AES 实验代码 | 组件恒等式、小尺度端到端攻击、真实七轮 AES 单位成本可重跑 | 2^105 数据规模和全部表项已被实际执行 |
| NIST 页面 | HAWK 是附加签名第三轮候选;AES 是现行 FIPS 标准 | Anthropic 结果已代表 NIST 的最终处置意见 |
| CryptanalysisBench | 有 191 项、六类密码原语的系统化评测框架 | 本次两项研究已经由该基准独立验证 |
这张表也解释了为何“算法级增量”比“生产系统告警”更准确。HAWK 处在公开竞赛和审查阶段,设计目的之一就是在部署前暴露问题;七轮 AES 是密码学界为了理解安全余量而构造的弱化研究对象。它们值得头条级关注,是因为模型触及了长期依赖专家创造力的分析环节,而不是因为互联网加密在当天失效。
HAWK:候选方案的有效强度被重估
HAWK 是基于格问题的后量子数字签名候选。NIST 的附加数字签名项目页面把它列在第三轮 9 个候选方案中,这个身份很关键:HAWK 还没有作为生产标准部署。Anthropic 也明确写道,该攻击不影响其他 NIST 后量子签名候选或格密码整体。
新攻击利用 HAWK 所用幂次二分圆分环中的一个此前未被利用的非平凡自同构。论文把密钥恢复归约到维度 n/2+1 的精确最短向量问题,而原有安全估计依赖更高维度的格约简。直观上,攻击者找到一个由公钥结构暴露的对称性,再沿该对称性把搜索问题压到约一半维度,最后恢复一把能替代原私钥完成签名的等价密钥。
“密钥强度减半”指安全指数或核心求解维度的显著下降,不能理解为攻击时间只减少一半。Anthropic 公告用 HAWK-256 举例,称原先预计约 2^64 的完整密钥恢复成本被实测到约 2^38;技术论文对正式参数给出更细口径:在其门电路计价模型下,HAWK-512 从约 2^150 降到至多 2^108,HAWK-1024 从约 2^288 降到至多 2^182。这些是模型化复杂度,不是按美元报价的现实攻击预算。
| HAWK 项目 | 既有估计 | 新结果 | 验证状态 |
|---|---|---|---|
| HAWK-256 挑战参数 | 公告称约 2^64 | 公告称约 2^38;代码约 3 小时 42 分 | 96 核参考机端到端恢复并完成签名验证 |
| HAWK-512 | 论文称约 2^150 gates | 至多约 2^108 gates | 理论归约与复杂度估计,未展示现实完整恢复 |
| HAWK-1024 | 论文称约 2^288 gates | 至多约 2^182 gates | 理论归约与复杂度估计,未展示现实完整恢复 |
HAWK-256 本来就是挑战参数集,不能拿它的数小时恢复直接断言更大参数也能在数小时内攻破。论文反而明确说,对更大的密钥,攻击仍不现实;新方法仍是指数时间攻击,不是把 HAWK 变成多项式时间可破。它改变的是安全余量和方案吸引力:若要维持原有安全等级,HAWK 可能需要显著增大密钥,而紧凑密钥正是它参与竞争的重要优势之一。
研究过程同样值得记录。Mythos 在类似 Claude Code 的多智能体沙箱中访问论文、Python 和 Sage,主要独立完成文献梳理、数学推理、计算实验与验证管线,人类操作者提供项目管理和少量非技术方向。公告称发现、开发、验证共约 60 小时,API 成本约 10 万美元。这个成本只有厂商公告一个账目来源,论文与代码能核对技术对象和运行阶段,却不能独立证明账单,因此不应把它写成行业统一价格。
七轮 AES:运行时间下降,数据墙仍在
AES 部分最容易被标题误导。NIST 的 FIPS 197 规定 AES 可使用 128、192、256 位密钥,处理 128 位数据块;本次论文只研究 AES-128,并进一步只取完整 10 轮中的 7 轮。研究弱化轮数版本是常规密码分析方法,用来观察攻击技术和评估安全余量,不代表完整标准使用了七轮配置。
先前基线是 Derbez、Fouque 与 Jean 在 2013 年给出的七轮中间相遇攻击:约需 2^105 个选择明文、2^99 运行工作量和 2^90 存储。Mythos 提出的 Möbius Bridge 利用 AES S-box 的代数结构,让指纹对一个未知字节保持不变,从而不再枚举这个字节。消去一个 8 位猜测,循环次数会直接减少 256 倍;但计算新指纹本身有成本,最终收益取决于怎样把查表、部分轮计算、缓存和向量指令折算成统一运行单位。
| 七轮 AES-128 口径 | 先前攻击 | 新攻击 | 应如何解读 |
|---|---|---|---|
| 选择明文数据 | 2^105 | 2^105 | 数据需求没有下降,仍完全不现实 |
| 标准计价运行时间 | 2^99 | 2^89.3 至 2^91.4 | 约 200 至 800 倍提速,区间来自计价方法 |
| 平衡复杂度 | 2^99 | 最低约 2^96.3 | 只改善约 2.7 比特,不是 800 倍总成本下降 |
| 攻击轮数 | 7 轮 | 7 轮 | 完整 AES-128 是 10 轮 |
| 端到端验证 | 理论大规模攻击 | 小尺度密码完成 50/50 恢复 | 完整七轮 AES-128 没有被实际跑完 |
论文自己提醒,在固定 2^105 数据口径下,数据仍是最大瓶颈,所以总复杂度的最大项没有因为运行时间下降而同步下降。若改用平衡数据、时间和内存的口径,新方法把约 2^99 降到约 2^96.3,改善约 2.7 比特。公告的 200 至 800 倍没有错,但它严格描述运行时间相对先前七轮攻击的改善,不能改写成攻击完整 AES 的成本整体降低 200 至 800 倍。
验证也采用了分层方案。研究者在一个 24 位密钥的小尺度七轮密码上对 50 把随机密钥执行完整恢复,两种比较方案均达到 50/50;在真实七轮 AES-128 上,他们测量表项和候选的单位周期成本,验证 Möbius 指纹、缓存与差分枚举组件。论文直言,完整七轮 AES-128 攻击无法用现有商用硬件在合理时间运行。因此,“代码可重跑”意味着组件和缩小实验可重跑,不意味着第三方只需下载仓库就能在工作站上破译 AES。
从生成答案到承担验证债务
两项研究采用了不同程度的自主性。HAWK 流程是半自主协作,人类偶尔提供方向;AES 流程接近全自主发现,研究者搭好能提出假设、运行实验和反驳假设的脚手架后,只给了少量实质提示。公告称模型三天内生成数亿 token,随后总输出达到约 10 亿 token,形成 Möbius Bridge 及后续细化。
但生成速度没有消除验证。AES 的核心想法约一周内出现,两名 Anthropic 研究者却接近一个月才对方法建立信心,合计投入数百小时。原因并不神秘:一个看似漂亮的代数不变量,还要经过边界条件、错误密钥分布、复杂度账本、实现常数与既有文献创新性核查。完整攻击又无法直接执行,验证者只能组合证明、缩小实验和单位成本投影。
HAWK 的验收路径更强,因为攻击能对 HAWK-256 端到端运行。仓库说明恢复出的是一把功能等价的解码私钥,而非原始 96 字节种子编码;最终证据是它能在 NIST 参考实现中签名,并由输入公钥成功验证。这个区别也很重要:密码分析的目标是获得签名能力,不需要逆推出生成私钥时的随机种子。
CryptanalysisBench 为这种能力提供了更广背景。论文收录 191 项任务,覆盖六类密码原语与多个 NIST 竞赛,并把已知实用攻击、未有实用攻击的完整或缩小方案、生产级前沿挑战分层。它说明模型密码分析已不再只是单个演示,却仍不是本次两项结果的独立裁判。基准作者与 Anthropic 研究人员有重合,任务成功率也不能替代对新攻击的密码学同行评审。
这次发布最有分量的变化,是模型开始在“算法为什么安全”这一层提出可检验的新攻击,而不只是在实现代码里寻找缓冲区、状态机或 API 使用错误。HAWK 的对称性利用与七轮 AES 的 Möbius Bridge 都需要跨论文理解既有攻击,再提出能进入复杂度账本的新结构;这比生成漏洞扫描脚本更接近密码研究的创造环节。
同时,结果把模型研究的真实成本暴露得很清楚。每项约 10 万美元 API 成本只是入口,AES 之后还有数百小时人工验证,完整攻击甚至无法端到端执行。研究产能可能先被模型放大,可信结论的产能却仍受制于少数能审计证明、实现和复杂度口径的专家。机构若只统计“模型提出了多少发现”,会迅速积累验证债务。
HAWK 案例支持把模型更早接入公开标准评估。候选方案在部署前被削弱,正是竞赛式密码设计希望得到的结果;即使 HAWK 最终被降级或改参,这次发现也更接近质量控制成功,而非安全事故。对 NIST 一类机构,挑战将从“有没有足够审查者”转向“怎样给机器生成的候选攻击排优先级,并保留可审计证据”。
AES 案例则提醒读者把技术增量和现实风险分开。200 至 800 倍是有意义的研究进展,但它发生在七轮变体的运行时间分项,数据仍需 2^105,完整十轮 AES 没有被攻破。夸大成生产危机会伤害这项工作的真正价值:模型找到了一种人类长期未用过的代数桥接方法,而且研究团队公开了足够多的验证材料,供密码社区逐项挑战。
早报判断是,当前应把 Claude Mythos Preview 看作昂贵、强力、需要严密验收的研究搜索器。它已经改变候选攻击的生成速度,却尚未证明能稳定替代顶尖密码学家。下一步的决定性证据不在厂商再公布一个惊人案例,而在独立团队能否复现、标准机构如何处置,以及同预算下完整失败分布是否公开。
评审桌上的三个检验
HAWK 的短期检验最明确:设计者与 NIST 是否接受复杂度推导,是否调整参数、安全等级或候选状态。独立研究者还需要确认攻击对环结构的依赖边界,以及“密钥翻倍才能恢复同等安全”会怎样影响性能和方案定位。若结论只适用于特定导子结构,它仍然能决定 HAWK 当前实例的命运,却不能外推到格密码整体。
七轮 AES 的复核重点应放在复杂度账本。第三方需要分别复现 Möbius 不变量、错误候选统计、真实 AES 单位成本与平衡复杂度,避免把查表、缓存和 AES-NI 计价差异隐藏在一个倍数里。只要数据仍是 2^105,对生产 AES 的风险判断就不会因某个组件快几百倍而改变。
更长期的问题是披露机制。Anthropic 称已在 2026 年 6 月向 HAWK 作者分享攻击,并与公开 NIST 邮件列表协调发布;两项当前结果都没有即时现实影响。未来若模型找到已部署密码系统的可实用攻击,同样的公开节奏可能不再合适。研究机构需要预先约定访问控制、厂商通知、标准机构介入和补丁窗口,而不是等模型第一次触及真实系统后临时决定。