Topic Timeline
#HackerOne
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 头条2026-07-04 · 周六重要度 5/5深度报告 →
Anthropic 把 AI 越狱打分做成行业标准:CJS 评分、四象限分类器与 HackerOne 征集
Anthropic 7-2 公布 Fable 5 cyber safeguards 细节与 CJS 草案。四象限分类器上调安全边际,CJS 用四轴把越狱分成 CJS-0 到 CJS-4,并接入 HackerOne 漏洞征集。
- 这份完整框架把 AI 安全治理从事件响应推向制度化对齐。
- 7-2 重启公告只带过 CJS 草稿,这次公开评分细则、案例、上下调规则和 HackerOne 流程,让实验室、监管和白帽有了同一套风险语言。
- 头条2026-07-02 · 周四重要度 5/5深度报告 →
21 天撤回、>99% 拦截、一份四维度框架:Anthropic Fable 5 重启给出了 AI 安全治理的新范式
Anthropic 7-1 宣布 Claude Fable 5 全球恢复(原于 6-12 因美方出口管制下架),同步联合 Amazon/Microsoft/Google 等 Project Glasswing 伙伴起草行业首个 jailbreak 严重性 4 维评估框架(能力增益/增益广度/武器化难度/可发现性),并在美国商务部 CAISI 测试下交付了拦截率 >99% 的新 safety classifier。事件回溯:6-9 发布 Fable 5 + Mythos 5,6-12 美方因 Amazon 研究者报告中可绕过 safeguard 识别软件漏洞并产出 exploit 代码而下令全部用户暂停,Anthropic 复测确认所有 8 款主流模型(含 Haiku 4.5/Sonnet 4.6/Opus 4.6/4.7/4.8/GPT-5.4/5.5/Kimi K2.7)均能产出相同利用代码、该技巧并未暴露 Mythos 级独有网络能力。Mythos 5 仅向经美方批准的美国机构开放;Fable 5 在 Pro/Max/Team 档 7-7 前含 50% 周配额免费额度、之后转 usage credits;AWS/Google Cloud/Microsoft Foundry 接入仍待恢复。