#Safety Classifier
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 头条2026-07-04 · 周六重要度 5/5深度报告 →
Anthropic 发布 Fable 5 cyber safeguards 完整版:CJS 4 轴评分与 4 象限分类器
Anthropic 7-2 在 Fable 5 重启公告的次日发布 cyber safeguards 完整技术细节。核心是 CJS 4 轴评分、4 象限分类器与 HackerOne 越狱征集。
- 这份完整框架把 AI 安全治理从事件响应推向制度化对齐。
- 7-2 重启公告只带过 CJS 草稿,这次公开评分细则、案例、上下调规则和 HackerOne 流程,让实验室、监管和白帽有了同一套风险语言。
- 头条2026-07-03 · 周五重要度 5/5深度报告 →
24 小时,从"史上最强 Sonnet"到"订阅用户 7-7 起将用不到":Fable 5 重启后的三连击把 Anthropic 的最高能力民主化实验拉下了马
Claude Fable 5 在 7-1 全球恢复 24 小时后,三个独立维度同时遭遇重击:(1) @bridgemindai 在 BridgeBench 重测,Debugging 86.2 → 25.9、Refactoring 73.6 → 38.4、Hallucination 75.9 → 61.7,归因为新硬性护栏过度触发并回退 Opus 4.8;(2) @Hesamation「Fable 5 不是被 nerf,而是被屠杀」一贴 4,485 赞 / 364 转,@Khazix0918 实测 Fable 5 自主去火山引擎提交工单的 500 赞 / 11 万浏览帖,以及社区造出新词「disfabled」(disabled-by-safety)形成对照;(3) Anthropic Claude Code 团队成员 @trq212 7-2 22:49 UTC 官宣 Fable 5 将于 7-7 后从订阅下架,后续"视产能恢复回归订阅",与昨日公告中「7-7 前 Pro/Max/Team 含 50% 周配额免费额度、之后转 usage credits」路径相符;LMArena 同步数据:Fable 5 在 Code Arena:Frontend 仍居 #1 但已下滑 27 分,与 Anthropic 7-1 自承「new safeguards will flag a slightly higher fraction of harmless requests」一致。Anthropic 把「安全敏感性」抬高一档的工程取舍,正在被公开标注为「整套订阅价值被掏空」。
- 头条2026-07-02 · 周四重要度 5/5深度报告 →
21 天撤回、>99% 拦截、一份四维度框架:Anthropic Fable 5 重启给出了 AI 安全治理的新范式
Anthropic 7-1 宣布 Claude Fable 5 全球恢复(原于 6-12 因美方出口管制下架),同步联合 Amazon/Microsoft/Google 等 Project Glasswing 伙伴起草行业首个 jailbreak 严重性 4 维评估框架(能力增益/增益广度/武器化难度/可发现性),并在美国商务部 CAISI 测试下交付了拦截率 >99% 的新 safety classifier。事件回溯:6-9 发布 Fable 5 + Mythos 5,6-12 美方因 Amazon 研究者报告中可绕过 safeguard 识别软件漏洞并产出 exploit 代码而下令全部用户暂停,Anthropic 复测确认所有 8 款主流模型(含 Haiku 4.5/Sonnet 4.6/Opus 4.6/4.7/4.8/GPT-5.4/5.5/Kimi K2.7)均能产出相同利用代码、该技巧并未暴露 Mythos 级独有网络能力。Mythos 5 仅向经美方批准的美国机构开放;Fable 5 在 Pro/Max/Team 档 7-7 前含 50% 周配额免费额度、之后转 usage credits;AWS/Google Cloud/Microsoft Foundry 接入仍待恢复。