#AI 治理
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 安全治理2026-07-17 · 周五重要度 3/5深度报告 →
待验证|OpenAI 谈青少年安全 AI 访问
低限核验:OpenAI 官方 RSS 显示该文折算为北京时间 7 月 17 日 00:00 发布。正文未抓到,仅 RSS 摘要确认适龄保护、学习工具、家长控制和专家合作四个方向。
这篇只能作为待验证的官方立场更新。正文抓取失败,不能把 RSS 摘要扩写成已上线功能或具体政策截止时间。
- 政策治理2026-07-16 · 周四重要度 4/5深度报告 →
OpenAI 提议州法先收敛前沿 AI 安全基线
OpenAI 7 月 15 日提出“反向联邦主义”路径,主张州法围绕风险评估公开、重大事故报告和独立审计收敛,再与仍在制定的联邦网络评测框架衔接。
- 这不是新法规,而是 OpenAI 对正在形成的美国规则体系表态。
- 公司支持统一联邦标准,同时把三州法律视为事实基线,兼顾安全义务与避免监管碎片化。
- 行业动态2026-07-10 · 周五重要度 4/5深度报告 →
Bernanke 加入 Anthropic LTBT:AI 公司治理引入宏观风险视角
Anthropic LTBT 任命前美联储主席 Ben Bernanke 为成员。这个独立监督结构可任命董事会成员。
- Anthropic 把治理监督从 AI 安全专家扩展到宏观经济与金融危机经验。
- 它关注的不只是模型失控,也包括 AI 对劳动、市场和公共机构的系统性冲击。
- 行业动态2026-07-10 · 周五重要度 4/5深度报告 →
Anthropic Hard Questions:试图把公众问题变成 AI 公司问责清单
Anthropic 启动 Hard Questions 倡议,披露 Public Record 首轮覆盖 52,000 名美国人,并用 Interviewer 调查 81,000 名 Claude 用户。
- Anthropic 把公众担忧从抽象民意转成可追踪问题清单。
- 它真正要验证的是公司能否把问责从安全论文推进到产品、政策和季度报告。
- 行业动态2026-07-09 · 周四重要度 4/5深度报告 →
OpenAI 发布首份《国家安全原则》:四条红线写进与战争部的现有合约
OpenAI 7 月 8 日发布首份《国家安全原则》,四条红线已写入与战争部的现有合约,由前司法部国安分部部长 David Kris 协助起草。
- 产品上新2026-07-08 · 周三重要度 4/5深度报告 →
Anthropic 将 Claude Code 和 Cowork 带入政府桌面 beta
Anthropic 在 7 月 7 日宣布 Claude Code 与 Claude Cowork 进入 Claude for Government Desktop public beta,并强调 FedRAMP High 环境。使用场景包括系统现代化、RFP 审阅、memo、casework 和 deck。
- 头条2026-07-04 · 周六重要度 5/5深度报告 →
Anthropic 发布 Fable 5 cyber safeguards 完整版:CJS 4 轴评分与 4 象限分类器
Anthropic 7-2 在 Fable 5 重启公告的次日发布 cyber safeguards 完整技术细节。核心是 CJS 4 轴评分、4 象限分类器与 HackerOne 越狱征集。
- 这份完整框架把 AI 安全治理从事件响应推向制度化对齐。
- 7-2 重启公告只带过 CJS 草稿,这次公开评分细则、案例、上下调规则和 HackerOne 流程,让实验室、监管和白帽有了同一套风险语言。
- 头条2026-07-02 · 周四重要度 5/5深度报告 →
21 天撤回、>99% 拦截、一份四维度框架:Anthropic Fable 5 重启给出了 AI 安全治理的新范式
Anthropic 7-1 宣布 Claude Fable 5 全球恢复(原于 6-12 因美方出口管制下架),同步联合 Amazon/Microsoft/Google 等 Project Glasswing 伙伴起草行业首个 jailbreak 严重性 4 维评估框架(能力增益/增益广度/武器化难度/可发现性),并在美国商务部 CAISI 测试下交付了拦截率 >99% 的新 safety classifier。事件回溯:6-9 发布 Fable 5 + Mythos 5,6-12 美方因 Amazon 研究者报告中可绕过 safeguard 识别软件漏洞并产出 exploit 代码而下令全部用户暂停,Anthropic 复测确认所有 8 款主流模型(含 Haiku 4.5/Sonnet 4.6/Opus 4.6/4.7/4.8/GPT-5.4/5.5/Kimi K2.7)均能产出相同利用代码、该技巧并未暴露 Mythos 级独有网络能力。Mythos 5 仅向经美方批准的美国机构开放;Fable 5 在 Pro/Max/Team 档 7-7 前含 50% 周配额免费额度、之后转 usage credits;AWS/Google Cloud/Microsoft Foundry 接入仍待恢复。
- Anthropic 在 22 天内完成了一次从「单家被管制」到「行业协作治理」的范式转换
- 三周前是单一厂商面临出口管制危机,今天是 Anthropic + Amazon + Microsoft + Google 联合起草 jailbreak 严重性框架,配套 HackerOne + 24/7 监控 + 美政府合作研究团队。
- 行业动态2026-06-27 · 周六深度报告 →
前沿模型获取首次进入「政府审批」:GPT-5.6 逐客审批 + Mythos 5 牌照式放行
6 月 27 日,两条平行新闻合龙成一个信号:美国前沿 AI「谁能用」的决策权第一次被搬进政府审批流程。OpenAI 的 GPT-5.6 Sol 应特朗普政府要求分阶段发布,预览期只对名单已报备政府的一小批受信任伙伴开放,Sam Altman 对员工称后续将『逐个客户』审批,《华盛顿邮报》标题直书『政府将决定谁能用 GPT-5.6』,该报道登上当日 Hacker News 榜首(约 1150 分、1205 条评论);同期 Anthropic 被暂停两周的旗舰网络安全模型 Mythos 5 由商务部长 Lutnick 致信放行,获准向 100 多家运营关键基础设施的美国机构恢复访问,信中明示『不再需要出口许可证』。一软一硬、一事前一事后,共同把前沿最强模型的获取从厂商自助开通变成政府逐案审批。但独立评估方 METR 明确表示其评估『不构成公众可依赖的稳健监督』,触发 Anthropic 暂停的所谓越狱仅是『少数已知的轻微漏洞』——审批机制正在拼装,却缺乏透明的技术标准。
- 行业动态2026-06-26 · 周五深度报告 →
前沿 AI 进入「政府审批」时代:GPT-5.6 要预先通报,Mythos 暂停又恢复
同一天里,两家美国头部实验室的最强模型都先过了国家安全这道闸:OpenAI 的 GPT-5.6 仅向少数受信任伙伴限量预览,并就模型能力向美国政府预先通报、配合 cyber 行政命令框架,WaPo 称「政府将决定谁能用」、The Verge 称应特朗普政府要求延期;Anthropic 自 6 月 12 日起被指令暂停 Mythos 5/Fable 5,6 月 26 日由商务部长 Lutnick 签字放行,允许向 100 多家运营关键基础设施的「受信任」美国机构恢复 Mythos 5。前沿模型的访问权,正被国家安全框架接管。
- 头条2026-06-26 · 周五深度报告 →
OpenAI 预览 GPT-5.6:Sol/Terra/Luna 三档齐发,主攻网络安全——却被政府按住了发行
OpenAI 启动 GPT-5.6 限量预览,新命名体系把『代际』(5.6)和『能力档位』(Sol/Terra/Luna)拆开。旗舰 Sol 在 Terminal-Bench 2.1 刷到 88.8%(ultra 91.9%)、超过 Claude Mythos 5 的 88%,被称『迄今最强网络安全模型』但未跨 Preparedness 的 Cyber Critical 阈值。真正的分水岭是:这次发行应美国政府要求限量,只对『名单已报备政府』的伙伴开放——OpenAI 公开说这不该成为长期默认。
- 头条2026-06-22 · 周一重要度 5/5深度报告 →
Five Eyes 罕见联合发声:前沿 AI 将在『数月内』放大进攻性网络能力
6 月 22 日,美(NSA、CISA)、英(NCSC)、澳(ACSC)、加(Cyber Centre)、新西兰(NCSC)五国六家网络与情报机构联名发布一份约 3 页的声明《AI 给网络风险带来的转变:领导者为何必须立即行动》,六位机构负责人共同署名警告:前沿 AI 模型『预计将超出当前行业预期』,在攻防两端同时重塑网络能力,而这一变化的时间尺度『不是数年,而是数月』(The timeline is not years, it is months)。声明罕见地不谈具体技术细节、不点名某个模型,而是直接喊话企业董事会与高管:把网络韧性当成核心业务风险而非 IT 问题,主动把 AI 用于自身防御,并立刻夯实补丁、攻击面收敛、身份管控等基本功——因为 AI 正在把『漏洞被发现到被利用』的窗口越压越短。加拿大 Cyber Centre 在配套国别声明里把这个窗口具体化为『从数天数周缩到数小时』,并披露其与 AI 厂商共建的 Project Glasswing 项目。