#AI 安全
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 产品上新2026-08-13 · 周四重要度 3/5
Claude浏览器侧栏并入Cowork会话
Anthropic于8月12日将Claude in Chrome侧栏改为Cowork会话,浏览器中的对话、技能和连接器可随账户在桌面、网页与移动端续接。新侧栏当天面向Max与Team开放,Pro将在未来数周推出。
- 浏览器扩展从独立入口变成跨设备智能体会话,减少任务切换时的上下文断裂。
- 它同时扩大了已登录网页与连接器的权限面,企业默认关闭策略仍然重要。
- 行业动态2026-08-13 · 周四重要度 4/5
德国组织投诉Meta AI眼镜涉嫌违法录制
德国人权组织HateAid于8月12日宣布,已向法兰克福总检察院提交针对Meta及相关AI眼镜销售方的刑事投诉,主张设备可能违反隐私和录音相关法律。投诉不等于检方已立案或违法事实成立。
- 可穿戴AI的合规对象不只包括用户数据,也包括镜头前不知情的第三人。
- 若执法推进,默认录制、指示灯和人工审核链路都可能成为产品设计约束。
- 研究论文2026-08-13 · 周四重要度 4/5深度报告 →
8月12日解读|Google称事实召回成为瓶颈
Google Research于8月12日发布对2月论文的新解读。研究用2150个事实、13个模型和约450万次回答区分编码与召回,称GPT-5与Gemini-3 Pro已编码95%至98%的事实,但直接召回仍失败26%至34%。
- 该研究把部分幻觉问题从模型没学到改写为模型取不出来,支持按需推理与召回增强。
- WikiProfile来自Wikipedia事实且依赖自动评分,尚不能取代开放域和业务事实性评估。
- 产品上新2026-08-12 · 周三重要度 4/5深度报告 →
SpaceXAI开启Grok Bot早期测试
SpaceXAI于8月11日介绍Grok Bot早期测试:用户把任务交给运行在持续云电脑中的Grok,任务可继续后台执行。首批资格面向SuperGrok Heavy以及部分Cursor Ultra、Cursor Teams Premium用户。
- Grok Bot把聊天模型推进为拥有持续计算环境的远程执行体。
- 云电脑扩大了后台执行能力,但文件、账号凭证、联网权限、资源共享和长任务失控仍需要可见的边界与审计。
- 行业动态2026-08-12 · 周三重要度 4/5深度报告 →
OpenAI将Daybreak模型带到AWS Bedrock
OpenAI于8月11日宣布Daybreak Blue与Red现可经Amazon Bedrock使用;新增价值限于企业采购入口与由OpenAI准入、AWS权限组成的双层控制面。
- 本次没有新增模型能力或评测
- 价值限于把获批模型纳入AWS采购,并把OpenAI资格审核与AWS账号、区域和IAM授权组成双层控制面。
- 行业动态2026-08-11 · 周二重要度 3/5
8月10日跟进|单源披露tl;dv会议记录风险
8月10日HN讨论升温,重新带出安全研究者8月4日的单源披露:tl;dv的Firestore meetings集合疑似缺少租户隔离,可枚举181874条会议记录。tl;dv回应称问题已修复,但修复时间、181874条数量与实际影响均未独立确认。
- 本次增量来自8月10日社区讨论及其中链接的公司回应
- 技术披露本身仍是8月4日研究者单源文章。
- 行业动态2026-08-11 · 周二重要度 4/5深度报告 →
Anthropic公布Claude内容标记实施口径
Anthropic于8月10日更新帮助页:在欧盟于8月2日及以后上线的新Claude模型从发布时支持机器可读标记,文本嵌入水印,受支持文件附C2PA签名来源元数据;旧模型仍在过渡。
- 这是一份实施承诺,不等于现有所有Claude输出已可被可靠识别。
- 关键缺口是检测工具、误报率、编辑后的保留率和各云平台支持矩阵
- 模型发布2026-08-11 · 周二重要度 5/5深度报告 →
OpenAI推出GPT-5.6-Cyber,Daybreak分为两级
OpenAI于8月10日推出GPT-5.6-Cyber,并将Daybreak设为Blue与Red两级。官方内部评测称Red模型完成95.0%的高级网络安全请求,但这衡量的是是否响应,不是漏洞利用成功率。
- 能力提升与访问治理被绑定在同一产品结构中。
- Red通过身份验证、监控和法律声明放宽拒答
- 行业动态2026-07-27 · 周一重要度 4/5深度报告 →
Open Secure AI Alliance 成立:37 家企业把开源模型列为防御资产
NVIDIA 于 2026-07-27 公布 Open Secure AI Alliance,创始名单 37 家企业与机构。联盟以 Hugging Face 用自托管开源模型 GLM 5.2 分析 1.7 万余条攻击动作为核心论据。NVIDIA 同步开源 agent 框架 NOOA。
- 头条2026-07-26 · 周日重要度 5/5深度报告 →
7月25日跟进|OpenAI 称 Hugging Face 事故仍在审查
OpenAI 7 月 25 日回应 Hugging Face 事故,称仍与外部顾问共同开展全面审查,并由安全与安保委员会监督。公司计划在未来数周发布技术报告,但发布以审查完成为前提。
- 这次回应的新增信息是调查状态与披露计划,而不是最终归因。
- 编辑边界应停在“仍在审查”,媒体披露与旧事故材料只能用于说明待回答的问题。
- 模型发布2026-07-25 · 周六重要度 5/5深度报告 →
Anthropic 推出 Opus 5,维持 Opus 4.8 价格
Anthropic 7 月 24 日推出 Claude Opus 5,覆盖所有平台。基础价格为每百万输入 5 美元、输出 25 美元,与 Opus 4.8 相同。
- 研究评测2026-07-25 · 周六重要度 4/5深度报告 →
Drone-Bench 测模型编写无人机跟飞代码
Anthropic 与 Andon Labs 7 月 24 日公布 Drone-Bench,用 5 个独立软件子任务评估模型编写室内无人机定位、导航与跟飞代码的能力,共测试 15 个模型。
- 这项评测把具身任务拆成可重复测量的软件模块,避免用一次演示代表通用能力。
- 当前重建仍是瓶颈,距离可靠的串行自主飞行还有明显边界。
- 头条2026-07-11 · 周六重要度 5/5深度报告 →
待验证|CASP 称 Boko Haram 已把前沿 AI 用进训练与作战支持
单份 CASP 报告基于 27 名 Boko Haram 前成员访谈,称两派已使用多家前沿 AI 系统辅助作战和日常行动。
- 这条不是抽象安全担忧,而是把滥用路径写进具体组织流程。
- 它要求模型厂商把安全评测从越狱题库扩展到训练、翻译、武器排障和组织传播链条。
- 行业动态2026-07-08 · 周三重要度 4/5深度报告 →
zkSecurity 用 AI 审计 Cloudflare CIRCL:7 个漏洞已修复
zkSecurity 披露其 AI 审计 pipeline 在 Cloudflare CIRCL 中发现的候选问题。研究员验证后确认 7 个真实漏洞,涉及 threshold RSA、BLS aggregate、HPKE PSK、CP-ABE 等模块,修复已合入上游。
- 这条新闻的价值在证据链:候选发现、人工验证、最小 PoC、上游 commit 和严重度对照都能追踪。
- AI 安全工具的门槛会从“能发现”转向“能降低验证成本”。
- 头条2026-07-04 · 周六重要度 5/5深度报告 →
Anthropic 把 AI 越狱打分做成行业标准:CJS 评分、四象限分类器与 HackerOne 征集
Anthropic 7-2 公布 Fable 5 cyber safeguards 细节与 CJS 草案。四象限分类器上调安全边际,CJS 用四轴把越狱分成 CJS-0 到 CJS-4,并接入 HackerOne 漏洞征集。
- 产品上新2026-07-02 · 周四重要度 4/5深度报告 →
Cognition Devin Security Swarm:用 Agentic MapReduce 把 AI 安全扫描从 token 成本问题转成并行工程问题
Cognition 发布 Devin Security Swarm——在复杂代码库中查找安全漏洞的更便宜、更准确的新方案,基于全新架构 Agentic MapReduce。Map 阶段并行派出多个 Devin 子 agent 同时扫描不同模块/文件树;Reduce 阶段汇总各子 agent 的发现,交叉验证、消除重复、聚类可疑路径。相比传统单 agent 顺序扫描,Agentic MapReduce 把扫描时间与 token 成本并行化,把『AI 做安全的成本曲线』从『单一 agent 的长上下文负担』转成『可水平扩展的并行工程问题』。这是 Devin 从通用软件工程 agent 向『AI 做安全』垂直延伸的标志——继 6-30 Devin Fusion(多 agent 协作通用软件工程)之后,Cognition 把多 agent 范式推到安全扫描场景,意味着 agent 厂商正在从『通用软件工程』走向『垂直 agent marketplace』(安全/数据/SRE/财务)。
- 产品上新2026-07-02 · 周四重要度 4/5
Cognition Devin Security Swarm:Agentic MapReduce 架构把 AI 安全扫描做成并行任务,成本更低、准确度更高
Cognition 发布 Devin Security Swarm——在复杂代码库中查找安全漏洞的更便宜、更准确的新方案,基于全新架构 Agentic MapReduce。Map 阶段:并行派出多个 Devin 子 agent 同时扫描不同模块/文件树;Reduce 阶段:汇总各子 agent 的发现,交叉验证、消除重复、聚类可疑路径。相比传统单 agent 顺序扫描,Agentic MapReduce 把扫描时间与 token 成本并行化,定位漏洞更便宜、更准确。这是 Devin 从通用软件工程 agent 向「AI 做安全」垂直延伸的标志——继 6-30 Devin Fusion(多 agent 协作通用软件工程)之后,Cognition 把多 agent 范式推到安全扫描场景。
- Devin Security Swarm 真正的价值不在「又一款 AI 安全工具」,而在 Agentic MapReduce 把 AI 安全扫描从「单 agent token 成本问题」转成「并行扫描的工程问题」
- 这是 OpenAI Deep Research、Devin Fusion、AgentKit 等『harness 化』范式在垂直场景的又一次落地。
- 研究论文2026-06-28 · 周日重要度 3/5
论文:LLM 自动简历筛选可被提示注入攻破,单注入与多注入实测
一篇 arXiv 论文(Prompt Injection in Automated Résumé Screening with Large Language Models)研究用 LLM 做自动简历筛选时的提示注入攻击,在『单注入』与『多注入』两种设置下实测——求职者可在简历中嵌入隐藏指令操纵 LLM 的筛选/打分结果,从而不公平地抬高自己的通过率。
- 这是 prompt injection 从『安全研究者的演示』落到『高利害真实场景』的一个典型案例。
- 简历筛选直接关系到就业公平和企业合规,而越来越多公司在用 LLM 做初筛——这意味着攻击面已经实实在在地存在于招聘流水线里。
- 头条2026-06-28 · 周日重要度 5/5深度报告 →
OpenAI 放出 GPT-5.6 三档预览 Sol/Terra/Luna:换了命名体系,Terra 性价比翻倍,但先报备了美国政府
OpenAI 启动 GPT-5.6『有限预览』,用 Sol(旗舰)/Terra(均衡)/Luna(低价)三档能力位替代旧命名——数字代表『代数』,名字代表可独立迭代的『能力档』。定价(每百万 token):Sol 输入 $5 / 输出 $30,Terra $2.50 / $15,Luna $1 / $6;官方称 Terra 性能对标上代 GPT-5.5 但价格便宜 2 倍。Benchmark 多为 OpenAI 自报:Sol 在 Terminal-Bench 2.1 上创 SOTA,在 ExploitBench 上以约 1/3 输出 tokens 与 Mythos Preview 竞争。新增 max reasoning effort 与借助 subagents 的 ultra 模式;prompt caching 支持显式 cache breakpoints、缓存最短存活 30 分钟、写入按未缓存输入价 1.25x、读取享 90% 折扣。安全上未跨越 Preparedness Framework 的 Cyber Critical 阈值,自动化红队投入超 70 万 A100 等效 GPU 小时。最反常的一点:应美国政府要求,本次先做小范围预览、参与方已报备政府,广泛开放要『未来数周』;7 月将在 Cerebras 上线 Sol,速度最高 750 tokens/秒。
- 头条2026-06-22 · 周一重要度 5/5深度报告 →
Five Eyes 罕见联合发声:前沿 AI 将在『数月内』放大进攻性网络能力
6 月 22 日,美(NSA、CISA)、英(NCSC)、澳(ACSC)、加(Cyber Centre)、新西兰(NCSC)五国六家网络与情报机构联名发布一份约 3 页的声明《AI 给网络风险带来的转变:领导者为何必须立即行动》,六位机构负责人共同署名警告:前沿 AI 模型『预计将超出当前行业预期』,在攻防两端同时重塑网络能力,而这一变化的时间尺度『不是数年,而是数月』(The timeline is not years, it is months)。声明罕见地不谈具体技术细节、不点名某个模型,而是直接喊话企业董事会与高管:把网络韧性当成核心业务风险而非 IT 问题,主动把 AI 用于自身防御,并立刻夯实补丁、攻击面收敛、身份管控等基本功——因为 AI 正在把『漏洞被发现到被利用』的窗口越压越短。加拿大 Cyber Centre 在配套国别声明里把这个窗口具体化为『从数天数周缩到数小时』,并披露其与 AI 厂商共建的 Project Glasswing 项目。
- 行业动态2026-06-22 · 周一重要度 3/5
『Agentjacking』:伪造错误报告投毒,诱导编码 Agent 执行恶意指令(待核实规模)
据聚合媒体 buildfastwithai 6 月整理,出现一类名为 Agentjacking 的新攻击:用伪造的 Sentry 错误报告夹带 Markdown 注入,被 Claude Code、Cursor、OpenAI Codex 等编码 Agent 当作合法内容执行;文中称利用成功率 85%、影响 2388 家组织,尚无通用补丁,缓解建议是把错误追踪输出当作不可信输入并加人工复核。
- 无论具体数字是否准确,这类攻击点出了 Agent 时代的结构性新风险面:Agent 会主动读取并信任各类工具输出(错误日志、issue、网页),任何一环都可能成为提示注入入口。
- 这与当日 Five Eyes 警告、GateMem 的访问控制研究在同一逻辑链上——AI 把攻击面从『代码』扩展到了『一切被模型读取的内容』。