本文要点
- 从一般内容越狱报告转为五道生物安全题的专项成功条件
- 从开放提交转为申请与邀请筛选后的私有测试平台
- 从内部红队扩展到外部研究者,但成果交流被 NDA 包围
阅读辅助
先看数字、证据和来源,再读正文。
该专项把成功条件限定为同一通用越狱通过五道生物安全问题且不触发内容审核。
2026-03-25 · OpenAI 发布公共 Safety Bug Bounty,并说明生物风险越狱另由私有专项计划处理。
7 月 9 日页面发布时,申请已在 6 月 22 日截止,测试则持续到 7 月 27 日。这组时间差意味着读者看到的是一项进行中的邀请制测试,不是仍可报名的新赏金。
OpenAI 要求研究者用同一个通用越狱策略,在干净会话中完成五道预设生物安全挑战题,同时不触发内容审核;首个完整通过者可获25,000 美元。申请在4 月 23 日开放,测试从4 月 28 日开始。参与者需通过申请或邀请进入平台,并签署 NDA。
核心条款主要来自 OpenAI 官方自报。FLI 报告能交叉核对题数、奖励、时间窗口、邀请制与 NDA,却没有独立测试数据。五道题内容、判分协议、尝试次数、有效提交数、误判率、获奖结果和修复记录均未公开。现有证据只能确认计划设计,不能确认防护效果。
对安全研究者而言,新增量是一个范围清楚、奖励明确的测试入口;对企业安全、公共卫生与政策团队而言,更关键的是它能否产出可审计的修复证据。一个私有项目可以合理保护高风险细节,但如果只有主办方知道测试如何失败、如何修复,外界就很难判断这笔赏金提高的是实际安全性,还是只提高了安全活动的可见度。
五道题把“越狱成功”变成了窄而严格的条件
普通内容越狱往往只要让模型在某次对话中越过拒答边界,就能展示一个显眼案例。这个专项要求更高:不是为每道题分别设计提示词,而是找出一个“通用”策略;不是在保留上下文的长对话里逐步诱导,而是从干净会话开始;不是只让模型输出片段,而是要通过全部五道预设挑战;同时还要避开内容审核。
| 条款 | 公开要求 | 能证明什么 | 不能证明什么 |
|---|---|---|---|
| 模型范围 | 仅限 Codex Desktop 中的 GPT-5.5 | 测试对象被限定,结果更容易归因 | 不能外推到 API、ChatGPT 其他入口或后续模型 |
| 攻击形式 | 同一个通用越狱策略 | 测的是跨题复用,而非一次性提示词技巧 | 未公开如何定义“同一个策略”以及允许哪些变体 |
| 任务数量 | 全部五道生物安全题 | 有明确的完整通过门槛 | 五题覆盖面、难度与现实风险代表性未知 |
| 审核条件 | 不触发内容审核 | 同时测试模型行为与审核链路 | 未说明模型拒答、分类器和平台拦截如何分别计分 |
| 完整奖励 | 首个有效提交获25,000 美元 | 给研究者一个清楚的经济激励 | 未公开付款、并列提交、复现失败或争议处理机制 |
| 信息披露 | 提示词、回复、发现与沟通受 NDA 约束 | 减少高风险方法即时扩散 | 外部无法直接检查失败样本和修复是否充分 |
这套设计的优点是,OpenAI 不再只说“欢迎红队反馈”,而是给出了清晰的成功条件。它也降低了把普通拒答绕过误报为重大生物安全漏洞的概率:只有跨越五题、跨越审核、可在限定环境中复现的提交,才接近项目定义的完整胜利。
但五题也可能成为过窄的代理指标。若研究团队知道测试集结构,就可能针对固定题目优化攻击;若不知道结构,则结果又很难被外界解释。外部目前无法判断五题是否覆盖信息检索、流程规划、故障排查或其他风险类型,也无法判断它们是否代表真实滥用路径。不能把“没有人公开赢得五题”自动解释成“模型不存在可利用的生物风险绕过”。
页面日期晚于申请截止,读者不能把它当成开放招募
时间线是这条新闻最容易被忽略的部分。OpenAI 页面标注7 月 9 日,但条款写明申请从4 月 23 日开始,于6 月 22 日结束。也就是说,在本期归档日看到这张页面的普通读者,按公开时间线已经不能再提交 GPT-5.5 专项申请。仍在进行的是测试阶段,截止日为7 月 27 日。
这一区别会改变新闻含义。它不是“OpenAI 现在面向所有研究者开放 25,000 美元挑战”,而更像是对一个已经完成参与者筛选、仍在执行中的私有测试计划作公开说明。OpenAI System Card 在 4 月已经写到,研究者通过申请与邀请进入,并尝试用单一越狱策略解决一组生物安全挑战。7 月页面让奖励、题数与保密条款更醒目,却没有补上参与规模或阶段性结果。
因此,4 月 23 日、6 月 22 日和7 月 27 日不是装饰性日期。它们分别对应招募开始、招募结束和测试结束。报道若只保留“7 月 9 日宣布”和“25,000 美元”,会让读者误以为申请仍开放,也会遮住更重要的问题:既然测试已经运行两个多月,OpenAI 是否获得有效提交,是否修过模型或审核链路,为什么没有给出阶段性数据?
这是公共安全赏金之外的私有专项
OpenAI 在 3 月 25 日发布的 Safety Bug Bounty 面向更广泛的 AI 滥用与安全问题,但公开说明把一般越狱排除在该公共项目范围之外。第三方提示注入、数据外泄、代理执行有害动作、账户与平台完整性等问题,可以进入公共赏金流程;针对高风险伤害类别的越狱,则由包括生物风险在内的私有专项处理。
两类项目的分界有实际意义。公开项目强调可复现、可修复、能造成具体用户伤害的产品问题。生物安全专项面对的是另一种权衡:过度公开可能扩散高风险方法,完全不公开又让外界无法检验安全声明。OpenAI 选择了申请与邀请制,再用 NDA 覆盖提示词、模型回复、发现与沟通,等于把测试细节锁进一个受控环境。
FLI 的安全指数提供了一个外部记录:它列出 GPT-5.5 项目的五道挑战、25,000 美元完整奖励、申请窗口、邀请或申请的参与方式,以及所有材料受 NDA 约束。这能说明项目不是仅存在于一张孤立网页中,却仍不是独立复现。FLI 没有拿到测试样本,也没有验证某个越狱能否通过,更没有审计 OpenAI 的判分与修复。
NDA 保护了什么,也遮住了什么
对生物风险测试而言,NDA 并非天然负面。有效通用越狱可能让未经筛选的人绕过防护,公开提示词和完整模型回复会产生现实扩散风险。邀请具备相关经验的研究者,限制测试环境,并要求先向厂商披露,是一套可以理解的风险控制方式。
问题在于保密边界是否有退出机制。OpenAI 的公开条款没有说明:风险修复后,研究者能否发布删敏后的方法;厂商应在多久内完成复现与修复;如果厂商认为提交无效,是否存在独立申诉;如果修复只是让五道固定题不再通过,是否会安排新的盲测题;公众最终能看到的是获奖数字、漏洞类别,还是只有一句“防护已加强”。
Hacker News 的讨论不能作为项目事实证据,但能说明社区最关心的阻力。讨论者质疑25,000 美元是否足以补偿跨学科研究成本,也担心 NDA 让参与者无法展示成果、让外界无法判断厂商是否公平处理有效提交。这些质疑目前没有公开数据可以消除。反过来,也不能仅凭社区不满就断定项目不会付款或没有价值;那同样缺乏证据。
真正可兼顾安全与复核的披露,不需要公开危险提示词。OpenAI可以在测试结束后公布参与者数量、有效提交比例、问题类别、判分流程、修复涉及模型还是审核器、修复后复测通过率,以及由独立专家确认过的删敏结论。这样既不扩散操作细节,也能让企业买方、政策制定者和研究界判断测试是否真的改变了防护。
早报判断是,这个计划的核心价值在于 OpenAI 尝试把一个模糊的安全目标变成可失败的接口:同一策略、干净会话、全部五题、不触发审核。25,000 美元只是吸引研究者进入这套接口的激励。只有当防护允许外部研究者以明确条件证明它失败,安全声明才开始接近工程测试,也就不再只是单向宣传。
但这套接口目前只完成了“可判定”,尚未完成“可核查”。五题、平台和参与者都由 OpenAI 控制,完整材料又受 NDA 约束。外界能确认条款,不能确认样本;能看到奖励,不能看到结果;能知道测试持续到7 月 27 日,不能知道修复是否接受过独立复测。少源和官方自报体现的是当前证据结构,不能只被视为措辞上的谨慎。
更稳妥的评价是:邀请制与 NDA 适合保护高风险细节,却不能替代公开问责。OpenAI 不必披露危险提示词,但应在测试结束后交付删敏统计、漏洞类别、处置时间线和第三方复测结论。若这些证据出现,私有赏金可以成为前沿模型安全的有效补充;若结果始终只在 NDA 内流转,外界就只能确认活动存在,无法确认安全性提高。
7 月 27 日之后,至少要回答四个问题
第一,项目到底吸引了多少合格研究者。一个同时要求模型红队能力与生物安全知识的计划,潜在参与者很少;申请与邀请制又会进一步缩小样本。参与者数量不需要暴露身份,但应让外界判断测试强度。
第二,五题之外有没有盲测与迁移测试。如果某个提交只对固定题有效,它更像测试集攻击;如果同一策略能迁移到未见问题,才更接近真正的通用越狱。OpenAI 应说明判分是否包含隐藏题、重复运行和不同会话条件。
第三,修复发生在哪一层。模型拒答、专用生物安全分类器、通用内容审核和 Codex Desktop 产品限制都可能阻止输出。只修某个提示词模式,与提高整体生物风险鲁棒性不是一回事。删敏报告至少要区分模型行为修复、审核链路修复和产品访问限制。
第四,研究者能否在安全窗口后公开成果。理想机制不是无限期保密,而是先协调披露、完成修复,再允许发布不含危险细节的方法论与结果。这样才能积累跨机构可用的红队知识,也让下一轮赏金不必从零开始。
截至 7 月 10 日,能给出的结论仍然有限:OpenAI 已公布一个面向 GPT-5.5、以五道生物安全挑战为门槛、完整奖励25,000 美元的私有赏金;申请期已结束,测试期持续至7 月 27 日;参与和成果受邀请制与 NDA 约束。项目是否发现有效越狱、是否推动实质修复、是否能给外部留下可复核证据,均待验证。