Microsoft发布首款网络安全模型,MDASH系统达96%
任务路由压低安全Agent成本,但96%与减半口径仍待独立复现。
本文要点
- MDASH从编排外部领先模型,变为加入Microsoft自研网络安全专用模型。
- 模型选择从统一调用,变为常规任务走小模型、异常困难任务走GPT-5.4。
- 官方成绩从5月的88.45%更新为统一系统96%,但复现实验仍未公开。
阅读辅助
先看数字、证据和来源,再读正文。
MAI-Cyber-1-Flash被设计为处理最多90%的任务,异常困难的10%交由GPT-5.4。
2025-06 · CyberGym论文与开源项目公开,以真实代码库漏洞和可执行概念验证评估安全智能体。
安全 Agent 的运行上限先由令牌账单决定。漏洞扫描不会只跑一次:代码持续变化,依赖持续更新,告警还要经过发现、验证、修复与回归。若每个环节都调用体量最大、价格最高的模型,系统可能在技术上可用,却很难按仓库、按提交长期运行。
Microsoft 在 2026 年 7 月 27 日给出的解法是任务路由。新发布的 MAI-Cyber-1-Flash 被放进多模型安全 Harness MDASH,官方称它可处理最多 90%的任务;被判断为异常困难的10%再交给 GPT-5.4。重点由“哪个单模型分数最高”转到“每一类任务该调用哪一个模型”。
公告同时给出三组结果:MDASH 与新模型组成的统一系统在 CyberGym 得到96%,比 Mythos 高12 个百分点;相对 Microsoft 当前 MDASH 最佳组合——GPT-5.4、5.4 mini 与 5.3 codex——成本节省50%。这三组数字均为 Microsoft 在自有系统中的公开口径,尚未看到第三方按相同任务快照、预算和 Harness 独立复现。
对安全团队而言,新闻价值在于一个可落地的成本架构;对采购方而言,边界同样重要。96%是统一系统成绩,50%只对应公告点名的内部基线,“最多 90%”也不是生产环境必然达到的固定比例。
路由器成为成本控制面
MDASH 的全称是多智能体漏洞识别与修复 Harness。Microsoft 称,安全专家已在其中创建100 多个智能体,分别承担发现、验证和修复等任务。MAI-Cyber-1-Flash 加入后,Harness 不只负责编排步骤,还要判断任务难度并选择模型。
这套设计可以拆成三个层面。常规任务交给 compact、code-heavy 的专用模型,以较低单次成本扩大扫描频率;少数高难任务升级到 GPT-5.4,以保留前沿模型的推理能力;最终由 MDASH 把多智能体执行、工具、验证和治理控制串起来。因而,发布的产品单位是“模型 + 数据 + Harness”的组合,而非一个可以脱离系统单独比较的模型端点。
| 维度 | Microsoft 7月27日口径 | 明确比较基准 | 当前证据边界 |
|---|---|---|---|
| 任务分配 | MAI-Cyber-1-Flash处理最多90%,GPT-5.4处理异常困难的10% | MDASH内部按难度路由 | 未披露难度分类器、阈值、误路由率 |
| 系统效果 | CyberGym 96% | 比Mythos高12个百分点 | 厂商自报的统一系统成绩,未公开逐任务结果 |
| 推理成本 | 节省50% | Microsoft现有MDASH最佳组合:GPT-5.4 + 5.4 mini + 5.3 codex | 没有绝对价格、token量、重试次数和人工成本 |
| 产品范围 | Perception已于当日发布 | 当前覆盖多类安全工作流 | 新模型用于软件漏洞之外场景仍是“将很快” |
路由带来的收益也伴随新的失效模式。若一个实际困难的漏洞被分类为常规任务,小模型的低成本会以漏报为代价;若大量普通任务被升级,50%的成本优势会快速收窄。公告没有公布路由器本身的准确率,也没有交代错误路由后是否会通过第二模型复核、动态升级或人工抽检兜底。
96%测的是系统,不是单模型
CyberGym 是由独立研究团队建设的开放网络安全评估框架。它面向真实代码库中的历史漏洞,要求智能体分析带漏洞版本并提交可执行的概念验证,而非只回答漏洞类别或生成一段解释。公开论文与仓库提供任务数据、运行环境、提交与验证机制,这让基准本身具有第三方定义和开放复现入口。
这层独立性不能自动延伸到 Microsoft 的96%。基准研究者定义赛道,与研究者复现某家厂商的最新系统提交,是两件不同的事。Microsoft 公告没有附可下载的逐任务轨迹、PoC、失败样本、总推理预算或排行榜提交记录,外部团队暂时无法从公开材料复算这个分数。
归因对象尤其容易被写错。公告原文把结果归给“MDASH with MAI-Cyber-1-Flash”的统一系统,因此96%不能简化为 MAI-Cyber-1-Flash 的单模型能力。MDASH 包含100 多个智能体,并会把高难任务路由到 GPT-5.4;最终成绩同时受任务拆分、提示词、工具、重试、验证器、升级策略和底层模型影响。
与 Mythos 的差距也应按原文保留为12 个百分点。百分点描述两个百分比的直接差,不能改写成相对提升12%。Microsoft 没有在公告中给出 Mythos 的具体运行配置、预算或失败分布,因而这组差距适合说明官方宣称的排名,不足以解释优势来自小模型、路由器还是 Harness。
还有一个历史参照。Microsoft 在 2026 年 5 月 12 日公布 MDASH 时,曾自报 CyberGym 成绩为88.45%。新公告的96%表面上高出7.55 个百分点,但两次材料没有在同一处确认任务快照、预算、模型阵容与评分规则完全一致。早报因此不把这两个数字直接写成“新模型带来 7.55 点提升”;它们只能说明公开成绩发生更新。
成本减半的分母
公告页面把产品概括为“half the cost”,正文则给出了更窄、更有用的比较对象:Microsoft 当前在 MDASH 中的最佳方案,由 GPT-5.4、5.4 mini 和 5.3 codex 组成。加入 MAI-Cyber-1-Flash 与分层路由后,官方称相对这套组合节省50%。
这个限定决定了正确表述。它不代表相对所有“领先模型”都便宜一半,也不代表客户账单一定下降一半。公开页面没有给出每个 CyberGym 任务的输入输出 token、缓存命中、工具调用次数、并发、失败重试、人工复核或基础设施成本;更没有公布 MAI-Cyber-1-Flash 的独立定价。外部买方目前只能确认比较方向和内部基线,不能重建总拥有成本。
“最多 90%由小模型处理”与“节省50%”之间也没有公开的简单换算式。高难的10%可能消耗远高于平均水平的 token 和工具时间;路由判断本身也有成本;漏洞验证往往需要编译、运行、沙箱和多轮修复。要证明成本优势能迁移到企业代码库,至少还需要按任务难度分桶披露调用量、成功率与平均复核时间。
模型、数据与Harness的三重绑定
Microsoft 将 MAI-Cyber-1-Flash 描述为 compact、code-heavy 的安全模型,源自 MAI-Thinking-1 谱系。MAI-Thinking-1 技术报告披露,祖先模型是35B 活跃参数、1T 总参数的稀疏 MoE,预训练使用30T tokens,上下文最长256K。这些数字只能解释谱系背景,不能当作 MAI-Cyber-1-Flash 的规格;新模型的参数量、上下文长度、训练 token、推理价格和开放方式均未在本次公告中列出。
数据层是 Microsoft 着墨最多的护城河。公司称其安全业务每天看到超过100 万亿条身份、终端、云和网络信号,并拥有来自160 万客户的运营洞察。以上规模来自厂商自报,外部无法核验数据去重、客户授权、训练使用范围和地域覆盖。它能说明 Microsoft 为何强调专用模型,却不能单独证明模型在未见过的企业代码库上同样有效。
Harness 层则把模型输出变成可验证动作。MDASH 运行于企业控制环境,Microsoft列出的控制包括角色权限、租户隔离、加密、审计和无互联网访问的沙箱。安全场景里,这些系统属性常比单次回答更关键:模型找到疑似漏洞后,还要生成证据、在隔离环境复现、判断可利用性并把修复送回工程流程。
MAI-Cyber-1-Flash 最值得关注的部分,是 Microsoft 把模型竞争落到了一个可计价的路由决策上。安全扫描属于高频、持续运行的工作负载,大模型能力再强,如果每次提交都承受最高档推理成本,覆盖率最终会被预算限制。让专用小模型吃下常规任务、前沿模型守住难题,是安全 Agent 走向常态化部署的一条现实路径。
这条路径的控制点也从模型转移到路由器。系统必须准确识别哪些任务可以便宜处理,哪些任务一旦降级就会漏掉高价值漏洞。Microsoft公布了“最多90%”的目标分配,却没有公布分类误差和升级机制。对安全产品而言,误路由不是普通推荐系统里的体验损失,它可能直接变成未发现的攻击面。
96%与节省50%足以证明方案值得测试,尚不足以证明方案已经普遍成立。前者混合了模型、数据、Harness和重试策略,后者只相对Microsoft现有三模型组合。更有说服力的下一步会是一份可复现的成本—质量曲线:在同一任务集上逐档调整小模型覆盖率,公开每一档的漏洞发现率、误报、token与人工复核时间。
这也改变了模型供应商进入企业安全系统的方式。单模型排行榜仍有价值,但采购方会越来越关心一个模型在多模型Harness中的边际贡献:它能接住多少任务、把多少任务安全地留给更便宜的路径、又在何种阈值下必须升级。MAI-Cyber-1-Flash的发布给出了架构答案,证据链还需要外部复现补齐。
Perception已经上线,扩展仍用将来时
同一公告还发布了 Perception。Microsoft把它描述为一组面向多种安全工作流的智能体团队,在MDASH中持续监控、修补并关闭新的威胁路径。这里的状态动词是“today we’re also launching”,因此可以写成7月27日已经发布。
紧随其后的句子使用“will also soon use MAI-Cyber-1-Flash”,对象是软件漏洞工作之外的更多安全工作流。忠实中文只能写成“将很快使用”或“计划很快扩展”。公告没有列出首批扩展场景、客户范围、预览资格或具体日期,不能改成“Perception已在更多工作流全面使用MAI-Cyber-1-Flash”。
这个区分会影响采购判断。Perception作为系统已经出现,新模型当前最明确的用途仍是软件漏洞识别与修复;更广泛的告警分诊、威胁狩猎、身份调查或云安全场景是否接入,需要等待后续产品文档。
“第三方评估”不等于第三方复现
Microsoft称MAI-Cyber-1-Flash经过其AI Red Team评估、自动与专家对抗测试,并由第三方独立评估。公告没有公布第三方名称、测试范围、报告链接、发现的问题或整改结果。当前能确认的是Microsoft做出了这项声明,无法审阅评估本身。
需要把三类证据分开:
- CyberGym论文与仓库是非Microsoft来源,能独立说明基准测什么、如何提交概念验证;
- Microsoft的96%、高出Mythos12个百分点和成本节省50%仍是厂商自报结果;
- 未具名第三方评估更可能指安全与治理审查,公告没有说明它是否复核性能、成本或路由比例。
因此,本稿将总体置信度定为 medium。发布事实、官方原话与比较基准清楚;最重要的效果数字缺少公开运行轨迹和独立复现,适用范围也尚未通过企业外部样本验证。
企业试点该记录哪些数
希望验证这套架构的团队,可以先把“模型替换”改写为“路由实验”。在相同仓库与漏洞集上记录小模型覆盖率、升级率、漏报、误报、单任务token、工具运行时和人工复核时间,再逐步提高小模型承担比例。只有质量曲线与成本曲线同时可见,最多90%才会从宣传数字变成工程参数。
复现96%需要锁定CyberGym任务快照、网络策略、工具权限、重试次数、成功判据和总预算。若只有最终百分比,不同Harness之间的比较很容易把多次尝试、额外验证器或更高推理预算误当成模型能力。
采购侧还应要求Microsoft补充三类材料:MAI-Cyber-1-Flash自身的模型卡与技术报告;50%成本实验的绝对账单和任务分布;未具名第三方评估的范围与结论。Perception的扩展则等待正式产品文档,尤其要确认哪些工作流已经接入、哪些仍在路线图上。