微软将首个专用网络安全模型 MAI-Cyber-1-Flash 接入漏洞挖掘系统 MDASH,并称这套组合在 CyberGym 基准测试中取得 95.95% 的成绩,高于 Anthropic、OpenAI 和谷歌的同类方案。公司同时表示,新配置的成本较其现有最佳 MDASH 方案低约 50%。
文章所述数据来自微软披露。CyberGym 是一项公开基准,要求 AI 代理在受控环境中复现 188 个开源项目中的 1507 个已知漏洞,再按成功复现比例评分。微软这次公布的结果在发稿时尚未出现在 CyberGym 公共排行榜上。
测试成绩高于多家模型
按微软披露,MDASH 这次的成绩为 95.95%,高于 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6%,以及 Gemini 3.5 Flash Cyber 的 83.2%。
微软强调,这一成绩并非单一模型独立完成,而是整套系统协同运行的结果。MAI-Cyber-1-Flash 负责最多 90% 的任务,剩余最复杂的约 10% 个案会被转交给 GPT-5.4 处理。
MDASH负责验证与复现
公司披露称,MAI-Cyber-1-Flash 是负责理解代码与推理的模型层,MDASH 则是外围执行系统,负责调度代理、调用工具、交叉检查结果、去除重复项,并验证漏洞是否真的可以被触发。
微软称,MDASH 内部使用了 100 多个专用代理,分别承担代码审计、结果辩论和概念验证构建等任务。所谓概念验证,即生成一个可运行的漏洞触发示例,用来证明缺陷确实存在。
已接入Defender私有预览
微软已通过 Defender 门户中的 Microsoft Security Exposure Management 启动 MDASH 私有预览。企业用户可以扫描 Git 代码仓库,查看按可信度排序的发现结果,并通过 Defender CLI 生成建议修复代码,供开发团队审核。
目前预览版对使用范围仍有限制,包括单个仓库规模约 256MB,以及每个租户同一时间仅允许一次并发扫描。微软还提到,Project Perception 未来将把类似的多代理方法扩展到更广泛的威胁监测和处置流程中。
补充信息:文中提到,研究人员此前已用公开模型复现类似 Claude Mythos 的漏洞挖掘流程,单次扫描成本可低至 30 美元以内,行业竞争焦点正从模型获取转向结果验证能力。












