Microsoft MDASH 在 CyberGym 取得 95.95% 分數,超越 Claude Mythos 與 GPT-5.6 Sol

Microsoft 於 7 月 27 日發布其首個專用資安模型 MAI-Cyber-1-Flash,並將其整合進 MDASH,這是一套漏洞狩獵系統,於 CyberGym 基準測試中取得 95.95% 的成績。該公司表示,這種配置超越 Anthropic 的 Mythos 5 與 OpenAI 的 GPT-5.6 Sol,同時成本比微軟目前表現最佳的 MDASH 設定低 50%。CyberGym 是一項基準,要求 AI 代理在受控環境中重現 188 個開源專案中的 1,507 個已知漏洞,並以成功重現的比例進行評分。Microsoft 執行長 Satya Nadella 表示,這套整合系統以一半成本提供世界級效能,這是首次有聚焦效率的 Microsoft 模型擊敗為通用能力打造、密集型的最先進模型。

MDASH 在 CyberGym 基準測試上超越競爭模型

根據該公司說法,Microsoft 的 MDASH 系統在 CyberGym 上得分為 95.95%。此結果使其領先 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6%,以及 Gemini 3.5 Flash Cyber 的 83.2%。該結果由 Microsoft 自行申報,且在發布時尚未出現在 CyberGym 的公開排行榜上;不過該基準使用公開測試集,並採用明確的成功指標。該分數相較 GPT-5.5 Cyber 約高出 10 分,且比 MDASH 先前的結果高出 7.5 分。

MAI-Cyber-1-Flash 以 GPT-5.4 備援處理 90% 工作量

MAI-Cyber-1-Flash 並非單獨運作。Microsoft 表示其可處理多達 90% 的任務,而 MDASH 會將最困難的 10% 轉交給 GPT-5.4。該模型用於推理程式碼的 AI,而 MDASH 則是支架:包含代理、工具、檢查,以及決定要在哪裡尋找的工作流程;用來挑戰疑似發現、移除重複項目,並證明可以觸發漏洞。MDASH 使用超過 100 個專用代理來審計程式碼、辯論某項發現是否真實,並建立概念驗證以證明漏洞確實存在。

Microsoft MDASH system architecture

Microsoft 透過 Defender Portal 開放私有預覽

Microsoft 正透過 Defender portal 裡的 Microsoft Security Exposure Management,將 MDASH 放入私有預覽。客戶可以掃描 Git 程式庫,查看從不太可能到已證實的排序結果,並使用 Defender CLI 為開發者審查產出建議的程式碼修正。預覽目前將程式庫限制在約 256MB,且允許每個租戶同時進行一次掃描。Project Perception 預期將同樣的多代理做法擴展到不僅限於程式碼掃描,還包括更廣泛的威脅監控與修復工作流程。

FAQ

Microsoft 的 MDASH 在 CyberGym 得了多少分?
Microsoft 表示其 MDASH 在 CyberGym 上取得 95.95%,這項基準要求 AI 代理在 188 個開源專案中重現 1,507 個已知漏洞。

MAI-Cyber-1-Flash 如何分配其工作量?
Microsoft 表示 MAI-Cyber-1-Flash 可處理多達 90% 的任務,而 MDASH 會將最困難的 10% 轉交給 GPT-5.4。該系統使用超過 100 個專用代理來審計程式碼並驗證發現結果。

MDASH 私有預覽有哪些限制?
透過 Defender portal 中的 Microsoft Security Exposure Management,該預覽目前將程式庫限制在約 256MB,並允許每個租戶同時進行一次掃描。

免責聲明:本頁面資訊可能來自第三方來源,僅供參考,不代表 Gate 的立場或觀點,亦不構成任何財務、投資或法律建議。虛擬資產交易具有高風險,請勿僅依賴本頁資訊作出決策。詳情請參閱 免責聲明
回覆
0/400
暫無回覆