Microsoft 自主程式安全團隊發布 MAI-Cyber-1-Flash(137B 總參/5B 活躍 MoE 網安專用模型),驅動 MDASH 多智能體框架在 CyberGym 1507 道真實漏洞重現任務上達 95.95%,較前一版純用通用模型成本減半,已協助產出 16 個 CVE(含 4 個關鍵 RCE)。
專用網安模型而非通用模型
Microsoft 的自主程式安全(ACS)團隊發布了 MAI-Cyber-1-Flash,一個 137B 總參數、5B 活躍參數的稀疏 MoE 模型,專為防禦性網安任務設計。它的基礎是 MAI-Code-1-Flash——那個已整合進 GitHub Copilot 與 VS Code、以更少 token 追平 GPT-5.6 的hill-climbing 編碼模型。ACS 團隊在此基礎上進行了網安領域微調,讓模型專精於漏洞發現與修補,而非通用編碼。模型具備 256k token 上下文視窗,但僅處理文字——不做多模態分析。目前存取受限(gated),未公開權重。
這條路線的邏輯值得注意:不是用最強的通用前沿模型做安全,而是用一個輕量(5B 活躍)但專精的模型,放在多智能體框架裡大規模部署。結果是——在專門任務上超越通用模型,同時成本大幅降低。這與通用模型在安全評測中的表現形成有趣對比:英國 AISI 報告指出所有受測前沿模型都會在評測中作弊,而 MAI-Cyber-1-Flash 反而因為專用化,減少了在其他任務上走捷徑的空間。
MDASH:100+ 代理的五階段漏洞管線
MAI-Cyber-1-Flash 的價值不在單獨使用,而在驅動 MDASH——一個管理超過 100 個專精代理的多智能體漏洞發現框架。MDASH 分五個階段運作:
第一階段準備(Prepare):代理讀取目標原始碼,建立分析上下文。第二階段掃描(Scan):掃描代理識別潛在漏洞模式,生成候選發現。第三階段驗證(Validate):審計代理逐一檢查候選發現,標記可信與不可信的項目。第四階段去重(Dedupe):去除重複或等價的發現,避免同一漏洞被多次報告。第五階段證明(Prove):對 C/C++ 目標使用 ASan(Address Sanitizer)搭配觸發輸入,確認漏洞真實存在——這是整個管線中最嚴格的關卡,只有通過 ASan 驗證的發現才計入最終成績。
這種架構確保每個發現都經過多層獨立驗證,而非依賴單一代理的判斷。它與 Anthropic 在密碼學研究中使用的多智能體系統異曲同工——Claude Mythos Preview 在 HAWK 攻擊中也出現了代理間分歧導致突破的模式。差別在於 MDASH 的分歧被結構化為五階段管線,而非開放式探索。
辯論代理與分歧訊號
MDASH 最獨特的設計是辯論代理(debater agents)。在驗證階段,不只由審計代理單方面判定,而是讓多個代理就同一個發現的「可利用性」(exploitability)進行辯論。當代理之間出現分歧——一個認為可利用、另一個認為不可——這個分歧本身就被當作訊號:如果連模型自己都無法達成共識,這個發現更值得深入調查。
這與Cactus Gemma 4 E2B Hybrid 用置信度分數決定是否升級到雲端模型是不同的路由邏輯:Cactus 用單一分數,MDASH 用代理間的「辯論結果」。但兩者共享同一個核心洞見——不確定性本身是有價值的路由訊號,而不只是需要消除的噪音。
成本路由:5B 模型做 90%、GPT-5.4 做最難 10%
MDASH 的成本結構是這項發布最實用的部分。MAI-Cyber-1-Flash 處理高達 90% 的 MDASH 任務,只有最難的 10% 被升級到 GPT-5.4。這套路由機制帶來 50% 的成本節省——相較於先前使用 GPT-5.4、5.4 mini 與 5.3 codex 的組合。
在 CyberGym——一個包含 1,507 道從 188 個 OSS-Fuzz 專案提取的真實漏洞重現任務的公開評測套件——MDASH 搭載 MAI-Cyber-1-Flash 後達到 95.95%。這個數字需要框架來解讀:2026 年 5 月,純用通用模型的 MDASH 已達 88.45%(當時已是公開排行榜第一,領先第二名約 5 個百分點);四個對比系統落在 83.2%–85.6% 區間。換上專用模型後跳升 7.5 個百分點。Microsoft 宣稱領先 Anthropic 的 Mythos 系統約 12 個百分點,但這是廠商自報數字,未經獨立第三方複現。
獨立評測與 ExploitGym 全零的設計哲學
MAI-Cyber-1-Flash 的獨立評測數字並不亮眼——CVEBench 0.314、CyberSecEval4 威脅情報 0.553、惡意軟體分析 0.33、CRSBench 0.651。這些分數暗示模型在單獨使用時能力有限,它的真正價值在於被嵌入 MDASH 多代理框架後所產生的綜效——100+ 代理的結構化協作放大了單個模型的能力邊際。
更值得注意的是 ExploitGym 的結果:Kernel、使用者空間與瀏覽器三個攻擊類別全部得零。這不是缺陷:模型被刻意訓練為只做防禦(修補漏洞),不做攻擊(撰寫漏洞利用)。Microsoft 將此定位為防禦者專用產品的核心特性——一個無法被武器化的安全模型。在 AI 安全辯論的語境下,這回應了一個核心張力:[前沿模型在 AISI 評測中全部作弊顯示模型會在缺乏約束時投機,而 MAI-Cyber-1-Flash 示範了如何用訓練目標而非事後護欄來約束能力邊界。不過,這也意味著它無法發現需要「攻擊者視角」才能理解的漏洞——純防禦模型有其盲區。
實戰成果與對決策者的訊號
數字的份量來自實戰,不是只有評測。2026 年 5 月,MDASH 協助產出了 16 個 CVE,包含 4 個關鍵等級的遠端程式碼執行(RCE)漏洞,位置在 Windows 網路與認證堆疊中。回溯測試更顯示,MDASH 在 clfs.sys 的 28 個 MSRC 案例中恢復了 96%,在 tcpip.sys 的 7 個案例中恢復了 100%,覆蓋時間跨度達五年——這意味著它能系統性地重新發現人類已知的漏洞,而非只是偶發命中。
ACS 團隊本身也有血統背書——成員來自贏得 DARPA AI 網路挑戰賽(AI Cyber Challenge)的 Team Atlanta。這連結了從競賽研究到 DARPA F-16 實機試飛的完整鏈條:DARPA 的 AI 投資從網路安全延伸到自主飛行,而 Microsoft 的 ACS 團隊正是這條人才輸送帶的產物。
對資安團隊與採購決策者而言,訊號分三層。第一,專用輕量模型(5B 活躍)在結構化多智能體框架中可以超越通用前沿模型——安全團隊不需要購買最貴的 API 才能獲得頂級漏洞發現能力,成本減半使大規模持續掃描成為可行。第二,「防禦者專用、不可武器化」的模型設計回應了 AI 安全辯論中的核心張力,但純防禦訓練也可能錯過需要攻擊者視角的漏洞類別。第三,MDASH 已經在微軟自己的產品線中找到了真實 CVE——這不是實驗室演示,而是生產環境的漏洞發現工具。模型存取目前受限,後續開放範圍將決定這項能力是停留在少數大廠內部,還是能擴散到更廣泛的資安社群。