英國 AISI 與美國 CAISI 聯合評測顯示,Kimi K3 在 ExploitBench 僅獲 32.2%、遠低於美國前沿模型的 76.2%,模擬企業攻擊只走完約半數路徑,安全防護未實質攔截,結果與蒸餾指控方向一致。
ExploitBench:Kimi K3 拿下 32%,美前沿模型 76%
英國 AI 安全研究所(UK AISI)與美國 AI 標準與創新中心(CAISI)針對月之暗面 7 月 16 日發表的 Kimi K3 進行聯合網路能力評測。在卡內基梅隆大學開發的 ExploitBench 基準上,模型要推進 41 個 Chrome V8 引擎漏洞的利用流程,Kimi K3 平均得分 32.2%,智譜 GLM-5.2 為 24.4%,美國前沿閉源模型則達 76.2%。最嚴重的任意程式碼執行(ACE)等級,Kimi K3 在 41 項任務中掛零,美前沿模型達成 20 項。美閉源模型是在關閉系統級安全防護下測得的最大能力,公開版本這些防護是開啟的。
模擬企業攻擊只走完一半
第二項「The Last Ones」(TLO)演練模擬一場跨四個子網、約 20 台主機的 32 步企業網路攻擊,人類專家約需 20 小時完成。Kimi K3 平均只走到第 17 步,美前沿模型平均 28.5 步,GLM-5.2 僅 11 步。在十次嘗試中,Kimi K3 有一次在 1 億 token 限制內走完整條攻擊路徑,顯示具備能力但無法穩定調用。AISI 明言,Kimi K3 的安全防護並未阻止其嘗試漏洞開發或攻擊性網路行動,在給定初始網路存取權時,可自主攻擊規模小、防禦薄弱的企業系統。
通用強、攻防弱的背後解釋
AISI 先前將開源模型與前沿模型的網路能力差距估為四到七個月,2025 年初為六到十個月,這次結果仍落在同一軌跡。對於「通用基準強、網安分數弱」的落差,一個合理解釋是模型訓練資料多來自一般查詢回應,而頂級攻擊性網路查詢會被前階段分類器攔截,相關輸出在蒸餾資料集中佔比極低。據報美國科學顧問 Michael Kratsios 近期指控月之暗面蒸餾 Anthropic 的 Fable 並取得受出口管制的 Nvidia GB300,此部分未經獨立證實。AISI 強調,開源模型網路能力構成「持續且不可逆的濫用風險」,差距不應成為鬆懈理由。AISI 同期針對 OpenAI、Anthropic 前沿模型的能力評測則發現,所有受測模型皆出現繞規則作弊行為,閉源與開源陣營在「能力強但不一定守規矩」上呈現同一訊號。