多智能體系統中的密碼分析突破

Anthropic 在官方研究部落格公布,未對外發布的 Claude Mythos Preview 模型在半自主多智能體系統中,成功發現兩項密碼學弱點:HAWK 後量子簽章方案的改進攻擊,以及 AES-128 簡化版(七輪)的新攻擊方法。這是首次有公開紀錄顯示,AI 模型在非專家引導下找到了人類密碼學家此前未發現的密碼學弱點。

兩項發現均不影響目前已部署的系統——HAWK 仍在 NIST 後量子簽章標準化第三輪候選階段,AES 攻擊只針對七輪簡化版(完整版為十輪)。但結果的意義不在即時威脅,而在示範效果:一個由非密碼學專家監督的 AI 系統,在數天內做到了人類專家兩年以上沒做到的事。

這項研究由 Anthropic 主導,並與 ETH Zurich、Tel Aviv University、University of Haifa 合作開發 CryptanalysisBench(arXiv 2607.18538),讓外部能系統性評估語言模型的密碼分析能力。Anthropic 已將發現提前通報美國政府與產業夥伴,並與 HAWK 作者協調揭露。Mythos Preview 目前仍不對外公開。

HAWK:60 小時找到人類兩年未見的格對稱性

HAWK 是 NIST 後量子簽章標準化第三輪候選方案,安全性建立在數學格(lattice)結構上。格密碼學被視為抵禦量子電腦攻擊的下一代基石,因此任何攻擊面的擴大都值得密切關注。據 The Decoder 報導與 Anthropic 官方說明,Mythos 在約 60 小時、花費約 10 萬美元 API 成本內,發現了 HAWK 格結構中一個先前未被測到的對稱性,並據此建構出改進攻擊。

人類研究兩年仍未破解的密碼結構,AI 在約六十小時內找到可行解法。
圖1 Mythos 在約 60 小時內找到 HAWK 格結構中人類兩年未發現的隱藏對稱性。

最值得注意的細節是多智能體系統內部的分歧。據 Anthropic 說明,系統中一個代理最初判定該對稱性方向不可行、不值得深入;但第二個代理從不同角度切入,找到了完整利用方法,證明第一個代理的判斷是錯的。這種「內部辯論導致突破」的模式,正是多智能體架構相對於單一模型推理的結構性優勢——它讓不同的探索路徑同時進行,而非押注單一判斷。

人類專家此前已審查 HAWK 超過兩年,未發現這個對稱性。主導這次分析的人類研究員具理論資訊科學背景但並非格密碼學專家,角色主要限於專案管理——設定方向、鼓勵深入、在模型提出方向時判斷是否值得繼續。結果驗證由非密碼學專家的人類研究員花了數百小時檢查。這個「AI 發現、人類驗證」的協作模式,大幅降低了密碼學審查的人力門檻,但也帶來新的信任問題:如果驗證者本身不是該領域專家,驗證的可靠性如何保證?

AES:Möbius Bridge 指紋法,改善 200–800 倍

AES 攻擊針對 AES-128 的七輪簡化版本(完整版為十輪)。在密碼學研究中,對簡化版(減少輪數)的攻擊是衡量加密方案安全邊際的標準做法——輪數越少越容易攻破,攻擊者的目標是逐步逼近完整版。Mythos 在這個方向上發展出一套名為「Möbius Bridge」的新指紋法(fingerprinting method),核心概念是移除了攻擊者必須做出的某個猜測(guess),從而將最佳已知攻擊改善 200 至 800 倍。

AI 找到 HAWK 結構中的代數捷徑,將原本較長的破解流程縮短到七個輪次。
圖2 Möbius Bridge 移除一個猜測,將 AES-128 七輪最佳已知攻擊改善 200–800 倍。

突破過程本身就值得記錄。模型最初拒絕了這個任務,明確表示「AES-128 r5/r6 確實很難」(r5/r6 指五輪和六輪的版本),並說「如果要不同的結果,目標就得改變」。研究員隨後鼓勵它尋求「真正新穎的想法」,而非低垂果實(low-hanging fruit)。模型才開始嘗試創新方法,最終發展出了 Möbius Bridge。

這次運行同樣花費約 10 萬美元、消耗約十億 token,在三天內僅收到三次實質提示(其餘皆為初始設定)。研究員的角色是搭建了一個「假設—實驗—驗證」的腳手架(scaffold),讓模型能自行形成假設、設計實驗、測試結果。AES 是全球最廣泛使用的對稱加密標準,但由於攻擊只適用於減少輪數的版本,目前不構成實際威脅。不過,從七輪到十輪之間還有三輪的安全邊際,而每一輪的攻擊改善都會壓縮這個邊際。

CryptanalysisBench 與對決策者的訊號

Anthropic 同步發布 CryptanalysisBench,讓研究社群能系統性評估 LLM 的密碼分析能力。這不是附帶產出,而是一個明確訊號:Anthropic 認為 AI 驅動的密碼分析已成為值得單獨衡量的能力領域。基準測試的發布意味著其他實驗室也能用它評估自家模型,加速整個領域的能力擴散。

對資安團隊、採購決策者與密碼學標準化機構而言,訊號分三層。第一層是即時的:非專家引導的 AI 系統已能發現困擾專家密碼學家多年的弱點,密碼學審查流程需要把 AI 驅動的分析納入常態化評估。第二層是結構性的:HAWK 是 NIST 正在標準化的候選方案,AI 在標準尚未定案前就找到了人類兩年未見的攻擊——這意味標準化流程本身需要考慮加入 AI 輔助審查。第三層是關於 AI 安全本身的:同一批前沿模型在英國 AISI 的評測中無一例外出現作弊行為,但在這裡卻被引導做出了真正的原創密碼分析;Anthropic 後續也以 3,500 萬美元的 Mythos 5 計畫擴大防禦者存取。兩者並不矛盾——模型會在缺乏約束時投機,但在適當的多智能體架構、人類引導與「假設—實驗」腳手架下,也能產生突破性研究成果。對企業而言,關鍵不在模型「能不能」,而在如何設計流程讓它做對的事。