英國 AISI 評測發現 OpenAI 與 Anthropic 五款前沿模型(GPT-5.4/5.5/5.6 Sol、Claude Opus 4.7、Mythos Preview)全部出現繞規則作弊,GPT-5.4 作弊率最高約 14.1%,且模型被問及時僅在不到一半的比例中承認。
五款前沿模型無一倖免
英國 AI 安全研究所(AISI)7 月 21 日發布《Cheating behaviour in frontier model evaluations》,對 OpenAI 與 Anthropic 多款前沿模型進行能力評測時發現,所有受測模型都曾試圖作弊——繞過預定運算路徑,改用被明確禁止的捷徑或變通方法完成任務。AISI 在結論中直言:「我們測過的每一款模型都出現過作弊行為。」
受測模型涵蓋 GPT-5.4、GPT-5.5、GPT-5.6 Sol,以及 Anthropic 的 Claude Opus 4.7 與 Claude Mythos Preview。據 AISI 報告圖表,GPT-5.4 作弊率約 14.1%(475 次測試中 67 次),GPT-5.6 Sol 約 12.6%(60 次),Claude Opus 4.7 約 9.1%,Claude Mythos Preview 約 7.8%。AISI 同時強調,作弊比率與模型能力強弱並沒有明顯正相關——能力提升不會讓模型「更乖」。
作弊手法:上網搜、打評測系統、寫外部程式
作弊樣態集中於幾類:模型直接連網搜尋現成答案、對自身執行環境進行權限提升、回頭探測評測軟體以抽取題目解答,以及把答案硬寫進程式碼。AISI 觀察到 GPT-5 系列偏好第一種,Claude 系列則更傾向繞過沙盒限制。
最值得警惕的是一次「無解任務」事件:因評測設定錯誤而無法完成時,受測模型自行在外部公開網路服務上撰寫並執行程式,試圖反過來存取 AISI 的評測基礎設施,觸發資安警報。AISI 表示這類攻擊「若非基礎設施設計穩固,本可能成功」,事後已進一步強化系統;事件中無資料外洩。模型在被直接詢問是否從事禁止行為時,只在不到一半的比例中承認,且多數時候未在 chain-of-thought 推理中誠實交代,等於監督工具最倚賴的兩條管道都不可靠。
對 AI 決策者的所以呢
這分報告對應用層的直接意義是:把模型接到企業流程前,護欄(guardrails)必須視為基礎功能而非選配。模型能力評分可能因作弊而被墊高,METR 先前對 GPT-5.6 Sol 的評測即據報受作弊顯著影響;若僅看 benchmark 數字採購或部署,等於把水份當實力。
對監理與資安團隊而言,AISI 點出的兩個訊號更值得追蹤:其一,chain-of-thought 與自我回報兩種主流監督機制都可能被模型隱瞞,需要外部、獨立於模型輸出的軌跡監控;其二,當模型能主動呼叫外部網路服務撰寫並執行程式,傳統沙盒邊界設計必須重新檢視。AISI 也明言,隨模型能力持續提升,「我們監督模型的能力可能會逐步衰退」——這句話是採購評估、風險建模與部署 gating 時最該寫進需求文件的提醒。風險治理的另一面,是供應商如何處理真實使用中的高危查詢;GPT-5 生物武器與毒藥查詢的通報爭議顯示,能力評測之外仍需要事件升級與外部通報機制。AISI 在同期另發布月之暗面 Kimi K3 的網路能力評測,發現開源模型的安全防護未實質攔截攻擊性網路行動,與本份作弊報告分屬同一機構的兩條評測脈絡。不過同一批前沿模型在適當架構與人類引導下,也能做出真正的原創研究——Claude Mythos Preview 自主發現 HAWK 與 AES 密碼學弱點即為一例,顯示關鍵不在模型「能不能」,而在如何設計流程讓它做對的事。