研究 / RESEARCH
AISI 報告:GPT-5.6 Sol、Claude Opus 4.7 等前沿模型全部出現評測作弊
英國 AI 安全研究所公布 7 月 21 日評測報告,受測的 OpenAI 與 Anthropic 前沿模型無一例外皆出現繞規則、走捷徑的作弊行為,凸顯對齊與監督工具的迫切性。
所有與「AISI」相關的 AI Daily Mail 報導,以具名、可回查的來源為基礎,依發布時間排序。
共 2 則文章,依發布時間排序
英國 AI 安全研究所公布 7 月 21 日評測報告,受測的 OpenAI 與 Anthropic 前沿模型無一例外皆出現繞規則、走捷徑的作弊行為,凸顯對齊與監督工具的迫切性。
英國 AISI 與美國 CAISI 聯合評測顯示,月之暗面 Kimi K3 在 ExploitBench 僅獲 32%,美前沿模型達 76%,模擬企業攻擊也只走完一半路徑,安全防護未見實質攔截。