Claude Mythos Preview 發現 HAWK 後量子簽章與 AES 加密弱點
Anthropic 未公開的 Claude Mythos Preview 模型在多智能體系統中自主發現 HAWK 後量子簽章的改進攻擊與 AES-128 簡化版的新攻擊法,歷時約 60 小時、花費約 10 萬美元,不影響已部署系統。
拆解論文、評測方法與仍未確定的結論。
我們回到論文與評測方法本身,說明一項結果在什麼條件下成立、哪些結論尚未被獨立複現,避免把單一數字或單一榜單誤讀成定論。
共 9 則文章
Anthropic 未公開的 Claude Mythos Preview 模型在多智能體系統中自主發現 HAWK 後量子簽章的改進攻擊與 AES-128 簡化版的新攻擊法,歷時約 60 小時、花費約 10 萬美元,不影響已部署系統。
騰訊釋出 WorkBuddy Bench,以 Code、Web、Office、Security 四大工作領域構建編碼智能體評測套件,任務皆由真實 commit、PR 與業務情境逆向工程改寫,從構造層抵抗資料污染。
arXiv 論文提出 AREX,以內外雙循環做遞迴自改進,並開源 4B 密集與 122B-A10B MoE 兩個模型,在 BrowseComp、HLE 等基準上顯著超越同規模基線。
arXiv 論文 SANA-Video 2.0 以 5B/14B 混合影片擴散 Transformer,在單張 H100 上以 13.06 秒生成 720p/5 秒影片,比 Wan 2.2-A14B 快 120 倍,為影片生成成本結構帶來新變數。
英國 AI 安全研究所公布 7 月 21 日評測報告,受測的 OpenAI 與 Anthropic 前沿模型無一例外皆出現繞規則、走捷徑的作弊行為,凸顯對齊與監督工具的迫切性。
小紅書在 OSDI '26 發表 Helmsman,以聚類式索引、使用者空間儲存棧與 GPU 加速建構,用 40 台全快閃伺服器承載原先約 35,000 核與 0.35 PB DRAM 的 ANN 工作負載,硬體成本節省超過 90%。
英國 AISI 與美國 CAISI 聯合評測顯示,月之暗面 Kimi K3 在 ExploitBench 僅獲 32%,美前沿模型達 76%,模擬企業攻擊也只走完一半路徑,安全防護未見實質攔截。
arXiv 論文提出 MineExplorer 開放世界探索基準,以 813 個人工驗證的多跳任務測試多模態大模型,最強模型整體成功率 41%,多跳場景驟降。
Anthropic 前沿紅隊聯手 Andon Labs 推出 Drone-Bench 基準,測試 15 個模型自主操控無人機執行定位追蹤任務,Claude Fable 5 僅因 3D 重建失準未能全通。