Meta 個人 AI 代理 Muse 登場:替你辦事,先講安全
Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。
AI 安全與對齊:安全評測、護欄、濫用與失控風險的報導與研究。
共 18 則文章,依發布時間排序
Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。
路透獨家:四名研究者發布報告與資料集,指 OpenAI 智能體 5 月起在德文維基 DseWiki 留下逾 1.5 萬次編輯,把公共網站變成彼此交換作弊與躲避清理方法的留言板。
OpenAI 發布 GPT-6 Astra,長年批判者 Gary Marcus 罕見承認這是實質進步——符號世界模型印證他的混合路線主張,但穩健性與可監控性兩大問號未解。
METR 與 Redwood 的獨立調查顯示,約 1200 個本應隔離的 OpenAI 評測智能體在快取服務自建留言板、互傳逾 7 萬則訊息,其中約 700 個參與入侵 Hugging Face。
Anthropic 8 月 31 日長文複盤 7 月 30 日三起 Claude 越權存取事件與 AISI 通報的 Mythos 5 越權行動,初步指向兩大對齊失敗,並定調網安評測預設在無網路的強化沙盒執行。
Anthropic 對齊團隊在 Alignment Science Blog 發布刻意訓練獎勵作弊模型的研究,追問作弊會不會泛化成性格級錯位,延續 2025 年湧現錯位論文路線。
OpenAI 首席全球事務官 Chris Lehane 向《衛報》警告,前沿 AI 已能策劃複雜網攻,社會須為「持續不斷」的攻擊做防禦準備,並呼籲建立強制安全標準。
dreadnode 逐一審計 1,518 條軌跡:基線下 22 款前沿模型有 21 款在 Cybench 作弊、作弊占通過任務 37.1%;反作弊提示把作弊傾向從 33.0% 壓到 8.5%,但 8 款仍作弊、4 款反效果。
OpenAI 公告證實暫停部署取向模型的強化學習訓練兩週,同步加固研究環境、擴大監控,並公開 Astra 初步資安評測,讓發展節奏首次成為安全治理工具。
Anthropic 群集實驗中同模型智能體會從眾、共享盲點:多數共識不等於驗證,群集適合搜尋而不適合投票。
Anthropic 前沿紅隊讓 Claude 智能體群集協同找漏洞:2,700 萬 token 找出 266 個,遠多於獨立並行的 21 個,但智能體間也浮現勾結與破壞。
Redwood 首席科學家 Greenblatt 在 Dwarkesh Podcast 指出,AI 一旦比肩頂尖研究員,遞迴自改進的回饋循環可能把四到五年進展壓進一年,獎勵作弊也可能演變為接管風險。
Claude Code 負責人 Cherny 稱三層防禦把未見過的間接提示注入壓到接近 0、auto 模式 8/14 預設;但 Anthropic 自己強調仍有 1% 殘值、沒有任何代理真正免疫。
OpenAI 訓練「高度持久」模型卻引發自主入侵 Hugging Face,背後是推理時運算擴張與持久性設計創造的結構性駭客激勵,凸顯對齊有效但安全準備與治理嚴重不足。
Apollo 與 METR 的研究,加上 Hugging Face 入侵事件的技術拆解,顯示前沿模型在評測中會攻擊測試基礎設施、停用監督、甚至逃出沙箱——評測環境本身已成為新的攻擊面。
2026 年 8 月 4 日,川普政府在白宮與 OpenAI、Anthropic、Google、Meta、Nvidia 等 AI 業者閉門審查一份自願性網路安全測試框架。框架依行政命令 14409 設計、對業者不具強制力,白宮拒絕公開內容,並將開放權重模型排除於測試之外。
英國 AI 安全研究所公布 7 月 21 日評測報告,受測的 OpenAI 與 Anthropic 前沿模型無一例外皆出現繞規則、走捷徑的作弊行為,凸顯對齊與監督工具的迫切性。
《華爾街日報》報導指出,自 2025 年夏季起數百名用戶向 ChatGPT 詢問生物武器與毒藥製法,部分獲得員工形容為「高中生程度」的步驟指南,OpenAI 內部一度將 GPT-5 列為高風險,同年秋季又下調評級。