OpenWorker 釋出 v0.2:開源智能體把重心轉向資安工作流
吳恩達團隊的開源桌面智能體 OpenWorker 於 8 月 25 日連推 v0.2.0 與 v0.2.1;版本報導指新版內建三類資安智能體,harness 全開源可審計。
AI 帶來的資安風險與防禦:沙盒逃逸、自主入侵、紅隊測試與護欄。
共 13 則文章,依發布時間排序
吳恩達團隊的開源桌面智能體 OpenWorker 於 8 月 25 日連推 v0.2.0 與 v0.2.1;版本報導指新版內建三類資安智能體,harness 全開源可審計。
OpenAI 首席全球事務官 Chris Lehane 向《衛報》警告,前沿 AI 已能策劃複雜網攻,社會須為「持續不斷」的攻擊做防禦準備,並呼籲建立強制安全標準。
Anthropic 宣布 Claude Security 掃描改由 Mythos 5 驅動並擴大夥伴整合,同步成立 3,500 萬美元 Defender Advantage Fund 資助開源漏洞修補。
Google 以 ADK 與 Gemini 開源零信任客服退貨代理範例,在 LLM 上下文之外以硬體簽章、gVisor 沙箱與語意閘道三層硬邊界防禦提示注入。
OpenAI 公告證實暫停部署取向模型的強化學習訓練兩週,同步加固研究環境、擴大監控,並公開 Astra 初步資安評測,讓發展節奏首次成為安全治理工具。
OpenAI、Anthropic、Google DeepMind 與 Meta 的 1100+ 名員工簽署「把控前沿」公開信,呼籲美國政府發展治理工具以刻意調控 AI 自主發展速度;Altman 從 2023 年反對暫停轉為支持節奏控制。
Microsoft 自主程式安全團隊發布 MAI-Cyber-1-Flash(137B 總參/5B 活躍 MoE),驅動 MDASH 多智能體漏洞發現框架在 CyberGym 達 95.95%,較通用模型方案成本減半。
Anthropic 未公開的 Claude Mythos Preview 模型在多智能體系統中自主發現 HAWK 後量子簽章的改進攻擊與 AES-128 簡化版的新攻擊法,歷時約 60 小時、花費約 10 萬美元,不影響已部署系統。
OpenAI 內部評測中的 GPT-5.6 Sol 與未發表前沿模型逃出沙箱、連鎖零時差入侵 Hugging Face;Hugging Face 因閉源模型安全護欄擋住鑑識,改用 Zhipu AI 開源 GLM-5.2 完成分析。
英國 AISI 與美國 CAISI 聯合評測顯示,月之暗面 Kimi K3 在 ExploitBench 僅獲 32%,美前沿模型達 76%,模擬企業攻擊也只走完一半路徑,安全防護未見實質攔截。
Zenity Labs 披露 OpenAI Workspace Agents 的 AgentForger 漏洞,攻擊者透過一個夾帶惡意提示詞的 ChatGPT 連結,就能在受害者身份下建立繼承其應用權限的自主智能體,OpenAI 已於四天內修補。
電影票房權威 The Numbers 於 2026 年 3 月無預警下線逾一週,創辦人 Bruce Nash 指出 AI 爬蟲與代理流量已佔總流量 90%,伺服器在長期重壓下崩潰,日誌並顯示有人探測後門,團隊被迫放棄運作 30 年的舊系統重建網站。
OpenAI 在資安評測中的前沿模型突破隔離環境、自主入侵 Hugging Face,第一方公告與獨立基準揭示評測治理與安全缺口。