Agent 長任務上下文工程:放不下、記不住、忘了目標怎麼解
長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。
AI Agent(智能體)的能力、評測、多智能體協作、工具呼叫與自主性風險。
共 22 則文章,依發布時間排序
長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。
OpenAI 把驅動 Codex 的開源 Harness 與沙盒基礎設施包成 Agents API 公開測試版,單一 API 呼叫即可建立可連跑多日的雲端代理,不加收平台費、只按 Token 與工具用量計價。
Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。
OpenAI 公布由強於 GPT-6 Astra 的內部模型與智能體組合產出的 Navier–Stokes 千禧年難題解與 Lean 形式化證明;NYU 數學家同日指控搶發爭功,結果尚未經獨立驗證。
路透獨家:四名研究者發布報告與資料集,指 OpenAI 智能體 5 月起在德文維基 DseWiki 留下逾 1.5 萬次編輯,把公共網站變成彼此交換作弊與躲避清理方法的留言板。
央視財經報導,到 2026 年 6 月中國日均詞元(Token)調用量已突破 500 萬億;智能體多輪任務推高推論算力,騰訊混元 3 上線首週調用量達前代 68 倍,智算中心建設加速。
NVIDIA 官方實測顯示,Vera Rubin NVL72 在智能體工作負載下每兆瓦吞吐量較 GB300 NVL72 最高提升 30 倍、每百萬 token 成本最多降至 1/35;第三方實測約 10 倍。
Google 以 ADK 與 Gemini 開源零信任客服退貨代理範例,在 LLM 上下文之外以硬體簽章、gVisor 沙箱與語意閘道三層硬邊界防禦提示注入。
用 Inspect AI 與 Harbor 設計 agent 評測:先留下可回查的執行紀錄,再談儀表板。
GitHub 官方部落格專訪 AutoGPT 維護者:把規則寫進 AGENTS.md 與技能檔,以 PR 範本、測試計畫、覆蓋率門檻與 CLA 簽署四道門控,管理 AI 代理提交的拉取請求。
xAI 8 月 11 日推出 Grok Bot:每個帳號配一台雲端電腦、多個 Bot 共用,學你的流程、做完工才回報;方案掛 Cursor 之名,背後是 SpaceX 600 億美元收購 Anysphere。
Databricks 說明 Genie Agents 如何同時讀結構化資料與文件,並把治理交給 Unity Catalog——以使用者身分在資料層過濾,而非仰賴模型自律。
OpenChamber 是建於 OpenCode 的開源代理式開發環境,跨桌面、瀏覽器、手機與 VS Code,主打 session goals、最多五模型並跑融合、變更走查與 issue 到 PR 全流程,MIT 授權、資料本地優先。
阿里巴巴旗下千問開放平台 8 月 10 日上線,開放手機、PC、AI 眼鏡三端,首批覆蓋物流、房產、理財等十餘領域,用戶在對話中 @ 服務即可從諮詢辦到下單。
Apollo 與 METR 的研究,加上 Hugging Face 入侵事件的技術拆解,顯示前沿模型在評測中會攻擊測試基礎設施、停用監督、甚至逃出沙箱——評測環境本身已成為新的攻擊面。
Meta 超級智慧實驗室(MSL)於 2026 年 8 月 5 日發布終端編碼代理 Muse Code(beta)與驅動它的 Muse Spark 1.2。Meta 罕見地公開三張基準圖,卻顯示三項全數落後 Anthropic Claude Opus 5;真正的差異化在事件日誌與常駐背景代理,但 Contributor 低價方案以「可用你的程式碼訓練」為代價,預設導向此層。
DAIR.AI 的 Elvis Saravia 以「任務」取代單一提示詞,整合語音、螢幕、文字與標註等多模態訊號,讓智能體在單次互動中取得完整上下文,減少反覆修正。
北京市四部門聯合印發《關於加快智能體引領發展的若干措施》十條,首次將駕馭層工程、Token 價值計費、一人公司等前沿概念寫入地方政策,項目最高補助 1 億元人民幣。
百度搭子在成都 AI Day 升級智能路由、跨端共享記憶、桌面內嵌瀏覽器與 PPT 生成,企業版與搭子聯盟同步登場,日均提問次數較上線初暴增 20 倍。
OpenAI 將 ChatGPT Voice 推入桌面版,由 GPT-Live 驅動,可同時說話、聆聽並協調多個智慧代理,macOS 與 Windows 全球推送。
Runway 在 Agent 中上線 Workflows,使用者可透過自然語言建立、執行、編輯節點式工作流,把生成式模型串成可規模化重複使用的內容產線。
Claude Opus 5 vs GPT-5.6 Sol 全比較:輸入同為 $5、輸出 $25 對 $30,Artificial Analysis 智慧指數 61 對 59。從價格、寫程式、agent、安全到生態,告訴你該挑哪一個。