Claude Code 自動模式 8 月 14 日起預設開啟:分類器取代逐次審核
Anthropic 宣布 8 月 14 日起 Claude Code 在 Pro、Max、Team 新工作階段預設採自動模式,由獨立分類器逐個攔截不可逆、破壞性與對外操作,解決使用者盲目核准 97% 權限提示的疲勞問題。
拆解工具、開源專案與導入流程的能力、限制與成本。
這裡收錄 coding agent、向量檢索、tokenizer、端側推論與代理框架。每篇文章依證據清楚區分官方說明、第三方評測與實際操作;沒有可見的操作方法與限制時,不標示為實測。
共 41 則文章 · 136 個具名來源 · 涵蓋 2026/07/26 至 2026/09/13
編輯策展,最近複核:2026-08-20
Anthropic 宣布 8 月 14 日起 Claude Code 在 Pro、Max、Team 新工作階段預設採自動模式,由獨立分類器逐個攔截不可逆、破壞性與對外操作,解決使用者盲目核准 97% 權限提示的疲勞問題。
自動權限模式的代表性變更
Anthropic 官方部落格揭露為 Claude Opus 5 與 Fable 5 移除 Claude Code 超過 80% 系統提示詞,編碼評測無顯著退步,並提出五條上下文工程新規則與 claude doctor 指令。
系統提示詞精簡與成本工程
開源工具 claude-thermos 以本地反向代理監控 Claude Code 會話,在主智能體等待子智能體時自動刷新提示詞快取,作者量測可省下約 22% 帳單。
開源快取工具的具體實作
長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。
Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。
Cursor 官方宣布 Projects:開發者改在單一持久對話中與協調代理合作,由它規劃並派工給多個實作代理,beta 向所有用戶展開。
柏克萊 RDI 開源 CUA-Lite 平台,以單一 LiteSample 資料架構與統一環境介面,把電腦操作代理的評測、微調與強化學習收進同一套駕馭層,30k+ 任務免 VM 就能跑。
GitHub 在 Copilot CLI 推出 HydraFusion 研究預覽:依任務在單模型、級聯與互評三種工作流間動態調度多模型,官方評測稱成本最多省 67%。
GPT-6 Astra 驅動 Blender 有三條路:Computer Use 免設定但慢且貴、MCP 呼叫工具較快、Python CLI 以 bpy 腳本直達核心;三種接法的原理、設定與逾時對策一次拆解。
Google 開發者部落格複盤 AI Agents Challenge 頭部提交,歸納出雙向 MCP、事件驅動並行、回退同標準、分層路由四個工程模式。
Google Stax 與 Gemini Enterprise 官方評測文件指出,可靠的 LLM-as-a-Judge 靠可改寫的 rubric、涵蓋邊角案例的資料集,以及以人類評分為基準的校準迴圈。
別急著裝框架:在免費雲端筆記本上用原始模型 API 依序練提示詞、RAG、評估、智能體與 LoRA 微調,手寫每一層機制,看懂框架到底幫你做了什麼。
吳恩達團隊的開源桌面智能體 OpenWorker 於 8 月 25 日連推 v0.2.0 與 v0.2.1;版本報導指新版內建三類資安智能體,harness 全開源可審計。
RAG 專案最常卡住的不是模型而是資料攝取。本文拆解 LangChain 與 Airbyte 的三條整合路線——文件載入器、PyAirbyte 管線與 Agent 連接器——以及上生產前要補齊的四個關卡。
OpenBMB 開源 MathForm 三件套:以 Mathlib 檢索與驗證引導迭代的形式化框架、約 36.7 萬筆已驗證範例的 FormalVerse 資料集、MathForm-8B 模型;六基準平均 Pass@8 達 88.06%(SC)與 72.37%(CC),Apache 2.0 釋出。
SGLang 發布 Weight Cache Daemon:量化權重常駐 GPU 守護行程,引擎重啟走 CUDA IPC 零拷貝,Ling-2.6-1T FP8 載入由 495 秒縮至 0.63 秒。
Mistral 推出 Agentic Search,以 search、open、navigate、read、grep 五個工具讓模型在長文件中多步檢索並驗證,FinanceBench 正確率從 26.7% 升到 86%。
Anthropic 釋出 Claude Python SDK v1.0.0:HTTP 層改用 API 相容的 httpx2,移除 Text Completions 等長期棄用介面,並要求 Python 3.10 以上。
Anthropic 訪談十餘家高成長新創,整理出人人皆可交付、自動化繁瑣工作、信任但驗證等五條 Claude Code 實戰規則,讓小團隊打出十倍規模的交付速度。
Google Cloud 為 AlloyDB 的 ScaNN 索引推出四層樹架構 Preview,內部測試於 100 億向量達 p95 延遲 51ms、召回率 95%,查詢複雜度自 O(N^1/2) 降至 O(N^1/4)。
Anthropic 副資安長公開 AI 原生 SDLC 實務:Claude 已撰寫約 80% 合併程式碼、工程師每季產出約 8 倍,控制點從階段門禁移往技能、沙盒與代理身分。
Anthropic 將 Computer Use、Skills API 與 Files API 從 beta 轉為正式版,同步提供瀏覽器操作工具;不再需要 beta header,但 token 開銷與資安邊界仍要自行把關。
螞蟻集團 inclusionAI 開源 ConceptEdit 圖像編輯資料管線,以逾 1,000 個細粒度編輯概念驅動、逐例 VQA 過濾,產出 1,200 萬組驗證編輯配對與評測基準。
Google 以 ADK 與 Gemini 開源零信任客服退貨代理範例,在 LLM 上下文之外以硬體簽章、gVisor 沙箱與語意閘道三層硬邊界防禦提示注入。
Sentence Transformers v6.0 新增第四種模型類型 MultiVectorEncoder,以 MaxSim 晚期交互逐 token 計分,PyLate 與 ColBERT 檢查點可直接載入。
Modular 於 8 月 18 日宣布 Mojo 編譯器與工具鏈完整開源,以 Apache 2.0 含 LLVM 例外授權上架 GitHub,在 1.0 穩定後七天兌現承諾;編譯器貢獻管道目標年底開放。
用 Inspect AI 與 Harbor 設計 agent 評測:先留下可回查的執行紀錄,再談儀表板。
DeepSeek 將智能體框架 Harness v0.1 以 MIT 授權開源,基於 Cordis 插件系統,模型、工具、技能、會話、沙箱、儲存全部變成可替換的插件。
Modular 在 26.5 版正式將 Mojo 推進至 1.0,標誌這門 2023 年問世、Python 語法包覆系統語言骨幹的 AI 語言從研究走向生產、立下穩定底座;開源標準庫以來近 200 名貢獻者合入逾 1,100 個 PR、改動逾 20 萬行。
新手第一個 AI 編碼助理怎麼選?從 GPT-5.6 Sol 與 Kimi K3 兩種模型、ChatGPT 訂閱與 Codex CLI 兩種工具,到交代脈絡、迭代補檔、用 Custom GPT 與 Skills 沉澱重用,一篇講清上手流程。
VS Code 內的 GitHub Copilot 跑在 Electron 上、共用 Chromium 網路堆疊;在本機用 mitmproxy 當中間人並信任其 CA 憑證,就能解密、檢視 AI 助理與後端模型之間的 HTTPS 流量。
Cua 團隊釋出進程級 Metal 能力墊片,攔截 macOS 虛擬機的能力查詢並改兩個回報值,讓 llama.cpp 選到更快核心;M1 Ultra 上 TinyLlama 推理快 11–16 倍、逼近裸機。
SGLang 在路線圖 #20415 推動 Unified Radix Cache,把 Full、SWA、Mamba 三套分叉的前綴快取統一成單一 token 鍵控樹,各組件各自處理路徑、滑動窗口與檢查點復用,為混合注意力與狀態空間模型推論打地基。
MiniMax 官方開源的全模態影片模型 MiniMax-H3,一次前向傳遞同時生成影片與原生立體聲音訊;ComfyUI 0.30.0 起原生支援,可用 Python 經 API 無頭驅動、不必開圖形介面。
Z.ai 官方編碼代理 ZCode 以 Goal、子代理、遠端控制與閒時任務四大能力,把 GLM-5.2 的百萬 token 長任務實力變成可跨裝置調度的桌面工作流;v3.7.5 已讓閒時任務接入自訂模型子代理。
Databricks 說明 Genie Agents 如何同時讀結構化資料與文件,並把治理交給 Unity Catalog——以使用者身分在資料層過濾,而非仰賴模型自律。
Anthropic 宣布 8 月 14 日起 Claude Code 在 Pro、Max、Team 新工作階段預設採自動模式,由獨立分類器逐個攔截不可逆、破壞性與對外操作,解決使用者盲目核准 97% 權限提示的疲勞問題。
阿里巴巴 Qwen 團隊開源 Qwen-MM-Plugins,以 skill 加 MCP server 的兩件式架構,把讀圖、看片、讀文件、3D/CAD 等多模態能力裝進 Claude Code、Codex、Gemini CLI 等智能體框架,採 Apache-2.0 釋出。
OpenChamber 是建於 OpenCode 的開源代理式開發環境,跨桌面、瀏覽器、手機與 VS Code,主打 session goals、最多五模型並跑融合、變更走查與 issue 到 PR 全流程,MIT 授權、資料本地優先。
Anthropic 官方部落格揭露為 Claude Opus 5 與 Fable 5 移除 Claude Code 超過 80% 系統提示詞,編碼評測無顯著退步,並提出五條上下文工程新規則與 claude doctor 指令。
開源工具 claude-thermos 以本地反向代理監控 Claude Code 會話,在主智能體等待子智能體時自動刷新提示詞快取,作者量測可省下約 22% 帳單。
新開源分詞器 GigaToken 以 SIMD 與多層快取改寫 BPE 效能,在 144 核 AMD EPYC 上對 GPT-2 達 24.53 GB/s,較 HuggingFace Tokenizers 快 989 倍,並可直接替代 HF 與 tiktoken。
xAI 釋出 Grok Build 終端編程代理,由 Grok 4.5 驅動,內建 Skills、Plan mode、Subagents 與 MCP,免費開放試用,直接挑戰 Claude Code 與 Codex CLI。
開發者 slvDev 把 28.9M 參數語言模型塞進約 8 美元的 ESP32-S3,靠 Per-Layer Embeddings 將 25M 參數留在快閃記憶體,端到端約 9.5 tok/s 完全離線生成。