輸出是否可靠
不只看示範畫面;確認結果品質、失敗模式、可重現性,以及人工覆核要付出多少成本。
這裡集中收錄工具、工作流與產品分析;文章會區分 AIDM 實際操作、官方資料與第三方評測。沒有公開測試方法與限制,就不標示為實測。
不只看示範畫面;確認結果品質、失敗模式、可重現性,以及人工覆核要付出多少成本。
釐清資料保存、權限、供應商依賴與地端選項,避免功能好用卻跨過團隊不能接受的邊界。
把價格、延遲、整合與維運放在同一張決策表,而不是只比較模型分數或行銷功能清單。
Apple 台灣官網已把 Siri AI 列為 iPhone 主打功能,標示英文率先推出、使用可能受限,主打個人情境理解與 app 整合,由 A20 Pro 支撐。
長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。
OpenAI 工程團隊首度說明 ChatGPT 背後的線上儲存平台 Habitat:官方摘要稱它從 Python 函式庫演進為全球分散式平台,服務 10 億使用者、每秒 2,200 萬次請求。
Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。
OpenAI 把驅動 Codex 的開源 Harness 與沙盒基礎設施包成 Agents API 公開測試版,單一 API 呼叫即可建立可連跑多日的雲端代理,不加收平台費、只按 Token 與工具用量計價。
Cursor 官方宣布 Projects:開發者改在單一持久對話中與協調代理合作,由它規劃並派工給多個實作代理,beta 向所有用戶展開。
OpenAI 發表 ChatGPT for Financial Services:GPT-6 Astra 搭內建金融數據,由 OpenAI 索引託管並逐筆溯源,直通 Excel 範本交付,採資格制銷售。
Anthropic 將 CrowdStrike、Cursor、Factory、Gamma、Vercel 納入 Claude Marketplace,企業可用既有 Anthropic 承諾額度採購這些第三方產品。
Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。
柏克萊 RDI 開源 CUA-Lite 平台,以單一 LiteSample 資料架構與統一環境介面,把電腦操作代理的評測、微調與強化學習收進同一套駕馭層,30k+ 任務免 VM 就能跑。
GitHub 在 Copilot CLI 推出 HydraFusion 研究預覽:依任務在單模型、級聯與互評三種工作流間動態調度多模型,官方評測稱成本最多省 67%。
GPT-6 Astra 驅動 Blender 有三條路:Computer Use 免設定但慢且貴、MCP 呼叫工具較快、Python CLI 以 bpy 腳本直達核心;三種接法的原理、設定與逾時對策一次拆解。
Google 開發者部落格複盤 AI Agents Challenge 頭部提交,歸納出雙向 MCP、事件驅動並行、回退同標準、分層路由四個工程模式。
Google Stax 與 Gemini Enterprise 官方評測文件指出,可靠的 LLM-as-a-Judge 靠可改寫的 rubric、涵蓋邊角案例的資料集,以及以人類評分為基準的校準迴圈。
網易 UU 遠程的終端功能補上完整 TUI 互動與會話管理,會話可分離重接、跨裝置接力,官方建議雙端升級 V4.39.0。
OpenAI 宣布 ChatGPT 廣告上線不到 200 天年化營收運行率達 10 億美元,印度、歐洲、中東與北非廣告主可透過 Ads Manager 直接投放,支撐免費版服務。
Runway 發表首個「介面世界模型」Solaris:即時逐幀生成可互動的網站與應用介面,不經程式碼中間層,並定位為智能體訓練的新環境。
別急著裝框架:在免費雲端筆記本上用原始模型 API 依序練提示詞、RAG、評估、智能體與 LoRA 微調,手寫每一層機制,看懂框架到底幫你做了什麼。
Apple 發表搭載 M5 Max 與 M5 Ultra 的新一代 Mac Studio,官方稱 AI 效能最高提升 4.3 倍,M5 Ultra 最高可選 512GB 統一記憶體,台灣 84,900 元起。
吳恩達團隊的開源桌面智能體 OpenWorker 於 8 月 25 日連推 v0.2.0 與 v0.2.1;版本報導指新版內建三類資安智能體,harness 全開源可審計。
RAG 專案最常卡住的不是模型而是資料攝取。本文拆解 LangChain 與 Airbyte 的三條整合路線——文件載入器、PyAirbyte 管線與 Agent 連接器——以及上生產前要補齊的四個關卡。
OpenBMB 開源 MathForm 三件套:以 Mathlib 檢索與驗證引導迭代的形式化框架、約 36.7 萬筆已驗證範例的 FormalVerse 資料集、MathForm-8B 模型;六基準平均 Pass@8 達 88.06%(SC)與 72.37%(CC),Apache 2.0 釋出。
xAI 把 Grok Build 開放給所有使用者:在對話中描述 App、遊戲或儀表板即時生成可運作版本,可發布到 grok.me、綁自有網域並匯出 GitHub。
SGLang 發布 Weight Cache Daemon:量化權重常駐 GPU 守護行程,引擎重啟走 CUDA IPC 零拷貝,Ling-2.6-1T FP8 載入由 495 秒縮至 0.63 秒。
Mistral 推出 Agentic Search,以 search、open、navigate、read、grep 五個工具讓模型在長文件中多步檢索並驗證,FinanceBench 正確率從 26.7% 升到 86%。
Anthropic 釋出 Claude Python SDK v1.0.0:HTTP 層改用 API 相容的 httpx2,移除 Text Completions 等長期棄用介面,並要求 Python 3.10 以上。
Anthropic 訪談十餘家高成長新創,整理出人人皆可交付、自動化繁瑣工作、信任但驗證等五條 Claude Code 實戰規則,讓小團隊打出十倍規模的交付速度。
Google Cloud 為 AlloyDB 的 ScaNN 索引推出四層樹架構 Preview,內部測試於 100 億向量達 p95 延遲 51ms、召回率 95%,查詢複雜度自 O(N^1/2) 降至 O(N^1/4)。
Anthropic 副資安長公開 AI 原生 SDLC 實務:Claude 已撰寫約 80% 合併程式碼、工程師每季產出約 8 倍,控制點從階段門禁移往技能、沙盒與代理身分。
Anthropic 將 Computer Use、Skills API 與 Files API 從 beta 轉為正式版,同步提供瀏覽器操作工具;不再需要 beta header,但 token 開銷與資安邊界仍要自行把關。
螞蟻集團 inclusionAI 開源 ConceptEdit 圖像編輯資料管線,以逾 1,000 個細粒度編輯概念驅動、逐例 VQA 過濾,產出 1,200 萬組驗證編輯配對與評測基準。
Google 以 ADK 與 Gemini 開源零信任客服退貨代理範例,在 LLM 上下文之外以硬體簽章、gVisor 沙箱與語意閘道三層硬邊界防禦提示注入。
Sentence Transformers v6.0 新增第四種模型類型 MultiVectorEncoder,以 MaxSim 晚期交互逐 token 計分,PyLate 與 ColBERT 檢查點可直接載入。
Modular 於 8 月 18 日宣布 Mojo 編譯器與工具鏈完整開源,以 Apache 2.0 含 LLVM 例外授權上架 GitHub,在 1.0 穩定後七天兌現承諾;編譯器貢獻管道目標年底開放。
OpenAI 為 13–17 歲用戶自動啟用 ChatGPT for Teens:年齡預測自動套用防護,學習模式以引導取代給答案,家長可連結帳號管理,並與 CodeAI 合作推動 AI 素養。
用 Inspect AI 與 Harbor 設計 agent 評測:先留下可回查的執行紀錄,再談儀表板。
Cursor 宣布 Origin 程式碼託管早期測試版:付費方案全部開放,支援儲存庫、pull request、GitHub 雙向同步與 Vercel、Depot、Buildkite 整合。
Google 為試算表推出 Sheets canvas:在 Ask Gemini 側欄用自然語言,把既有資料生成可讀寫的互動迷你應用,畫布與試算表雙向同步。
OpenAI 自 7 月 30 日起將 GPT-5.6 Luna 降為每百萬 token 輸入 0.20、輸出 1.20 美元,與 Claude Opus 拉開逾 20 倍價差;本文拆解價格結構與影響。
DeepSeek 將智能體框架 Harness v0.1 以 MIT 授權開源,基於 Cordis 插件系統,模型、工具、技能、會話、沙箱、儲存全部變成可替換的插件。
xAI 8 月 11 日推出 Grok Bot:每個帳號配一台雲端電腦、多個 Bot 共用,學你的流程、做完工才回報;方案掛 Cursor 之名,背後是 SpaceX 600 億美元收購 Anysphere。
Modular 在 26.5 版正式將 Mojo 推進至 1.0,標誌這門 2023 年問世、Python 語法包覆系統語言骨幹的 AI 語言從研究走向生產、立下穩定底座;開源標準庫以來近 200 名貢獻者合入逾 1,100 個 PR、改動逾 20 萬行。
OpenAI 讓 ChatGPT 桌面端匯入 Claude Code 的專案、對話、技能與設定,同步進 Work 與 Codex,可在設定開啟自動更新。
新手第一個 AI 編碼助理怎麼選?從 GPT-5.6 Sol 與 Kimi K3 兩種模型、ChatGPT 訂閱與 Codex CLI 兩種工具,到交代脈絡、迭代補檔、用 Custom GPT 與 Skills 沉澱重用,一篇講清上手流程。
VS Code 內的 GitHub Copilot 跑在 Electron 上、共用 Chromium 網路堆疊;在本機用 mitmproxy 當中間人並信任其 CA 憑證,就能解密、檢視 AI 助理與後端模型之間的 HTTPS 流量。
Cua 團隊釋出進程級 Metal 能力墊片,攔截 macOS 虛擬機的能力查詢並改兩個回報值,讓 llama.cpp 選到更快核心;M1 Ultra 上 TinyLlama 推理快 11–16 倍、逼近裸機。
Google 執行長 Sundar Pichai 宣布 Gemini 應用月活突破 10 億,是 Google 增長最快的產品、第 14 個達 10 億用戶的產品,一年內從約 4 億翻倍,緊追 5 月已破 10 億的 ChatGPT。
Google Cloud 把 Gemini 嵌進 DMS 轉換工作區,在演算法轉換之上自動改寫並解釋預存程序、觸發程序與函式,協助從 Oracle、SQL Server 搬向 PostgreSQL。
SGLang 在路線圖 #20415 推動 Unified Radix Cache,把 Full、SWA、Mamba 三套分叉的前綴快取統一成單一 token 鍵控樹,各組件各自處理路徑、滑動窗口與檢查點復用,為混合注意力與狀態空間模型推論打地基。
MiniMax 官方開源的全模態影片模型 MiniMax-H3,一次前向傳遞同時生成影片與原生立體聲音訊;ComfyUI 0.30.0 起原生支援,可用 Python 經 API 無頭驅動、不必開圖形介面。
Z.ai 官方編碼代理 ZCode 以 Goal、子代理、遠端控制與閒時任務四大能力,把 GLM-5.2 的百萬 token 長任務實力變成可跨裝置調度的桌面工作流;v3.7.5 已讓閒時任務接入自訂模型子代理。
Databricks 說明 Genie Agents 如何同時讀結構化資料與文件,並把治理交給 Unity Catalog——以使用者身分在資料層過濾,而非仰賴模型自律。
微信正灰度測試朋友圈「AI 幫寫」「AI 點評」,由原生助手小微驅動,騰訊客服證實逐步開放中;這把生成式 AI 放進發文與回覆兩個最高頻的社交動作。
Anthropic 宣布 8 月 14 日起 Claude Code 在 Pro、Max、Team 新工作階段預設採自動模式,由獨立分類器逐個攔截不可逆、破壞性與對外操作,解決使用者盲目核准 97% 權限提示的疲勞問題。
Meta 執行長祖克柏發表 6,500 字宣言《The Future is for Everyone》,主張超級智慧應分散給每個人而非集中於一方,並承諾恢復開源、個人代理、博士級導師與完全隱私模式。
阿里巴巴 Qwen 團隊開源 Qwen-MM-Plugins,以 skill 加 MCP server 的兩件式架構,把讀圖、看片、讀文件、3D/CAD 等多模態能力裝進 Claude Code、Codex、Gemini CLI 等智能體框架,採 Apache-2.0 釋出。
OpenChamber 是建於 OpenCode 的開源代理式開發環境,跨桌面、瀏覽器、手機與 VS Code,主打 session goals、最多五模型並跑融合、變更走查與 issue 到 PR 全流程,MIT 授權、資料本地優先。
阿里巴巴旗下千問開放平台 8 月 10 日上線,開放手機、PC、AI 眼鏡三端,首批覆蓋物流、房產、理財等十餘領域,用戶在對話中 @ 服務即可從諮詢辦到下單。
xAI 於 8 月 7 日推出 Imagine Image 2.0,以魔術棒點選特定區域即可單獨編輯、其餘畫面不動,並搭配分割、去背、多參考與智慧變形,現已於 grok.com 與 iOS、Android App 全面可用。
ByteDance Seed 團隊的 Seedance 2.5 單次生成 30 秒影音、多輪續寫延伸到數分鐘,支援 30 圖+10 影+10 音多模態參考與時間戳鏡頭控制;火山方舟文件指單次生成時長提升至 30 秒。
Meta 超級智慧實驗室(MSL)於 2026 年 8 月 5 日發布終端編碼代理 Muse Code(beta)與驅動它的 Muse Spark 1.2。Meta 罕見地公開三張基準圖,卻顯示三項全數落後 Anthropic Claude Opus 5;真正的差異化在事件日誌與常駐背景代理,但 Contributor 低價方案以「可用你的程式碼訓練」為代價,預設導向此層。
OpenRouter 推出 Classifiers 測試版,讓企業對每次 AI 請求附加結構化元資料,按任務類型、部門、合規類別與成本中心分類,非同步執行不增加推論延遲。
Anthropic 官方部落格揭露為 Claude Opus 5 與 Fable 5 移除 Claude Code 超過 80% 系統提示詞,編碼評測無顯著退步,並提出五條上下文工程新規則與 claude doctor 指令。
開源工具 claude-thermos 以本地反向代理監控 Claude Code 會話,在主智能體等待子智能體時自動刷新提示詞快取,作者量測可省下約 22% 帳單。
Anthropic 將 Claude 語音模式從 Haiku 升級到 Opus 與 Sonnet,新增連接工具呼叫與 11 種語言,搶進行動語音助理市場。
百度搭子在成都 AI Day 升級智能路由、跨端共享記憶、桌面內嵌瀏覽器與 PPT 生成,企業版與搭子聯盟同步登場,日均提問次數較上線初暴增 20 倍。
新開源分詞器 GigaToken 以 SIMD 與多層快取改寫 BPE 效能,在 144 核 AMD EPYC 上對 GPT-2 達 24.53 GB/s,較 HuggingFace Tokenizers 快 989 倍,並可直接替代 HF 與 tiktoken。
OpenAI 將 Health in ChatGPT 擴大至全美 18 歲以上用戶,可連結 Apple Health 與 Epic、Oracle Health 等醫療體系病歷,並推進到主對話流程,背後由 GPT-5.6 Sol 支撐。
OpenAI 將 ChatGPT Voice 推入桌面版,由 GPT-Live 驅動,可同時說話、聆聽並協調多個智慧代理,macOS 與 Windows 全球推送。
Runway 在 Agent 中上線 Workflows,使用者可透過自然語言建立、執行、編輯節點式工作流,把生成式模型串成可規模化重複使用的內容產線。
xAI 釋出 Grok Build 終端編程代理,由 Grok 4.5 驅動,內建 Skills、Plan mode、Subagents 與 MCP,免費開放試用,直接挑戰 Claude Code 與 Codex CLI。
開發者 slvDev 把 28.9M 參數語言模型塞進約 8 美元的 ESP32-S3,靠 Per-Layer Embeddings 將 25M 參數留在快閃記憶體,端到端約 9.5 tok/s 完全離線生成。