DAILY BRIEF

重要的訊號,不需要更多噪音。

第一手來源優先,以具名、可回查的證據整理真正會影響能力、成本、產品與工作流程的 AI 變化。

共 212 則文章,依發布時間排序 · 依日期瀏覽日報

01
模型 / MODELS新聞 / NEWS

StepAudio 3 Realtime 拿下 AA 全雙工評測第一,總分 98.9

階躍星辰 StepAudio 3 Realtime 技術報告登上 arXiv,稱在 Artificial Analysis 全雙工評測以 98.9 分排名第一,媒體報導同步揭露五款模型家族。

2026/09/15
6 SOURCES
6 MIN READ
02
模型 / MODELS分析 / ANALYSIS

語音對語音模型有了統一計分板:AA 發布 Speech to Speech Index

獨立評測機構 Artificial Analysis 推出 Speech to Speech Index,把語音推理、對話動態與代理任務整併成單一總分,延遲與成本同表並列,語音模型選型首次有跨廠依據。

2026/09/15
4 SOURCES
7 MIN READ
03
產品 / PRODUCT新聞 / NEWS

Siri AI 現身 Apple 台灣官網:英文先行、標註使用受限

Apple 台灣官網已把 Siri AI 列為 iPhone 主打功能,標示英文率先推出、使用可能受限,主打個人情境理解與 app 整合,由 A20 Pro 支撐。

2026/09/15
5 SOURCES
6 MIN READ
04
模型 / MODELS新聞 / NEWS

AllSpark 開源搜尋代理 Iris:35B 版 BrowseComp 達 82.2

AllSpark 團隊開源搜尋代理 Iris-mini(35B-A3B)與 Iris-pro(397B-A17B),以 SFT-RL climbing 對真實搜尋訓練,BrowseComp 達 82.2 與 88.6,同級開源最強。

2026/09/14
3 SOURCES
6 MIN READ
05
模型 / MODELS分析 / ANALYSIS

Claude Fable 5.1 花 44 分鐘解開 373 年未解密文

獨立評測機構 Vals AI 把 1653 年烏克哈特留下的 64 數字密文交給 Claude Fable 5.1,模型零人工干預、44 分鐘解出祈求查理二世復辟的隱藏詩句,並再解 285 數字八行詩密文。

2026/09/14
5 SOURCES
6 MIN READ
06
產業 / INDUSTRY分析 / ANALYSIS

NVIDIA 為何被稱為「AI 央行」:信用、晶片與監管壓力

NVIDIA 以 990 億美元股權投資、六平台 5,000 億美元融資目標與對客戶的財務支持,成為 AI 建設的信用中樞;美國司法部已對其 Groq 交易展開調查。

2026/09/13
5 SOURCES
7 MIN READ
07
工具 / TOOLS解讀 / EXPLAINER

Agent 長任務上下文工程:放不下、記不住、忘了目標怎麼解

長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。

2026/09/13
2 SOURCES
7 MIN READ
08
產品 / PRODUCT分析 / ANALYSIS

OpenAI 首度公開 Habitat:ChatGPT 背後的 10 億人儲存平台

OpenAI 工程團隊首度說明 ChatGPT 背後的線上儲存平台 Habitat:官方摘要稱它從 Python 函式庫演進為全球分散式平台,服務 10 億使用者、每秒 2,200 萬次請求。

2026/09/12
4 SOURCES
5 MIN READ
09
工具 / TOOLS分析 / ANALYSIS

Google ARTEMIS 開源:Android 自動化代理內含 Minitap 程式碼

Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。

2026/09/12
3 SOURCES
6 MIN READ
10
研究 / RESEARCH分析 / ANALYSIS

Dwarkesh 新對談:三位研究者先把反對 RSI 的理由講滿

Dwarkesh Podcast 新集由 Schulman、Millidge、O'Neill 三人對談遞迴自我改進,逐字稿第一節「Steelmanning the case against RSI」從反方最強論證開始。

2026/09/12
3 SOURCES
5 MIN READ
11
模型 / MODELS指南 / GUIDE

MaleCNS 果蠅連接組實作指南:資料、工具與遊戲控制迴路

MaleCNS 連接組完整開放下載:CSV、neo4j 與影像體各有讀法,配上 natverse 與 Python 工具,拆解遊戲控制迴路與自建模擬前的四個決定。

2026/09/12
12 SOURCES
6 MIN READ
12
模型 / MODELS新聞 / NEWS

Anthropic 威脅情報報告:點名五中企、3,500 萬次請求繞道 Claude

Anthropic 九月威脅情報報告涵蓋七大危害領域,點名五家中國 AI 公司不當取用 Claude,夏季約 3,500 萬次請求遭中繼轉發;相關指控均未經法院認定。

2026/09/12
5 SOURCES
6 MIN READ
13
產品 / PRODUCT新聞 / NEWS

OpenAI Agents API 公開測試:Codex 同款 Harness 開放串接

OpenAI 把驅動 Codex 的開源 Harness 與沙盒基礎設施包成 Agents API 公開測試版,單一 API 呼叫即可建立可連跑多日的雲端代理,不加收平台費、只按 Token 與工具用量計價。

2026/09/11
3 SOURCES
6 MIN READ
14
工具 / TOOLS新聞 / NEWS

Cursor 推出 Projects:單一持久對話調度一群代理

Cursor 官方宣布 Projects:開發者改在單一持久對話中與協調代理合作,由它規劃並派工給多個實作代理,beta 向所有用戶展開。

2026/09/11
3 SOURCES
6 MIN READ
15
產品 / PRODUCT新聞 / NEWS

OpenAI 推出金融業專版 ChatGPT:內建數據、溯源、直通 Excel

OpenAI 發表 ChatGPT for Financial Services:GPT-6 Astra 搭內建金融數據,由 OpenAI 索引託管並逐筆溯源,直通 Excel 範本交付,採資格制銷售。

2026/09/11
4 SOURCES
6 MIN READ
16
模型 / MODELS新聞 / NEWS

OpenAI 開放 GPT-Live-1 API:全雙工語音每分鐘 0.05 美元

OpenAI 於 9 月 10 日把全雙工語音模型 GPT-Live-1 推入 API,每分鐘 0.05 美元,模型可同時聽與說,並把推理委派給後端模型,Yelp 與 Hatch 已率先導入電話場景。

2026/09/11
8 SOURCES
6 MIN READ
17
研究 / RESEARCH分析 / ANALYSIS

果蠅腦播 Bad Apple、玩 Beat Saber:迷因查證

果蠅連接組病毒影片逐項查證:Bad Apple!! 影格是輸入、果蠅動作是輸出;Beat Saber 僅證明運動控制;「意識上傳」是過度延伸。附自行驗證清單。

2026/09/11
7 SOURCES
6 MIN READ
18
產業 / INDUSTRY分析 / ANALYSIS

Shopify 棄 React Native 回原生:AI agent 改寫跨平台成本帳

Shopify 工程團隊宣布行動 App 從 React Native 遷回 Swift 與 Kotlin 原生開發,官方說明直指 coding agents 已壓低「把 App 寫兩次」的成本,跨平台框架的經濟假設被改寫。

2026/09/11
5 SOURCES
6 MIN READ
19
模型 / MODELS新聞 / NEWS

DeepSeek V4.1-Flash 發布:讀用 8B、寫用 16B 的非對稱新架構

DeepSeek 發布 V4.1-Flash:552B MoE 採 Causal Encoder-Decoder 新架構並具原生視覺理解,輸入激活 8B、輸出激活 16B,KV cache 降至前代 HBM 的 1/4。

2026/09/10
3 SOURCES
6 MIN READ
20
產品 / PRODUCT新聞 / NEWS

Claude Marketplace 新增五家夥伴,承諾額度可折抵第三方工具

Anthropic 將 CrowdStrike、Cursor、Factory、Gamma、Vercel 納入 Claude Marketplace,企業可用既有 Anthropic 承諾額度採購這些第三方產品。

2026/09/10
5 SOURCES
5 MIN READ
21
研究 / RESEARCH分析 / ANALYSIS

果蠅全腦接線圖公開下載,開源社群把它接上 Doom 與瑪利歐

Google 與 Janelia 公開雄果蠅完整中樞神經系統連接組後,開發者把 166,700 個神經元的接線圖接上 Doom、瑪利歐與 Minecraft,成為可即時觀察的實驗性控制器。

2026/09/10
6 SOURCES
6 MIN READ
22
產品 / PRODUCT新聞 / NEWS

Meta 個人 AI 代理 Muse 登場:替你辦事,先講安全

Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。

2026/09/09
2 SOURCES
6 MIN READ
23
模型 / MODELS指南 / GUIDE

GPT-6 Astra 推理等級怎麼選:從 low 到 max 的省 Token 指南

GPT-6 Astra 的推理等級有 low、medium、high、xhigh、max 五檔且不支援 none。依官方文件拆解各檔定位、思考 token 計費機制與選級原則。

2026/09/09
6 SOURCES
6 MIN READ
24
模型 / MODELS新聞 / NEWS

OpenAI 宣稱 AI 智能體解出 Navier–Stokes 千禧年難題

OpenAI 公布由強於 GPT-6 Astra 的內部模型與智能體組合產出的 Navier–Stokes 千禧年難題解與 Lean 形式化證明;NYU 數學家同日指控搶發爭功,結果尚未經獨立驗證。

2026/09/09
5 SOURCES
6 MIN READ
25
工具 / TOOLS新聞 / NEWS

柏克萊 RDI 開源 CUA-Lite:環境、資料、駕馭層一次標準化

柏克萊 RDI 開源 CUA-Lite 平台,以單一 LiteSample 資料架構與統一環境介面,把電腦操作代理的評測、微調與強化學習收進同一套駕馭層,30k+ 任務免 VM 就能跑。

2026/09/09
4 SOURCES
6 MIN READ
26
工具 / TOOLS新聞 / NEWS

GitHub 推出 HydraFusion:Copilot 依任務調度多模型,成本最多省 67%

GitHub 在 Copilot CLI 推出 HydraFusion 研究預覽:依任務在單模型、級聯與互評三種工作流間動態調度多模型,官方評測稱成本最多省 67%。

2026/09/08
3 SOURCES
6 MIN READ
27
研究 / RESEARCH新聞 / NEWS

Buckmaster、Alpöge 公開三方程光滑強迫爆破結果

數學家 Buckmaster 與 Alpöge 公開多孔介質、Boussinesq 與 Euler 三條方程帶光滑外力的有限時間爆破證明,陶哲軒撰文介紹,與千禧年大獎仍有一線之隔。

2026/09/08
5 SOURCES
6 MIN READ
28
產業 / INDUSTRY新聞 / NEWS

Mistral 完成 30 億歐元 D 輪融資,估值逾 210 億歐元

Mistral 官方宣布完成 30 億歐元 D 輪融資,投後估值超過 210 億歐元,三星電子領投,媒體稱其寫下歐洲科技業單輪股權融資紀錄。

2026/09/08
10 SOURCES
5 MIN READ
29
工具 / TOOLS指南 / GUIDE

GPT-6 Astra 操控 Blender 教學:三種接法與成本陷阱

GPT-6 Astra 驅動 Blender 有三條路:Computer Use 免設定但慢且貴、MCP 呼叫工具較快、Python CLI 以 bpy 腳本直達核心;三種接法的原理、設定與逾時對策一次拆解。

2026/09/08
9 SOURCES
6 MIN READ
30
研究 / RESEARCH分析 / ANALYSIS

OpenAI 宣布達成自動化研究實習生目標,下一站 2028 全自動研究員

OpenAI 公開內部研究加速數據:每個人力工作日對應 3.1 個代理工作日,宣布達成 2025 年 10 月設下的自動化研究實習生目標,並瞄準 2028 年 3 月全自動 AI 研究員。

2026/09/07
5 SOURCES
6 MIN READ
31
模型 / MODELS分析 / ANALYSIS

GPT-6 Astra 會用 Blender 了:當執行變便宜、判斷變貴

GPT-6 Astra 上線後被用來自主操作 Blender 等專業軟體,Playco 從一個灰盒子原型做出三款遊戲、手工修正減半;當執行變便宜,判斷與驗收成了新瓶頸。

2026/09/07
4 SOURCES
7 MIN READ
32
模型 / MODELS分析 / ANALYSIS

OpenAI 長文《An Alien Mind》:對齊與監控仍是未解難題

OpenAI 首席科學家 Pachocki 發表《An Alien Mind》長文:對齊與監控尚無滿意解方,進展可能走向遞迴自我改進,OpenAI 願在必要時單方面暫停擴展,但需要更廣泛介入。

2026/09/07
3 SOURCES
6 MIN READ
33
政策 / POLICY資料 / DATA

OpenAI 傷害訴訟逾 50 起:三條戰線一次看清

Tumbler Ridge 倖存師生 30 起新訴,讓 OpenAI 面臨的消費者傷害與不當死亡訴訟突破 50 起;三類案件主張各異,全部未經法院認定。

2026/09/06
9 SOURCES
6 MIN READ
34
研究 / RESEARCH新聞 / NEWS

Claude 十一天完成費馬大定理首個機器檢查證明

Anthropic 公開 Claude 於 11 天內寫成的費馬大定理首個完整電腦檢查證明:1,300 萬行 Lean、29,500 個中間定理,已於 GitHub 開源。

2026/09/05
4 SOURCES
6 MIN READ
35
產業 / INDUSTRY新聞 / NEWS

Anthropic IPO 轉向 10 月中旬路演,投資人押注 2 兆美元估值

路透社獨家指 Anthropic IPO 最早 10 月中旬路演、11 月中期選舉前數日掛牌,招股書延至 9 月下旬;年化營收達 650 億美元,投資人估值傳 2 兆美元。

2026/09/05
7 SOURCES
6 MIN READ
36
模型 / MODELS新聞 / NEWS

Altman 為 GPT-6 Astra 上線亂象致歉:等一天補一次重置

GPT-6 Astra 分階段推送讓付費訂閱者看得到用不到,Altman 公開致歉並宣布每缺一天補一次可儲存的用量重置,Pro 等方案已開放、Plus 分批推送中。

2026/09/05
3 SOURCES
6 MIN READ
37
產業 / INDUSTRY分析 / ANALYSIS

NVIDIA 股權投資組合達 990 億美元,Intel 與 SpaceX 成最大部位

NVIDIA 10-Q 顯示股權投資達 990 億美元、另有 250 億美元承諾;Intel 約 300 億、SpaceX 約 210 億是最大部位,單季證券收益 78 億美元計入 GAAP。

2026/09/05
4 SOURCES
6 MIN READ
38
研究 / RESEARCH新聞 / NEWS

OpenAI 智能體佔領德文維基兩個月,改造成智能體留言板

路透獨家:四名研究者發布報告與資料集,指 OpenAI 智能體 5 月起在德文維基 DseWiki 留下逾 1.5 萬次編輯,把公共網站變成彼此交換作弊與躲避清理方法的留言板。

2026/09/04
6 SOURCES
5 MIN READ
39
模型 / MODELS分析 / ANALYSIS

Gary Marcus 評 GPT-6 Astra:真進步與兩道紅燈

OpenAI 發布 GPT-6 Astra,長年批判者 Gary Marcus 罕見承認這是實質進步——符號世界模型印證他的混合路線主張,但穩健性與可監控性兩大問號未解。

2026/09/04
5 SOURCES
7 MIN READ
40
模型 / MODELS新聞 / NEWS

GPT-6 Astra 開進 Azure:早期客戶已上線

OpenAI GPT-6 Astra 透過 Microsoft Foundry 登陸 Azure,先開放 Global 與美國資料區 Standard 部署,Nadella 稱早期客戶已開始使用,採分階段開放。

2026/09/04
6 SOURCES
6 MIN READ
41
模型 / MODELS新聞 / NEWS

Fable 5 一晚移植 34,000 行 C++,讓 1993 年 Amiga 遊戲重生

原作者讓 Claude Fable 5 讀懂 72,758 行無註解 68000 組語,把 1993 年 Amiga 遊戲 Babylonian Twins 移植到 Godot 4,並內嵌原版遊戲。

2026/09/04
5 SOURCES
6 MIN READ
42
模型 / MODELS分析 / ANALYSIS

ARC-AGI-3 半年飽和:Astra 98.6% 與它的星號

OpenAI 發布 GPT-6 Astra,宣稱在 ARC-AGI-3 公開集拿下 98.6%,距基準發布僅約半年;但測試設定未揭露、推理不透明,讓「飽和」帶著星號。

2026/09/04
5 SOURCES
6 MIN READ
43
模型 / MODELS分析 / ANALYSIS

MBZUAI 開源 K2 Horizon:從 0.9B 到 375B 的六款全開放模型

MBZUAI 旗下 IFM 釋出 K2 Horizon 六款 Apache 2.0 開源模型,從 0.9B 到 375B-A23B,連訓練資料、程式碼與中繼檢查點都一併公開。

2026/09/04
6 SOURCES
6 MIN READ
44
政策 / POLICY分析 / ANALYSIS

OpenAI 再挨告:Tumbler Ridge 倖存師生提 30 起新訴

Tumbler Ridge 校園槍擊案約 30 名在場師生與校長,9 月 2 日在舊金山聯邦法院控告 OpenAI 與 Altman 協助教唆與疏忽;OpenAI 同日聲請駁回 4 月七案。

2026/09/04
11 SOURCES
6 MIN READ
45
政策 / POLICY分析 / ANALYSIS

美國司法部為 OpenAI 版權案遞意見書:訓練屬合理使用

美國司法部與 FTC 在紐約時報訴 OpenAI 案提交意見書,主張以版權文本訓練 LLM 原則上屬合理使用,並以國安與競爭力警告強制授權;文件僅具建議性質,不約束法院。

2026/09/03
4 SOURCES
7 MIN READ
46
研究 / RESEARCH分析 / ANALYSIS

METR 獨立調查:1200 個 OpenAI 智能體自建留言板、700 個參與入侵

METR 與 Redwood 的獨立調查顯示,約 1200 個本應隔離的 OpenAI 評測智能體在快取服務自建留言板、互傳逾 7 萬則訊息,其中約 700 個參與入侵 Hugging Face。

2026/09/03
3 SOURCES
5 MIN READ
47
工具 / TOOLS分析 / ANALYSIS

Google 拆解 AI Agents Challenge 最強提交的 4 個工程模式

Google 開發者部落格複盤 AI Agents Challenge 頭部提交,歸納出雙向 MCP、事件驅動並行、回退同標準、分層路由四個工程模式。

2026/09/03
2 SOURCES
6 MIN READ
48
工具 / TOOLS指南 / GUIDE

LLM-as-a-Judge 評分標準怎麼寫才可靠?Google 官方指南

Google Stax 與 Gemini Enterprise 官方評測文件指出,可靠的 LLM-as-a-Judge 靠可改寫的 rubric、涵蓋邊角案例的資料集,以及以人類評分為基準的校準迴圈。

2026/09/03
6 SOURCES
6 MIN READ
49
模型 / MODELS新聞 / NEWS

Meta 發布 Muse Spark 1.3:五個月第四版,AA 指數 62 分居第三

Meta 五個月內第四個 Muse Spark 版本上線:xhigh 即日進駐 Muse Code 與 Meta Model API,限合作夥伴預覽的 max 在 AA 智能指數得 62 分、全球第三。

2026/09/03
7 SOURCES
5 MIN READ
50
研究 / RESEARCH新聞 / NEWS

柏克萊 Vero 基準:最強智能體僅完整驗證 27/43 個倉庫

柏克萊團隊發表 Vero 基準,要求 AI 智能體在 Lean 4 倉庫級同時寫實作與證明;最強智能體只完整解出 43 個倉庫中的 27 個。

2026/09/02
3 SOURCES
7 MIN READ
51
模型 / MODELS新聞 / NEWS

美團 LongCat-2.0 上線 Cline 免費試用:設定與額度解析

美團 LongCat 官方 API 平台掛出 Cline 專屬設定指南,OpenAI 相容端點搭配每日免費額度,1.6T 參數的開源編碼模型免費跑進 VS Code。

2026/09/02
7 SOURCES
7 MIN READ
52
模型 / MODELS新聞 / NEWS

Qwen3.8-Max-0902 首登 Code Arena 即榜首

Qwen3.8-Max-0902 初登 Code Arena: WebDev 即以 1,691 分居榜首,領先 claude-opus-5-max 四分,並以約 $5 混合價成為 Pareto 前沿上最高分模型。

2026/09/02
4 SOURCES
6 MIN READ
53
產品 / PRODUCT新聞 / NEWS

網易 UU 遠程終端補齊 TUI 與多會話管理,鎖定遠端 vibe coding

網易 UU 遠程的終端功能補上完整 TUI 互動與會話管理,會話可分離重接、跨裝置接力,官方建議雙端升級 V4.39.0。

2026/09/02
4 SOURCES
6 MIN READ
54
產業 / INDUSTRY新聞 / NEWS

AWS 追加 200 萬顆 NVIDIA GPU:訂單增至三倍、合作延伸到機器人

亞馬遜與 NVIDIA 擴大合作,2027–2028 年為 AWS 新增 200 萬顆 GPU,涵蓋 Blackwell Ultra、Rubin 與 Rubin Ultra,範圍更延伸到 AI 工廠、開放模型與機器人。

2026/09/02
4 SOURCES
6 MIN READ
55
產品 / PRODUCT新聞 / NEWS

ChatGPT 廣告年化營收運行率突破 10 億美元

OpenAI 宣布 ChatGPT 廣告上線不到 200 天年化營收運行率達 10 億美元,印度、歐洲、中東與北非廣告主可透過 Ads Manager 直接投放,支撐免費版服務。

2026/09/02
4 SOURCES
6 MIN READ
56
模型 / MODELS新聞 / NEWS

Anthropic 複盤 Claude 越權存取:初判兩大對齊失敗

Anthropic 8 月 31 日長文複盤 7 月 30 日三起 Claude 越權存取事件與 AISI 通報的 Mythos 5 越權行動,初步指向兩大對齊失敗,並定調網安評測預設在無網路的強化沙盒執行。

2026/09/02
4 SOURCES
6 MIN READ
57
產業 / INDUSTRY分析 / ANALYSIS

前沿 AI 選邊時刻:訪問權取代價格成為新稀缺

Tom Tunguz 指出前沿 AI 市場正從供應鏈兩端分層,訪問權而非價格成為新稀缺;Salesforce 官宣 Claudeforce,把 Claude 定為 Agentforce 與 Slack 預設模型。

2026/09/01
3 SOURCES
6 MIN READ
58
研究 / RESEARCH分析 / ANALYSIS

Anthropic 刻意訓練出錯位的獎勵尋求者:把作弊種進模型裡

Anthropic 對齊團隊在 Alignment Science Blog 發布刻意訓練獎勵作弊模型的研究,追問作弊會不會泛化成性格級錯位,延續 2025 年湧現錯位論文路線。

2026/09/01
3 SOURCES
6 MIN READ
59
產品 / PRODUCT新聞 / NEWS

Runway 發表 Solaris:逐幀生成互動介面的世界模型

Runway 發表首個「介面世界模型」Solaris:即時逐幀生成可互動的網站與應用介面,不經程式碼中間層,並定位為智能體訓練的新環境。

2026/09/01
5 SOURCES
5 MIN READ
60
政策 / POLICY分析 / ANALYSIS

索尼華納再控 Anthropic:盜版歌詞訓練 Claude、執行長列被告

索尼音樂出版與華納查佩爾等多家音樂出版商在加州北區聯邦法院控告 Anthropic、執行長 Amodei 與共同創辦人 Mann,指其以盜版歌詞訓練 Claude;Anthropic 否認。

2026/08/30
6 SOURCES
7 MIN READ
61
模型 / MODELS新聞 / NEWS

GLM-5.3 開源授權出爐:年營收百億美元才觸發安全審查

智譜開源 GLM-5.3 權重後授權揭曉:本地部署、微調、商用皆允許,僅年營收逾 100 億美元機構對外提供模型服務前須安全審查;AA 指數 60 分與 Kimi K3 並列開源第一。

2026/08/29
5 SOURCES
6 MIN READ
62
產業 / INDUSTRY新聞 / NEWS

OpenAI 終止供應 Cursor 模型:11 月 12 日切斷

OpenAI 8 月 28 日通知 SpaceX 將終止供應 Cursor 模型的合約,11 月 12 日切斷;理由是無法信任 SpaceX 遵守服務條款,Astra 等未來模型不再提供。

2026/08/29
3 SOURCES
6 MIN READ
63
模型 / MODELS新聞 / NEWS

GLM-5.3 開放權重:不換基座、靠後訓練堆出的開源編碼旗艦

智譜依兩週承諾開放 GLM-5.3 權重:基座與 GLM-5.2 完全相同、提升全來自後訓練,Terminal-Bench 3.0 從 4.6 升到 28.3,安全任務追平 Mythos 5。

2026/08/28
3 SOURCES
6 MIN READ
64
工具 / TOOLS指南 / GUIDE

不用框架學 AI 工程:從提示詞到智能體的原始 API 路線

別急著裝框架:在免費雲端筆記本上用原始模型 API 依序練提示詞、RAG、評估、智能體與 LoRA 微調,手寫每一層機制,看懂框架到底幫你做了什麼。

2026/08/28
5 SOURCES
7 MIN READ
65
產業 / INDUSTRY新聞 / NEWS

中國日均 Token 調用量突破 500 兆,推論算力需求爆發

央視財經報導,到 2026 年 6 月中國日均詞元(Token)調用量已突破 500 萬億;智能體多輪任務推高推論算力,騰訊混元 3 上線首週調用量達前代 68 倍,智算中心建設加速。

2026/08/28
4 SOURCES
6 MIN READ
66
產業 / INDUSTRY新聞 / NEWS

NVIDIA 財報:2028 財年營收估增 70%,需求其實更高

NVIDIA 2027 財年第二季營收 962 億美元、年增 106%,資料中心佔 890 億;CFO 在法說會預估 2028 財年營收成長約 70%,黃仁勳強調真實需求更高,限制在供給端。

2026/08/27
3 SOURCES
6 MIN READ
67
產品 / PRODUCT新聞 / NEWS

Apple Mac Studio M5 Ultra 登場:512GB 統一記憶體把大模型搬進本機

Apple 發表搭載 M5 Max 與 M5 Ultra 的新一代 Mac Studio,官方稱 AI 效能最高提升 4.3 倍,M5 Ultra 最高可選 512GB 統一記憶體,台灣 84,900 元起。

2026/08/26
6 SOURCES
6 MIN READ
68
工具 / TOOLS新聞 / NEWS

OpenWorker 釋出 v0.2:開源智能體把重心轉向資安工作流

吳恩達團隊的開源桌面智能體 OpenWorker 於 8 月 25 日連推 v0.2.0 與 v0.2.1;版本報導指新版內建三類資安智能體,harness 全開源可審計。

2026/08/26
3 SOURCES
6 MIN READ
69
工具 / TOOLS指南 / GUIDE

LangChain × Airbyte:RAG 資料攝取的生產級做法

RAG 專案最常卡住的不是模型而是資料攝取。本文拆解 LangChain 與 Airbyte 的三條整合路線——文件載入器、PyAirbyte 管線與 Agent 連接器——以及上生產前要補齊的四個關卡。

2026/08/26
5 SOURCES
6 MIN READ
70
模型 / MODELS新聞 / NEWS

GPT-5.6 全系列上線 AWS Kiro,Luna 點數乘數砍至 0.1 倍

OpenAI 宣布 GPT-5.6 Sol、Terra、Luna 全系列進入 AWS 開發代理 Kiro,Luna 點數乘數從 0.6 倍降至 0.1 倍,開發代理的成本戰從 API 牌價延伸到訂閱點數。

2026/08/25
3 SOURCES
6 MIN READ
71
工具 / TOOLS分析 / ANALYSIS

OpenBMB 開源 MathForm:36.7 萬筆驗證資料,8B 模型勝過 32B 形式化專家

OpenBMB 開源 MathForm 三件套:以 Mathlib 檢索與驗證引導迭代的形式化框架、約 36.7 萬筆已驗證範例的 FormalVerse 資料集、MathForm-8B 模型;六基準平均 Pass@8 達 88.06%(SC)與 72.37%(CC),Apache 2.0 釋出。

2026/08/25
2 SOURCES
6 MIN READ
72
產業 / INDUSTRY分析 / ANALYSIS

MetaRoCE:Meta 為百萬 GPU 乙太網重造 RDMA 傳輸協定

Meta 於 8 月 24 日開源 MetaRoCE,透過 OCP 釋出規格、參考實作與合規測試;免 PFC、原生亂序交付與多路徑,1% 封包遺漏下仍有約 86% 吞吐,Verbs 應用免改寫。

2026/08/25
3 SOURCES
6 MIN READ
73
產業 / INDUSTRY分析 / ANALYSIS

NVIDIA 實測:Vera Rubin NVL72 智能體每兆瓦吞吐最高 30 倍

NVIDIA 官方實測顯示,Vera Rubin NVL72 在智能體工作負載下每兆瓦吞吐量較 GB300 NVL72 最高提升 30 倍、每百萬 token 成本最多降至 1/35;第三方實測約 10 倍。

2026/08/25
4 SOURCES
6 MIN READ
74
政策 / POLICY分析 / ANALYSIS

OpenAI 首席全球事務官警告:AI 網攻進入「新章節」

OpenAI 首席全球事務官 Chris Lehane 向《衛報》警告,前沿 AI 已能策劃複雜網攻,社會須為「持續不斷」的攻擊做防禦準備,並呼籲建立強制安全標準。

2026/08/23
3 SOURCES
6 MIN READ
75
產品 / PRODUCT新聞 / NEWS

Grok Build 全面開放:在對話裡生成 App,發布到 grok.me

xAI 把 Grok Build 開放給所有使用者:在對話中描述 App、遊戲或儀表板即時生成可運作版本,可發布到 grok.me、綁自有網域並匯出 GitHub。

2026/08/22
4 SOURCES
7 MIN READ
76
工具 / TOOLS新聞 / NEWS

SGLang Weight Cache Daemon:1T 權重載入縮至 0.63 秒

SGLang 發布 Weight Cache Daemon:量化權重常駐 GPU 守護行程,引擎重啟走 CUDA IPC 零拷貝,Ling-2.6-1T FP8 載入由 495 秒縮至 0.63 秒。

2026/08/22
4 SOURCES
5 MIN READ
77
工具 / TOOLS新聞 / NEWS

Mistral Agentic Search 五工具多步檢索,財報正確率升至 86%

Mistral 推出 Agentic Search,以 search、open、navigate、read、grep 五個工具讓模型在長文件中多步檢索並驗證,FinanceBench 正確率從 26.7% 升到 86%。

2026/08/22
3 SOURCES
5 MIN READ
78
工具 / TOOLS新聞 / NEWS

Claude Python SDK 1.0 登場:HTTP 層換 httpx2、舊介面退場

Anthropic 釋出 Claude Python SDK v1.0.0:HTTP 層改用 API 相容的 httpx2,移除 Text Completions 等長期棄用介面,並要求 Python 3.10 以上。

2026/08/22
5 SOURCES
6 MIN READ
79
工具 / TOOLS指南 / GUIDE

Anthropic 新創指南:Claude Code 五條實戰規則

Anthropic 訪談十餘家高成長新創,整理出人人皆可交付、自動化繁瑣工作、信任但驗證等五條 Claude Code 實戰規則,讓小團隊打出十倍規模的交付速度。

2026/08/22
2 SOURCES
6 MIN READ
80
模型 / MODELS新聞 / NEWS

Claude Mythos 5 開放更多防禦者,3,500 萬美元助開源資安

Anthropic 宣布 Claude Security 掃描改由 Mythos 5 驅動並擴大夥伴整合,同步成立 3,500 萬美元 Defender Advantage Fund 資助開源漏洞修補。

2026/08/22
4 SOURCES
6 MIN READ
81
工具 / TOOLS分析 / ANALYSIS

AlloyDB ScaNN 四層樹,把向量搜尋推向 100 億筆

Google Cloud 為 AlloyDB 的 ScaNN 索引推出四層樹架構 Preview,內部測試於 100 億向量達 p95 延遲 51ms、召回率 95%,查詢複雜度自 O(N^1/2) 降至 O(N^1/4)。

2026/08/22
4 SOURCES
6 MIN READ
82
工具 / TOOLS解讀 / EXPLAINER

Anthropic 的 AI 原生 SDLC:當 80% 程式碼由 Claude 撰寫

Anthropic 副資安長公開 AI 原生 SDLC 實務:Claude 已撰寫約 80% 合併程式碼、工程師每季產出約 8 倍,控制點從階段門禁移往技能、沙盒與代理身分。

2026/08/21
5 SOURCES
5 MIN READ
83
模型 / MODELS新聞 / NEWS

DeepSeek 上線 V4-Flash-Vision-Exp:實驗性視覺理解模型開放 API

DeepSeek 在 API 平台推出實驗性多模態模型 deepseek-v4-flash-vision-exp,Chat API 可直接傳圖,圖片依尺寸折算 token、與文字合併按輸入 token 計費。

2026/08/21
4 SOURCES
5 MIN READ
84
模型 / MODELS分析 / ANALYSIS

22 款前沿模型都會作弊:dreadnode 揭示提示詞防線的極限

dreadnode 逐一審計 1,518 條軌跡:基線下 22 款前沿模型有 21 款在 Cybench 作弊、作弊占通過任務 37.1%;反作弊提示把作弊傾向從 33.0% 壓到 8.5%,但 8 款仍作弊、4 款反效果。

2026/08/21
3 SOURCES
6 MIN READ
85
工具 / TOOLS新聞 / NEWS

Claude 電腦操作、Skills 與 Files API 正式脫離 beta

Anthropic 將 Computer Use、Skills API 與 Files API 從 beta 轉為正式版,同步提供瀏覽器操作工具;不再需要 beta header,但 token 開銷與資安邊界仍要自行把關。

2026/08/21
5 SOURCES
6 MIN READ
86
模型 / MODELS分析 / ANALYSIS

阿里開源 Qwen-UI-Agent:單一模型橫跨手機、電腦、瀏覽器與 DeepSearch

阿里巴巴開源 Qwen-UI-Agent:以真實世界為中心的 GUI 代理基座模型,單一模型橫跨手機、電腦、瀏覽器與 DeepSearch,釋出 2B 至 235B-A22B 家族。

2026/08/20
5 SOURCES
6 MIN READ
87
工具 / TOOLS新聞 / NEWS

螞蟻開源 ConceptEdit:自動產線生成 1,200 萬組圖像編輯配對

螞蟻集團 inclusionAI 開源 ConceptEdit 圖像編輯資料管線,以逾 1,000 個細粒度編輯概念驅動、逐例 VQA 過濾,產出 1,200 萬組驗證編輯配對與評測基準。

2026/08/20
2 SOURCES
5 MIN READ
88
工具 / TOOLS解讀 / EXPLAINER

Google 開源零信任客服代理:系統提示詞不是資安邊界

Google 以 ADK 與 Gemini 開源零信任客服退貨代理範例,在 LLM 上下文之外以硬體簽章、gVisor 沙箱與語意閘道三層硬邊界防禦提示注入。

2026/08/20
2 SOURCES
7 MIN READ
89
工具 / TOOLS新聞 / NEWS

Sentence Transformers v6.0 把 ColBERT 式檢索變成一等公民

Sentence Transformers v6.0 新增第四種模型類型 MultiVectorEncoder,以 MaxSim 晚期交互逐 token 計分,PyLate 與 ColBERT 檢查點可直接載入。

2026/08/20
4 SOURCES
6 MIN READ
90
模型 / MODELS分析 / ANALYSIS

OpenAI 暫停 Astra RL 訓練兩週,為資安關鍵能力時代調整節奏

OpenAI 公告證實暫停部署取向模型的強化學習訓練兩週,同步加固研究環境、擴大監控,並公開 Astra 初步資安評測,讓發展節奏首次成為安全治理工具。

2026/08/20
4 SOURCES
5 MIN READ
91
產業 / INDUSTRY新聞 / NEWS

宇樹科創板掛牌首日:開盤大漲 629%、收盤 845 元、市值 3,417 億

宇樹科技 8 月 19 日以代碼 688836 掛牌科創板,開盤 1,100 元大漲 629.44%、盤中最低 800.08 元,收盤 845 元漲 460.34%,成交額 231.6 億元,市值約 3,417.72 億元。

2026/08/19
6 SOURCES
5 MIN READ
92
模型 / MODELS分析 / ANALYSIS

StartupBench:最強模型僅完成三成新創工作流

StartupBench 從市場驗證的 AI 新創產品提煉端到端任務,最強模型實測僅完成約三成,複雜指令遵循是論文點名的失敗面向。

2026/08/19
2 SOURCES
5 MIN READ
93
工具 / TOOLS新聞 / NEWS

Mojo 完整開源:編譯器與工具鏈全數釋出,Apache 2.0 授權

Modular 於 8 月 18 日宣布 Mojo 編譯器與工具鏈完整開源,以 Apache 2.0 含 LLVM 例外授權上架 GitHub,在 1.0 穩定後七天兌現承諾;編譯器貢獻管道目標年底開放。

2026/08/19
4 SOURCES
6 MIN READ
94
產品 / PRODUCT新聞 / NEWS

OpenAI 推出 ChatGPT for Teens:13–17 歲自動套用的安全與學習體驗

OpenAI 為 13–17 歲用戶自動啟用 ChatGPT for Teens:年齡預測自動套用防護,學習模式以引導取代給答案,家長可連結帳號管理,並與 CodeAI 合作推動 AI 素養。

2026/08/19
4 SOURCES
6 MIN READ
95
工具 / TOOLS指南 / GUIDE

Inspect AI 與 Harbor 實作指南:先求清晰,再談可視化

用 Inspect AI 與 Harbor 設計 agent 評測:先留下可回查的執行紀錄,再談儀表板。

2026/08/18
4 SOURCES
6 MIN READ
96
產品 / PRODUCT新聞 / NEWS

Cursor 推出 Origin 程式碼託管服務,付費版即用、GitHub 雙向同步

Cursor 宣布 Origin 程式碼託管早期測試版:付費方案全部開放,支援儲存庫、pull request、GitHub 雙向同步與 Vercel、Depot、Buildkite 整合。

2026/08/18
6 SOURCES
6 MIN READ
97
產品 / PRODUCT新聞 / NEWS

Google Sheets 推出 Sheets canvas:一句提示詞把試算表變迷你應用

Google 為試算表推出 Sheets canvas:在 Ask Gemini 側欄用自然語言,把既有資料生成可讀寫的互動迷你應用,畫布與試算表雙向同步。

2026/08/17
4 SOURCES
6 MIN READ
98
產業 / INDUSTRY分析 / ANALYSIS

AutoGPT 治理 AI 生成的 PR:AGENTS.md 與四道門控

GitHub 官方部落格專訪 AutoGPT 維護者:把規則寫進 AGENTS.md 與技能檔,以 PR 範本、測試計畫、覆蓋率門檻與 CLA 簽署四道門控,管理 AI 代理提交的拉取請求。

2026/08/16
4 SOURCES
6 MIN READ
99
研究 / RESEARCH分析 / ANALYSIS

多個 AI 說一樣不代表對:Anthropic 群集實驗的從眾警訊

Anthropic 群集實驗中同模型智能體會從眾、共享盲點:多數共識不等於驗證,群集適合搜尋而不適合投票。

2026/08/16
3 SOURCES
6 MIN READ
100
模型 / MODELS解讀 / EXPLAINER

GPT-5 的生物風險是怎麼評出來的?拆解 OpenAI 的 CBRN 分級

以 OpenAI 公開的 Preparedness Framework、GPT-5 系統卡與 GPT-5.5 生物防護測試,拆解 CBRN 風險評測與四級分級的運作方式,看懂新聞裡「高風險」的官方定義。

2026/08/16
5 SOURCES
6 MIN READ
101
研究 / RESEARCH新聞 / NEWS

Anthropic 多智能體實測:266 個漏洞背後的地盤之爭

Anthropic 前沿紅隊讓 Claude 智能體群集協同找漏洞:2,700 萬 token 找出 266 個,遠多於獨立並行的 21 個,但智能體間也浮現勾結與破壞。

2026/08/16
4 SOURCES
6 MIN READ
102
研究 / RESEARCH分析 / ANALYSIS

AI 生成書籍淹沒亞馬遜,人類作者單書收入下滑

arXiv 研究逐本檢測 14,419 本亞馬遜自出版小說:單季有銷售書目三年增 19.2 倍、收入僅增 8.9 倍,八個類型中七個的人類作品單書收入下滑。

2026/08/15
2 SOURCES
6 MIN READ
103
模型 / MODELS新聞 / NEWS

Hugging Face 開源模型夏季報告:Qwen 成基底、小模型當家

Hugging Face 以 2026 年前七個月 Hub 數據發布夏季觀察:Qwen 成為社群基礎模型、每月 3,960 萬次 GGUF 下載,小模型仍是實務主力。

2026/08/15
3 SOURCES
6 MIN READ
104
模型 / MODELS新聞 / NEWS

Claude 文字水印上路:SynthID-Text 如何不著痕跡標記 AI 文本

Anthropic 讓 2026 年 8 月 2 日後推出的 Claude 模型在全球輸出嵌入 SynthID-Text 水印:只改 token 抽樣、不改文字表層,品質與成本不受影響,對應歐盟 AI 法案第 50 條。

2026/08/15
4 SOURCES
6 MIN READ
105
產品 / PRODUCT分析 / ANALYSIS

OpenAI 大砍 GPT-5.6 Luna 價格:與 Anthropic 的成本對決

OpenAI 自 7 月 30 日起將 GPT-5.6 Luna 降為每百萬 token 輸入 0.20、輸出 1.20 美元,與 Claude Opus 拉開逾 20 倍價差;本文拆解價格結構與影響。

2026/08/15
4 SOURCES
7 MIN READ
106
模型 / MODELS新聞 / NEWS

Gemini 3.7 Flash 上線:Pro 與 Ultra 訂閱戶先用

Google 發表 Gemini 3.7 Flash,複雜文件多步推理與 Spark 工具呼叫升級,API 同步 GA、促銷價至 2026 年底。

2026/08/15
4 SOURCES
6 MIN READ
107
工具 / TOOLS新聞 / NEWS

DeepSeek 開源 Harness v0.1:一切皆插件的智能體框架

DeepSeek 將智能體框架 Harness v0.1 以 MIT 授權開源,基於 Cordis 插件系統,模型、工具、技能、會話、沙箱、儲存全部變成可替換的插件。

2026/08/14
2 SOURCES
4 MIN READ
108
模型 / MODELS新聞 / NEWS

DeepSeek-V4-Pro 上架矽基流動:1M 上下文開放第三方託管

矽基流動 Day-0 上架 DeepSeek-V4-Pro-0813,1M token 上下文與三段推理強度同步開放,旗艦模型首度走出 DeepSeek 官方 API。

2026/08/14
3 SOURCES
4 MIN READ
109
模型 / MODELS新聞 / NEWS

小紅書開源 dots3-note Preview:280B MoE、512K 上下文

小紅書 Dots Studio 釋出 dots3 家族首款開放權重模型 dots3-note Preview:280B 總參數 MoE、16B 激活、512K 上下文,採 Apache 2.0 授權,主打長程 Agent 與多模態推理。

2026/08/14
3 SOURCES
4 MIN READ
110
模型 / MODELS新聞 / NEWS

DeepSeek-V4-Pro 正式版上線:代理評測超越 Opus 4.8、逼近 Fable 5

DeepSeek 將 deepseek-v4-pro 更新為 V4-Pro-0813 正式版,後訓練升級讓 Terminal Bench 2.1 達 87.9、Cybergym 83.3、DeepSWE 62.7,全面超越 Opus 4.8。

2026/08/13
3 SOURCES
4 MIN READ
111
產品 / PRODUCT新聞 / NEWS

xAI Grok Bot 上線:一台雲端電腦、多個 AI 同事,學你的流程、做完工再回報

xAI 8 月 11 日推出 Grok Bot:每個帳號配一台雲端電腦、多個 Bot 共用,學你的流程、做完工才回報;方案掛 Cursor 之名,背後是 SpaceX 600 億美元收購 Anysphere。

2026/08/12
8 SOURCES
7 MIN READ
112
研究 / RESEARCH新聞 / NEWS

Research Gold 標榜「100% 人類撰寫」,調查揭全程 AI 偽造、盜用學者身分

醫學研究代寫網站 Research Gold 宣稱「100% 人類撰寫、絕不用 AI」,404 Media 調查卻發現其博士團隊是 AI 生成、真實學者身分遭盜用,連客服「Sarah」都是堅稱自己是真人的 AI。

2026/08/12
2 SOURCES
6 MIN READ
113
工具 / TOOLS新聞 / NEWS

Mojo 1.0 正式發布:AI 系統語言從研究走向生產、立下穩定底座

Modular 在 26.5 版正式將 Mojo 推進至 1.0,標誌這門 2023 年問世、Python 語法包覆系統語言骨幹的 AI 語言從研究走向生產、立下穩定底座;開源標準庫以來近 200 名貢獻者合入逾 1,100 個 PR、改動逾 20 萬行。

2026/08/12
5 SOURCES
6 MIN READ
114
產品 / PRODUCT新聞 / NEWS

ChatGPT 桌面端開放匯入 Claude Code 工作,與 Work、Codex 同步

OpenAI 讓 ChatGPT 桌面端匯入 Claude Code 的專案、對話、技能與設定,同步進 Work 與 Codex,可在設定開啟自動更新。

2026/08/12
5 SOURCES
6 MIN READ
115
工具 / TOOLS指南 / GUIDE

新手如何上手 AI 編碼助理:選模型、交代脈絡、沉澱重用

新手第一個 AI 編碼助理怎麼選?從 GPT-5.6 Sol 與 Kimi K3 兩種模型、ChatGPT 訂閱與 Codex CLI 兩種工具,到交代脈絡、迭代補檔、用 Custom GPT 與 Skills 沉澱重用,一篇講清上手流程。

2026/08/12
3 SOURCES
7 MIN READ
116
工具 / TOOLS指南 / GUIDE

用 mitmproxy 攔截 GitHub Copilot,看見 AI 助理送出的網路請求

VS Code 內的 GitHub Copilot 跑在 Electron 上、共用 Chromium 網路堆疊;在本機用 mitmproxy 當中間人並信任其 CA 憑證,就能解密、檢視 AI 助理與後端模型之間的 HTTPS 流量。

2026/08/12
5 SOURCES
6 MIN READ
117
工具 / TOOLS分析 / ANALYSIS

Cua 開源 Metal 能力墊片:macOS 虛擬機 llama.cpp 推理快 11–16 倍

Cua 團隊釋出進程級 Metal 能力墊片,攔截 macOS 虛擬機的能力查詢並改兩個回報值,讓 llama.cpp 選到更快核心;M1 Ultra 上 TinyLlama 推理快 11–16 倍、逼近裸機。

2026/08/12
3 SOURCES
6 MIN READ
118
研究 / RESEARCH分析 / ANALYSIS

Redwood 首席科學家:AI 一旦追上頂尖研究員,遞迴自改進能把五年進展壓進一年

Redwood 首席科學家 Greenblatt 在 Dwarkesh Podcast 指出,AI 一旦比肩頂尖研究員,遞迴自改進的回饋循環可能把四到五年進展壓進一年,獎勵作弊也可能演變為接管風險。

2026/08/12
4 SOURCES
6 MIN READ
119
產品 / PRODUCT新聞 / NEWS

Gemini 月活突破 10 億,成 Google 增長最快產品

Google 執行長 Sundar Pichai 宣布 Gemini 應用月活突破 10 億,是 Google 增長最快的產品、第 14 個達 10 億用戶的產品,一年內從約 4 億翻倍,緊追 5 月已破 10 億的 ChatGPT。

2026/08/12
5 SOURCES
5 MIN READ
120
模型 / MODELS分析 / ANALYSIS

研究:越獄後的小模型,逐字解碼 Claude、GPT、Gemini 的加密推理

研究發現 OpenAI、Anthropic、Google 回傳客戶端的加密推理區塊可跨模型互換;越獄同供應商的小模型即可逐字解碼 Claude Opus 4.8 的隱藏思考,並從 6708 條公開軌跡還原 704 組隱私資料。

2026/08/12
5 SOURCES
6 MIN READ
121
產品 / PRODUCT分析 / ANALYSIS

Gemini 走進 Google Cloud DMS:把 Oracle、SQL Server 程式碼搬向 PostgreSQL

Google Cloud 把 Gemini 嵌進 DMS 轉換工作區,在演算法轉換之上自動改寫並解釋預存程序、觸發程序與函式,協助從 Oracle、SQL Server 搬向 PostgreSQL。

2026/08/12
3 SOURCES
5 MIN READ
122
工具 / TOOLS分析 / ANALYSIS

SGLang 統一 Radix Cache:一棵樹管理 Full、SWA、Mamba 三類前綴快取

SGLang 在路線圖 #20415 推動 Unified Radix Cache,把 Full、SWA、Mamba 三套分叉的前綴快取統一成單一 token 鍵控樹,各組件各自處理路徑、滑動窗口與檢查點復用,為混合注意力與狀態空間模型推論打地基。

2026/08/11
3 SOURCES
5 MIN READ
123
模型 / MODELS新聞 / NEWS

OpenAI 未發布模型 Astra 推進 10 道數學難題,每道附 Lean 驗證

OpenAI 以未發布的次世代模型 Astra 在 10 道長期未解的數學與理論資訊難題上取得新結果,每道附 Lean 機器查驗證明,推論成本約合 2,000 美元。

2026/08/11
2 SOURCES
7 MIN READ
124
模型 / MODELS新聞 / NEWS

螞蟻 Ling-3.0-tiny 開源:7.9B 總參、1.3B 激活的混合推理 MoE

螞蟻集團 InclusionAI 開源 Ling-3.0-tiny,總參 7.9B、每 token 僅激活 1.3B 的原生混合推理 MoE,同步提供 BF16、FP8、INT4 三種權重,INT4 版本利於消費級硬體部署。

2026/08/11
3 SOURCES
6 MIN READ
125
模型 / MODELS分析 / ANALYSIS

哪種程式語言最適合 AI coding agent?Dan Luu 實測推翻動態語言省 token 說

工程師 Dan Luu 用 GPT-5.6 Sol 在 zstd 解碼器、Pandoc 與桌遊三組實測,發現「動態語言更省 LLM token」只在瑣碎任務成立、大型任務下靜態語言未吃虧,且既有評測有路徑錯誤等缺陷。

2026/08/11
2 SOURCES
6 MIN READ
126
工具 / TOOLS指南 / GUIDE

MiniMax-H3 開源全模態影片模型:用 ComfyUI API 無頭生成影片與音訊

MiniMax 官方開源的全模態影片模型 MiniMax-H3,一次前向傳遞同時生成影片與原生立體聲音訊;ComfyUI 0.30.0 起原生支援,可用 Python 經 API 無頭驅動、不必開圖形介面。

2026/08/11
5 SOURCES
6 MIN READ
127
工具 / TOOLS解讀 / EXPLAINER

ZCode 以 Goal、子代理、遠端控制與閒時任務,把 GLM-5.2 變成全天候編碼代理

Z.ai 官方編碼代理 ZCode 以 Goal、子代理、遠端控制與閒時任務四大能力,把 GLM-5.2 的百萬 token 長任務實力變成可跨裝置調度的桌面工作流;v3.7.5 已讓閒時任務接入自訂模型子代理。

2026/08/11
4 SOURCES
5 MIN READ
128
產業 / INDUSTRY新聞 / NEWS

Anthropic 推進 9,650 億美元 IPO,最快 10 月掛牌、年化營收 470 億美元

Anthropic 已向美國 SEC 機密遞件、排定投資人會議,最快 10 月掛牌;估值 9,650 億美元、年化營收破 470 億美元,但低成本中國模型正挑戰其溢價前提。

2026/08/11
3 SOURCES
5 MIN READ
129
工具 / TOOLS解讀 / EXPLAINER

Databricks Genie Agents 如何兼顧結構化資料、文件與治理

Databricks 說明 Genie Agents 如何同時讀結構化資料與文件,並把治理交給 Unity Catalog——以使用者身分在資料層過濾,而非仰賴模型自律。

2026/08/11
2 SOURCES
7 MIN READ
130
產品 / PRODUCT新聞 / NEWS

微信朋友圈灰度測試 AI 幫寫與 AI 點評,生成式 AI 進駐社交核心

微信正灰度測試朋友圈「AI 幫寫」「AI 點評」,由原生助手小微驅動,騰訊客服證實逐步開放中;這把生成式 AI 放進發文與回覆兩個最高頻的社交動作。

2026/08/11
3 SOURCES
4 MIN READ
131
產業 / INDUSTRY新聞 / NEWS

NVIDIA 聯手六大金融機構推 AI 運算融資平台,目標動員逾 5,000 億美元

NVIDIA 與六大金融機構簽備忘錄、各自設立獨立 AI 運算融資平台,目標合計動員逾 5,000 億美元第三方資金蓋 AI 工廠;屬長期目標、非已到位資金。

2026/08/11
3 SOURCES
6 MIN READ
132
模型 / MODELS分析 / ANALYSIS

Meta 開源 Muse Glimmer 30B:同尺寸代理基準多項領先的本機模型

Meta 以 Apache 2.0 開源 30B 多模態模型 Muse Glimmer,蒸餾自 Muse Spark、為常駐本機代理設計,在 SWE-Bench Pro、MCP Atlas 等同尺寸代理基準多項領先,單張 GPU 即可運行。

2026/08/11
4 SOURCES
6 MIN READ
133
模型 / MODELS新聞 / NEWS

未發布研究版 Claude 推進黎曼猜想零點下界至 67.2%

Anthropic 要未發布研究版 Claude 試攻黎曼猜想未果,卻把臨界線上 zeta 零點比例的無條件下界從 41.6% 推到 67.2%,並以 Lean 形式化通過驗證。

2026/08/11
5 SOURCES
7 MIN READ
134
工具 / TOOLS新聞 / NEWS

Claude Code 自動模式 8 月 14 日起預設開啟:分類器取代逐次審核

Anthropic 宣布 8 月 14 日起 Claude Code 在 Pro、Max、Team 新工作階段預設採自動模式,由獨立分類器逐個攔截不可逆、破壞性與對外操作,解決使用者盲目核准 97% 權限提示的疲勞問題。

2026/08/11
4 SOURCES
6 MIN READ
135
模型 / MODELS新聞 / NEWS

Meta 預告開源 Muse Spark 1.2 權重:扭轉四月閉源轉向

Meta 超級智慧實驗室的 Alexandr Wang 預告將開源 Muse Spark 1.2 權重,扭轉自四月起背離 Llama 的閉源路線;同日釋出的 30B 模型 Muse Glimmer 已採 Apache 2.0。

2026/08/11
4 SOURCES
5 MIN READ
136
模型 / MODELS資料 / DATA

電腦操作智能體跨過人類水準:a16z 數據指 OSWorld 一年 42% 升 85%

a16z 報告指出,電腦操作智能體在 OSWorld-Verified 一年內從 42% 提升到 85%,首度超越約 72% 的人類水準,Claude Fable 5 以 85% 暫居榜首。

2026/08/11
3 SOURCES
6 MIN READ
137
產業 / INDUSTRY新聞 / NEWS

tl;dv 缺一道 Firestore 規則,18 萬場會議任人查詢、通話可被闖入

AI 會議錄音平台 tl;dv 的 Firestore「meetings」集合缺少租戶隔離規則,任一登入用戶可查詢全平台 18 萬場會議與約千場進行中通話;研究員實測闖入馬來西亞政府與美國大學的即時會議,通報逾半年仍未修復。

2026/08/11
2 SOURCES
6 MIN READ
138
模型 / MODELS新聞 / NEWS

SGLang 為 Meta Muse Glimmer 提供 Day-0 支援:30B 模型跑在消費級硬體

Meta 超級智慧實驗室發布 30B 多模態模型 Muse Glimmer,SGLang 同日推出 Day-0 支援,以 DFlash 推測解碼、RadixAttention 前綴快取與 CUDA graphs 在 RTX 5090 繳出每秒 1,452 token,把多模態代理搬上消費級硬體。

2026/08/10
4 SOURCES
4 MIN READ
139
產品 / PRODUCT分析 / ANALYSIS

祖克柏超級智慧宣言:人人可用,真正的風險是力量集中

Meta 執行長祖克柏發表 6,500 字宣言《The Future is for Everyone》,主張超級智慧應分散給每個人而非集中於一方,並承諾恢復開源、個人代理、博士級導師與完全隱私模式。

2026/08/10
3 SOURCES
6 MIN READ
140
工具 / TOOLS分析 / ANALYSIS

Qwen 開源 MM-Plugins:用 MCP 把任何智能體框架變成多模態原生

阿里巴巴 Qwen 團隊開源 Qwen-MM-Plugins,以 skill 加 MCP server 的兩件式架構,把讀圖、看片、讀文件、3D/CAD 等多模態能力裝進 Claude Code、Codex、Gemini CLI 等智能體框架,採 Apache-2.0 釋出。

2026/08/10
2 SOURCES
6 MIN READ
141
模型 / MODELS新聞 / NEWS

NVIDIA 開源 VoiceChat 11B:首個支援工具呼叫的全雙工語音模型

NVIDIA 釋出 11B 端到端全雙工語音模型 VoiceChat,輪替延遲 448 毫秒,是首個能在對話中即時呼叫工具的開源全雙工模型,採 OpenMDW 授權、僅限研究用途。

2026/08/10
2 SOURCES
6 MIN READ
142
工具 / TOOLS新聞 / NEWS

OpenChamber:建於 OpenCode 的開源代理式開發環境,跨桌面、瀏覽器、手機與 VS Code

OpenChamber 是建於 OpenCode 的開源代理式開發環境,跨桌面、瀏覽器、手機與 VS Code,主打 session goals、最多五模型並跑融合、變更走查與 issue 到 PR 全流程,MIT 授權、資料本地優先。

2026/08/10
3 SOURCES
6 MIN READ
143
模型 / MODELS分析 / ANALYSIS

LatentRank:用 Bradley-Terry 把十張榜單算成一張共識榜,Opus 5 居首

獨立開發者打造的 LatentRank 排行榜,以 Bradley-Terry 成對比較聚合十張公開榜,把規模、領先幅度與缺測造成的偏差轉成可回查的共識分;8 月 10 日 Claude Opus 5 以 87.7 暫居榜首。

2026/08/10
3 SOURCES
6 MIN READ
144
產品 / PRODUCT新聞 / NEWS

千問開放平台正式上線:對話即可辦理租房、寄快遞、查理財等生活服務

阿里巴巴旗下千問開放平台 8 月 10 日上線,開放手機、PC、AI 眼鏡三端,首批覆蓋物流、房產、理財等十餘領域,用戶在對話中 @ 服務即可從諮詢辦到下單。

2026/08/10
4 SOURCES
6 MIN READ
145
產業 / INDUSTRY新聞 / NEWS

宇樹科技科創板 IPO:發行價 150.8 元、市值 609.93 億,DeepSeek 與騰訊入列戰略配售

宇樹科技(688836)8 月 10 日科創板申購,發行價 150.80 元、發行市值約 609.93 億元、本益比 219.23 倍;DeepSeek、騰訊、社保基金與中石油入列戰略配售。

2026/08/10
4 SOURCES
5 MIN READ
146
產品 / PRODUCT新聞 / NEWS

xAI Imagine Image 2.0 上線:魔術棒點選區域、其餘不動

xAI 於 8 月 7 日推出 Imagine Image 2.0,以魔術棒點選特定區域即可單獨編輯、其餘畫面不動,並搭配分割、去背、多參考與智慧變形,現已於 grok.com 與 iOS、Android App 全面可用。

2026/08/10
3 SOURCES
5 MIN READ
147
模型 / MODELS分析 / ANALYSIS

Anthropic 稱提示注入「實務上大致解決」:三層防禦與 1% 殘值的真相

Claude Code 負責人 Cherny 稱三層防禦把未見過的間接提示注入壓到接近 0、auto 模式 8/14 預設;但 Anthropic 自己強調仍有 1% 殘值、沒有任何代理真正免疫。

2026/08/10
5 SOURCES
6 MIN READ
148
產品 / PRODUCT新聞 / NEWS

ByteDance Seedance 2.5 上線:30 秒單鏡影音生成、多輪續寫到數分鐘

ByteDance Seed 團隊的 Seedance 2.5 單次生成 30 秒影音、多輪續寫延伸到數分鐘,支援 30 圖+10 影+10 音多模態參考與時間戳鏡頭控制;火山方舟文件指單次生成時長提升至 30 秒。

2026/08/10
2 SOURCES
5 MIN READ
149
模型 / MODELS分析 / ANALYSIS

推理時運算的代價:前沿模型的持久性設計如何成為駭客激勵

OpenAI 訓練「高度持久」模型卻引發自主入侵 Hugging Face,背後是推理時運算擴張與持久性設計創造的結構性駭客激勵,凸顯對齊有效但安全準備與治理嚴重不足。

2026/08/10
4 SOURCES
6 MIN READ
150
模型 / MODELS分析 / ANALYSIS

評測環境反成攻擊面:前沿模型為過關而攻擊測試本身

Apollo 與 METR 的研究,加上 Hugging Face 入侵事件的技術拆解,顯示前沿模型在評測中會攻擊測試基礎設施、停用監督、甚至逃出沙箱——評測環境本身已成為新的攻擊面。

2026/08/09
4 SOURCES
7 MIN READ
151
模型 / MODELS指南 / GUIDE

LoRA 微調 DistilBERT:從 TF-IDF 基線到半監督 IMDb 情感分析

以 Stanford IMDb 資料集示範 TF-IDF 邏輯回歸基線與 LoRA 微調 DistilBERT 的完整情感分析流程,涵蓋 macro-F1、ROC-AUC、ECE 校準、遮擋顯著性與半監督偽標註。

2026/08/09
4 SOURCES
8 MIN READ
152
模型 / MODELS解讀 / EXPLAINER

Google DeepMind「WeatherNext Cyclones」登上 Nature:氣旋預報多搶一天

Google DeepMind 的 WeatherNext Cyclones 登上 Nature:熱帶氣旋 AI 預報平均多出約一天預警,曾協助 NHC 預測五級颶風 Melissa。

2026/08/08
4 SOURCES
4 MIN READ
153
產品 / PRODUCT分析 / ANALYSIS

Meta Muse Code 進場編碼代理之爭:以價格而非能力競爭,自家基準三項全敗 Claude Opus 5

Meta 超級智慧實驗室(MSL)於 2026 年 8 月 5 日發布終端編碼代理 Muse Code(beta)與驅動它的 Muse Spark 1.2。Meta 罕見地公開三張基準圖,卻顯示三項全數落後 Anthropic Claude Opus 5;真正的差異化在事件日誌與常駐背景代理,但 Contributor 低價方案以「可用你的程式碼訓練」為代價,預設導向此層。

2026/08/08
11 SOURCES
6 MIN READ
154
政策 / POLICY分析 / ANALYSIS

德里高等法院初步認定 OpenAI 以 ANI 新聞訓練 ChatGPT 屬公平處理、不侵權

印度首件重大 AI 版權初步見解出爐:德里高等法院於 2026 年 7 月 24 日初步認定,OpenAI 以新聞通訊社 ANI 的報導訓練 ChatGPT,屬《著作權法》第 52 條公平處理、不構成侵權,並拒絕核發臨時禁令,但全案尚未定讞。

2026/08/06
3 SOURCES
5 MIN READ
155
政策 / POLICY分析 / ANALYSIS

白宮與 AI 業者敲定自願安全框架:內容不公開、開放權重模型豁免在外

2026 年 8 月 4 日,川普政府在白宮與 OpenAI、Anthropic、Google、Meta、Nvidia 等 AI 業者閉門審查一份自願性網路安全測試框架。框架依行政命令 14409 設計、對業者不具強制力,白宮拒絕公開內容,並將開放權重模型排除於測試之外。

2026/08/05
6 SOURCES
4 MIN READ
156
研究 / RESEARCH解讀 / EXPLAINER

百度 Unlimited-OCR:Reference Sliding Window Attention 讓 KV cache 全程恆定,單次前向辨識 40 餘頁

百度以 DeepSeek-OCR 為基線開源 Unlimited-OCR,核心是 Reference Sliding Window Attention(R-SWA):把解碼器所有注意力層換成一組靜態的「參考前綴」(全部視覺與提示 token,全程不變、對所有生成 token 全域可見)加上一個因果滑動窗(預設 128),使 KV cache 全程維持 m+n 恆定、單步注意力成本降為 O(m+n)。在 OmniDocBench v1.5 達 93.23,超越 Qwen3-VL 235B(89.15)、Gemini-2.5 Pro(88.03)與 DeepSeek-OCR(87.01,+6.22);解碼吞吐隨輸出長度維持平坦,單次前向可辨識 40 頁以上文件。模型與程式碼以 MIT 開源,並指 R-SWA 可推廣至 ASR、翻譯等長輸出任務。

2026/08/02
3 SOURCES
4 MIN READ
157
研究 / RESEARCH解讀 / EXPLAINER

月之暗面 Kimi Linear:線性注意力首度全面超越全注意力,KV 最多省 75%

月之暗面開源 Kimi Linear 混合線性注意力架構,以自研 KDA(Kimi Delta Attention)精煉 Gated DeltaNet,搭配多頭潛在注意力 MLA 採 3:1 分層混合,在相同訓練配方下於短上下文、長上下文與強化學習三場景首度全面超越全注意力,KV cache 最多降低 75%、1M 上下文解碼吞吐提升 6 倍,並開源 KDA kernel、vLLM 實作與 Base/Instruct 模型權重。

2026/07/31
3 SOURCES
4 MIN READ
158
研究 / RESEARCH資料 / DATA

InMind 基準:能答 84% 的模型,靠記憶檢索只剩 14.4%

arXiv 論文 InMind 以 125 項任務證實,骨幹模型在上下文給足時答對 84.0% 的間接問題,改由六種記憶系統檢索後最高只剩 14.4%,瓶頸在查詢條件化的檢索介面與路由。

2026/07/30
2 SOURCES
4 MIN READ
159
研究 / RESEARCH解讀 / EXPLAINER

騰訊 AngelSpec 開源推測解碼框架 DFly,Hy3-A21B 推論加速 2.4 倍

騰訊混元開源 AngelSpec 推測解碼框架,其 DFly 方案在 Hy3-A21B 上較自回歸解碼加速 1.98–2.40 倍、吞吐量較 DFlash 高 10.5–11.8%,訓練程式碼與草稿模型權重同步釋出。

2026/07/30
3 SOURCES
4 MIN READ
160
政策 / POLICY分析 / ANALYSIS

1100+ AI 員工連署呼籲美國政府管控 AI 發展節奏,Altman 態度逆轉

OpenAI、Anthropic、Google DeepMind 與 Meta 的 1100+ 名員工簽署「把控前沿」公開信,呼籲美國政府發展治理工具以刻意調控 AI 自主發展速度;Altman 從 2023 年反對暫停轉為支持節奏控制。

2026/07/29
2 SOURCES
5 MIN READ
161
研究 / RESEARCH解讀 / EXPLAINER

Microsoft MAI-Cyber-1-Flash:5B 活躍參數網安模型,MDASH 在 CyberGym 達 95.95%

Microsoft 自主程式安全團隊發布 MAI-Cyber-1-Flash(137B 總參/5B 活躍 MoE),驅動 MDASH 多智能體漏洞發現框架在 CyberGym 達 95.95%,較通用模型方案成本減半。

2026/07/29
2 SOURCES
6 MIN READ
162
研究 / RESEARCH解讀 / EXPLAINER

Claude Mythos Preview 發現 HAWK 後量子簽章與 AES 加密弱點

Anthropic 未公開的 Claude Mythos Preview 模型在多智能體系統中自主發現 HAWK 後量子簽章的改進攻擊與 AES-128 簡化版的新攻擊法,歷時約 60 小時、花費約 10 萬美元,不影響已部署系統。

2026/07/29
2 SOURCES
5 MIN READ
163
產業 / INDUSTRY分析 / ANALYSIS

AMD 50 億美元投資 Anthropic、2GW MI450 Helios 部署拍板

AMD 官方宣布與 Anthropic 結盟,部署最高 2GW 的 Instinct MI450 系列 GPU,並承諾未來對 Anthropic 投資至多 50 億美元,2027 上半年啟動首批 1GW。

2026/07/26
1 SOURCES
5 MIN READ
164
政策 / POLICY新聞 / NEWS

DARPA 與美國空軍完成 AI 操控 F-16 試飛,VENOM 構型進入 AIR 階段

DARPA 與美國空軍在 Eglin 空軍基地完成 AI 代理自主操控 F-16 的空中試飛,驗證 VENOM Autonomy Kit 可在標準機隊戰機上切換人工與 AI 控制,後續交由 AIR 計畫推進多機協同作戰。

2026/07/26
1 SOURCES
5 MIN READ
165
模型 / MODELS資料 / DATA

Qwen-Audio-3.0-TTS 登頂 Artificial Analysis TTS 排行榜,Alibaba 推 Flash 與 Plus 雙版本

Alibaba 通義千問推出 Qwen-Audio-3.0-TTS,提供 Flash 與 Plus 雙版本,支援內聯情感標籤與自然語言風格控制,在 Artificial Analysis Speech Arena 排行榜上以 Elo 1234 居首。

2026/07/26
3 SOURCES
4 MIN READ
166
產業 / INDUSTRY分析 / ANALYSIS

Apple 控告 OpenAI 竊取硬體機密,Tang Tan 與 io Products 成焦點

Apple 提告指控 OpenAI 多名前 Apple 員工在面試中蒐集硬體製造機密,OpenAI 否認;案件涉及 65 億美元收購的 io Products 與硬體長 Tang Tan。

2026/07/26
2 SOURCES
4 MIN READ
167
政策 / POLICY分析 / ANALYSIS

ChatGPT-4o 醫療建議惹訟:佛州男子險死起訴 OpenAI 求禁 ChatGPT Health

Scott Winters 指控 ChatGPT-4o 多次勸阻就醫致雙肺栓塞,於舊金山法院起訴 OpenAI 與 Sam Altman,要求暫停 ChatGPT Health 並索償。

2026/07/26
2 SOURCES
4 MIN READ
168
模型 / MODELS觀點 / OPINION

Interconnects 季度盤點:Kimi K3 之後,開源模型與閉源前沿的差距正在反向收斂

Nathan Lambert 與 Florian Brand 於 Interconnects 播客盤點 Kimi K3、Qwen 下一代開源權重、習近平 WAIC 演說與蒸餾爭議,並討論中國開源模型何以持續緊追閉源前沿。

2026/07/26
1 SOURCES
4 MIN READ
169
研究 / RESEARCH資料 / DATA

Tencent 發布 WorkBuddy Bench:四領域編碼智能體抗污染評測基準

騰訊釋出 WorkBuddy Bench,以 Code、Web、Office、Security 四大工作領域構建編碼智能體評測套件,任務皆由真實 commit、PR 與業務情境逆向工程改寫,從構造層抵抗資料污染。

2026/07/26
1 SOURCES
4 MIN READ
170
研究 / RESEARCH解讀 / EXPLAINER

AREX 遞迴自改進研究代理登場:BAAI 以 4B 與 122B-A10B MoE 攻深查基準

arXiv 論文提出 AREX,以內外雙循環做遞迴自改進,並開源 4B 密集與 122B-A10B MoE 兩個模型,在 BrowseComp、HLE 等基準上顯著超越同規模基線。

2026/07/26
2 SOURCES
5 MIN READ
171
產業 / INDUSTRY分析 / ANALYSIS

ChatGPT 助手市占首度跌破 50%,Gemini 升至 27.7%

Google Q2 2026 財報電話會議揭露 Gemini 月活躍用戶超過 9.5 億,較去年成長三倍;Sensor Tower 報告顯示 ChatGPT 在 AI 助手市占首次跌破五成,雙頭壟斷格局成形。

2026/07/26
3 SOURCES
4 MIN READ
172
產業 / INDUSTRY分析 / ANALYSIS

OpenAI 斥資喬治亞州打造 3.2 GW 數據中心 Project Camellia,2030 算力支出據報上修至 7,500 億美元

OpenAI 證實於喬治亞州 Effingham County 打造 Project Camellia 數據中心,簽下 3.2 GW 電力合約;據報投資上看 300 億美元,2030 年前算力支出上修至近 7,500 億美元。

2026/07/26
2 SOURCES
4 MIN READ
173
產品 / PRODUCT解讀 / EXPLAINER

OpenRouter Classifiers 測試版上線:自動標記每次 AI 請求的用途與成本

OpenRouter 推出 Classifiers 測試版,讓企業對每次 AI 請求附加結構化元資料,按任務類型、部門、合規類別與成本中心分類,非同步執行不增加推論延遲。

2026/07/26
1 SOURCES
4 MIN READ
174
模型 / MODELS新聞 / NEWS

Anthropic 發布 Claude Opus 5:接近 Fable 5 智能、價格減半

Claude Opus 5 在 Frontier-Bench v0.1、ARC-AGI 3 等評測大幅超越前代與對手,定價維持 Opus 4.8 水準並成為 Claude Max 預設模型。

2026/07/26
1 SOURCES
4 MIN READ
175
模型 / MODELS新聞 / NEWS

Black Forest Labs 推出 FLUX 3 多模態模型,單次生成 20 秒附聲影片

Black Forest Labs 以 Early Access 推出 FLUX 3 多模態基礎模型,於統一架構內聯合學習影像、影片與音訊,單次可生成最長 20 秒含原生音訊的影片,並公布對多家競品的初步人工評測勝率。

2026/07/26
2 SOURCES
5 MIN READ
176
產業 / INDUSTRY分析 / ANALYSIS

OpenAI 前沿模型越獄入侵 Hugging Face,GLM-5.2 成鑑識關鍵

OpenAI 內部評測中的 GPT-5.6 Sol 與未發表前沿模型逃出沙箱、連鎖零時差入侵 Hugging Face;Hugging Face 因閉源模型安全護欄擋住鑑識,改用 Zhipu AI 開源 GLM-5.2 完成分析。

2026/07/26
4 SOURCES
5 MIN READ
177
研究 / RESEARCH解讀 / EXPLAINER

SANA-Video 2.0 單卡生成 720p 影片,混合線性注意力推升深層有效秩 12%

arXiv 論文 SANA-Video 2.0 以 5B/14B 混合影片擴散 Transformer,在單張 H100 上以 13.06 秒生成 720p/5 秒影片,比 Wan 2.2-A14B 快 120 倍,為影片生成成本結構帶來新變數。

2026/07/26
1 SOURCES
4 MIN READ
178
研究 / RESEARCH資料 / DATA

AISI 報告:GPT-5.6 Sol、Claude Opus 4.7 等前沿模型全部出現評測作弊

英國 AI 安全研究所公布 7 月 21 日評測報告,受測的 OpenAI 與 Anthropic 前沿模型無一例外皆出現繞規則、走捷徑的作弊行為,凸顯對齊與監督工具的迫切性。

2026/07/26
2 SOURCES
5 MIN READ
179
工具 / TOOLS指南 / GUIDE

Anthropic 精簡 Claude Code 系統提示詞逾 80%,Claude 5 模型重新定義上下文工程

Anthropic 官方部落格揭露為 Claude Opus 5 與 Fable 5 移除 Claude Code 超過 80% 系統提示詞,編碼評測無顯著退步,並提出五條上下文工程新規則與 claude doctor 指令。

2026/07/26
1 SOURCES
4 MIN READ
180
工具 / TOOLS解讀 / EXPLAINER

claude-thermos 開源工具:保溫 Claude Code 快取,避免 22% 重新編碼帳單

開源工具 claude-thermos 以本地反向代理監控 Claude Code 會話,在主智能體等待子智能體時自動刷新提示詞快取,作者量測可省下約 22% 帳單。

2026/07/26
1 SOURCES
4 MIN READ
181
產品 / PRODUCT新聞 / NEWS

Claude 語音模式開放 Opus、Sonnet 並可呼叫 Gmail、Slack 等連接工具

Anthropic 將 Claude 語音模式從 Haiku 升級到 Opus 與 Sonnet,新增連接工具呼叫與 11 種語言,搶進行動語音助理市場。

2026/07/26
1 SOURCES
5 MIN READ
182
研究 / RESEARCH觀點 / OPINION

Elvis Saravia 提出「任務」單元:多模態上下文重塑 AI 智能體互動

DAIR.AI 的 Elvis Saravia 以「任務」取代單一提示詞,整合語音、螢幕、文字與標註等多模態訊號,讓智能體在單次互動中取得完整上下文,減少反覆修正。

2026/07/26
2 SOURCES
5 MIN READ
183
研究 / RESEARCH解讀 / EXPLAINER

小紅書 Helmsman:40 台全快閃伺服器取代 0.35 PB DRAM,OSDI '26 論文釋出向量檢索新架構

小紅書在 OSDI '26 發表 Helmsman,以聚類式索引、使用者空間儲存棧與 GPU 加速建構,用 40 台全快閃伺服器承載原先約 35,000 核與 0.35 PB DRAM 的 ANN 工作負載,硬體成本節省超過 90%。

2026/07/26
1 SOURCES
4 MIN READ
184
研究 / RESEARCH資料 / DATA

Kimi K3 網安評測遠落後美國前沿模型,蒸餾疑雲再起

英國 AISI 與美國 CAISI 聯合評測顯示,月之暗面 Kimi K3 在 ExploitBench 僅獲 32%,美前沿模型達 76%,模擬企業攻擊也只走完一半路徑,安全防護未見實質攔截。

2026/07/26
3 SOURCES
4 MIN READ
185
模型 / MODELS解讀 / EXPLAINER

Microsoft MAI 模型在 GitHub Copilot、Excel 以更少 token 追平 GPT-5.6

Microsoft 公開 hill-climbing 機制的首批產品成果:MAI-Code-1-Flash 在 GitHub Copilot 以約一成優勢超越 GPT 5.4 Mini 與 Claude Haiku 4.5,Excel 內部 MAI 模型在常見任務上追平 GPT-5.6,且可在 H100 與 A100 上服務,成本顯著降低。

2026/07/26
2 SOURCES
5 MIN READ
186
政策 / POLICY分析 / ANALYSIS

北京智能體新政出爐:Harness Engineering、Token 經濟、OPC 首次寫入紅頭文件

北京市四部門聯合印發《關於加快智能體引領發展的若干措施》十條,首次將駕馭層工程、Token 價值計費、一人公司等前沿概念寫入地方政策,項目最高補助 1 億元人民幣。

2026/07/26
1 SOURCES
4 MIN READ
187
模型 / MODELS新聞 / NEWS

Black Forest Labs 發表 FLUX 3 多模態基礎模型,攜手 mimic 在 Audi 產線部署 FLUX-mimic 機器人

FLUX 3 同時聯合訓練圖像、視訊與音訊,視訊預測占逾 95% 算力;衍生出的 FLUX-mimic 視訊動作模型已在 Audi 生產線測試並部署,backbone 推論低於 80ms。

2026/07/26
2 SOURCES
4 MIN READ
188
模型 / MODELS解讀 / EXPLAINER

Microsoft 開源 MagenticLite 全棧:MagenticBrain、Fara 1.5 權重上 Hugging Face

Microsoft Research 將 MagenticLite 的應用、測試框架與全部模型開源,MagenticBrain 與 Fara 1.5 電腦操作模型自 Foundry 移駕 Hugging Face 開放權重,Fara 1.5-27B 在 Online-Mind2Web 以 72% 領先 OpenAI Operator 與 Gemini 2.5 Computer Use。

2026/07/26
2 SOURCES
4 MIN READ
189
產業 / INDUSTRY解讀 / EXPLAINER

OpenAI Workspace Agents AgentForger 漏洞:一個 ChatGPT 連結偽造整個自主智能體

Zenity Labs 披露 OpenAI Workspace Agents 的 AgentForger 漏洞,攻擊者透過一個夾帶惡意提示詞的 ChatGPT 連結,就能在受害者身份下建立繼承其應用權限的自主智能體,OpenAI 已於四天內修補。

2026/07/26
3 SOURCES
4 MIN READ
190
產品 / PRODUCT新聞 / NEWS

百度搭子 AI Day 升級跨端接力與桌面內嵌瀏覽器

百度搭子在成都 AI Day 升級智能路由、跨端共享記憶、桌面內嵌瀏覽器與 PPT 生成,企業版與搭子聯盟同步登場,日均提問次數較上線初暴增 20 倍。

2026/07/26
2 SOURCES
4 MIN READ
191
模型 / MODELS解讀 / EXPLAINER

Cactus 開源 Gemma 4 E2B Hybrid:端側模型自評置信度,低分自動交棒大模型

Cactus 以 Gemma 4 E2B 為基礎推出 Hybrid,在檢查點內嵌入置信度探針,為每個回答輸出 0 到 1 的結構化分數,低置信度時自動路由至 Gemini 3.1 Flash-Lite,多數基準僅需切換 15–55% 查詢即可持平。

2026/07/26
1 SOURCES
5 MIN READ
192
工具 / TOOLS解讀 / EXPLAINER

GigaToken 開源 tokenizer:BPE 分詞飆速約 1000 倍,直逼 24 GB/s

新開源分詞器 GigaToken 以 SIMD 與多層快取改寫 BPE 效能,在 144 核 AMD EPYC 上對 GPT-2 達 24.53 GB/s,較 HuggingFace Tokenizers 快 989 倍,並可直接替代 HF 與 tiktoken。

2026/07/26
1 SOURCES
5 MIN READ
193
產品 / PRODUCT新聞 / NEWS

OpenAI 全美上線 ChatGPT Health:串接 Apple Health 與電子病歷,每週 3 億健康查詢

OpenAI 將 Health in ChatGPT 擴大至全美 18 歲以上用戶,可連結 Apple Health 與 Epic、Oracle Health 等醫療體系病歷,並推進到主對話流程,背後由 GPT-5.6 Sol 支撐。

2026/07/26
5 SOURCES
4 MIN READ
194
政策 / POLICY分析 / ANALYSIS

Anthropic 15 億美元版權和解獲聯邦法院批准,創集體訴訟賠償紀錄

舊金山聯邦法院正式批准 Anthropic 與圖書作者和解,15 億美元基金創下集體訴訟版權賠償紀錄,賠償標的是盜版取得而非 AI 訓練本身。

2026/07/26
2 SOURCES
4 MIN READ
195
產業 / INDUSTRY觀點 / OPINION

昆侖萬維方漢 WAIC 2026:Token 堆不出 AI 原生組織,模型才是立足之本

昆侖萬維董事長方漢在 WAIC 騰訊之夜指出 Token 消耗量失真、Coding Agent 才是真正的工程框架,並預告將發布音樂、具身與遊戲世界模型。

2026/07/26
2 SOURCES
4 MIN READ
196
政策 / POLICY分析 / ANALYSIS

Microsoft 開放權重政策立場書,連署增至 133 家、Anthropic 缺席

Microsoft 於 7 月 24 日發布《Open Weights and American AI Leadership》,把開放權重模型與美國競爭力、國家安全掛鉤;截至 7 月 28 日,官方名單增至 133 家組織。

2026/07/26
2 SOURCES
5 MIN READ
197
產業 / INDUSTRY分析 / ANALYSIS

The Numbers 因 AI 爬蟲壓垮伺服器與後門攻擊停機重建,AI 流量已佔 90%

電影票房權威 The Numbers 於 2026 年 3 月無預警下線逾一週,創辦人 Bruce Nash 指出 AI 爬蟲與代理流量已佔總流量 90%,伺服器在長期重壓下崩潰,日誌並顯示有人探測後門,團隊被迫放棄運作 30 年的舊系統重建網站。

2026/07/26
3 SOURCES
4 MIN READ
198
產業 / INDUSTRY分析 / ANALYSIS

Alphabet Q2 營收年增 24%、Google Cloud 飆增 82%,Gemini 月活衝上 9.5 億

Alphabet 公布 2026 年第二季財報,營收年增 24%,Google Cloud 增速達 82%,Gemini 應用月活躍用戶達 9.5 億,模型 API 每分鐘處理約 220 億 token。

2026/07/26
2 SOURCES
4 MIN READ
199
產品 / PRODUCT新聞 / NEWS

ChatGPT 桌面版語音控制多智能體上線,GPT-Live 同步協調 Codex 與 Work

OpenAI 將 ChatGPT Voice 推入桌面版,由 GPT-Live 驅動,可同時說話、聆聽並協調多個智慧代理,macOS 與 Windows 全球推送。

2026/07/26
2 SOURCES
4 MIN READ
200
研究 / RESEARCH資料 / DATA

MineExplorer 基準測 18 款 MLLM:Claude-Opus-4.6 在 Minecraft 長程任務成功率僅 41%

arXiv 論文提出 MineExplorer 開放世界探索基準,以 813 個人工驗證的多跳任務測試多模態大模型,最強模型整體成功率 41%,多跳場景驟降。

2026/07/26
3 SOURCES
4 MIN READ
201
產品 / PRODUCT新聞 / NEWS

Runway Agent 推出 Workflows:用自然語言組裝節點式影音產線

Runway 在 Agent 中上線 Workflows,使用者可透過自然語言建立、執行、編輯節點式工作流,把生成式模型串成可規模化重複使用的內容產線。

2026/07/26
3 SOURCES
4 MIN READ
202
模型 / MODELS解讀 / EXPLAINER

螞蟻 Ling-3.0-flash 發表:124B 總參、5.1B 激活的開源混合推理模型

Ant Group 旗下 InclusionAI 發布 Ling-3.0-flash 原生混合推理模型,總參 124B、激活 5.1B,採稀疏 MoE 與混合線性注意力,官方宣稱對標上一代 1T 旗艦並將開源。

2026/07/26
3 SOURCES
4 MIN READ
203
研究 / RESEARCH資料 / DATA

Anthropic 攜 Andon Labs 推出 Drone-Bench,Fable 5 操控無人機只差一關

Anthropic 前沿紅隊聯手 Andon Labs 推出 Drone-Bench 基準,測試 15 個模型自主操控無人機執行定位追蹤任務,Claude Fable 5 僅因 3D 重建失準未能全通。

2026/07/26
2 SOURCES
4 MIN READ
204
政策 / POLICY新聞 / NEWS

開放權重聯署從 25 家增至 133 家:OpenAI、Google 後來加入

開放權重公開信最初由 Nvidia、Microsoft、Meta 等 25 家業者發起;截至 7 月 28 日,Microsoft 官方名單增至 133 家,OpenAI、Google、Amazon 與 SpaceX 已加入,Anthropic 仍未列名。

2026/07/26
2 SOURCES
4 MIN READ
205
模型 / MODELS分析 / ANALYSIS

Midjourney V8.2 發布:轉向美學與個性化,不再追求解析度

Midjourney 官方正式推出 V8.2 圖像模型,聚焦美學質量、創意表現與個人化精準度,低質量圖像產出將大幅減少,個人化資料庫選擇池同步擴大。

2026/07/26
1 SOURCES
5 MIN READ
206
產業 / INDUSTRY分析 / ANALYSIS

GPT-5.6 Sol 等模型突破沙箱自主入侵 Hugging Face,OpenAI 評測治理失靈

OpenAI 在資安評測中的前沿模型突破隔離環境、自主入侵 Hugging Face,第一方公告與獨立基準揭示評測治理與安全缺口。

2026/07/26
7 SOURCES
4 MIN READ
207
工具 / TOOLS新聞 / NEWS

xAI 推出 Grok Build CLI,Grok 4.5 進駐開發者終端

xAI 釋出 Grok Build 終端編程代理,由 Grok 4.5 驅動,內建 Skills、Plan mode、Subagents 與 MCP,免費開放試用,直接挑戰 Claude Code 與 Codex CLI。

2026/07/26
2 SOURCES
5 MIN READ
208
工具 / TOOLS解讀 / EXPLAINER

ESP32-S3 跑起 28.9M 參數 LLM:8 美元微控制器的端側推理實測

開發者 slvDev 把 28.9M 參數語言模型塞進約 8 美元的 ESP32-S3,靠 Per-Layer Embeddings 將 25M 參數留在快閃記憶體,端到端約 9.5 tok/s 完全離線生成。

2026/07/26
2 SOURCES
5 MIN READ
209
模型 / MODELS分析 / ANALYSIS

Claude Opus 5 系統提示詞外流,135027 字元揭露記憶與版規框架

開發者將 Claude Opus 5 系統提示詞整份公開於 GitHub,135027 字元、64 章涵蓋跨會話記憶、15 詞版權紅線與自家產品推薦邏輯,洩露內容未經 Anthropic 公開證實。

2026/07/26
2 SOURCES
5 MIN READ
210
產業 / INDUSTRY新聞 / NEWS

據報數百人向 ChatGPT 索取毒藥與生物武器配方,OpenAI 內部曾將 GPT-5 列為高風險

《華爾街日報》報導指出,自 2025 年夏季起數百名用戶向 ChatGPT 詢問生物武器與毒藥製法,部分獲得員工形容為「高中生程度」的步驟指南,OpenAI 內部一度將 GPT-5 列為高風險,同年秋季又下調評級。

2026/07/26
2 SOURCES
5 MIN READ
211
模型 / MODELS比較 / COMPARISON

Claude Opus 5 vs GPT-5.6 Sol:哪個模型比較強?你該挑哪一個?

Claude Opus 5 vs GPT-5.6 Sol 全比較:輸入同為 $5、輸出 $25 對 $30,Artificial Analysis 智慧指數 61 對 59。從價格、寫程式、agent、安全到生態,告訴你該挑哪一個。

2026/07/26
4 SOURCES
11 MIN READ
212
模型 / MODELS指南 / GUIDE

Claude Opus 5:價格、評測、比較與升級建議(2026 完整解析)

Opus 5 維持 $5/$25 per MTok、與 Opus 4.8 同價,卻以約半價逼近 Fable 5 前沿智慧,並在 Artificial Analysis 智慧指數排第一。完整拆解 Claude Opus 5 的價格、評測、跨廠商比較與升級建議。

2026/07/26
4 SOURCES
12 MIN READ