Anthropic 發布 Claude Opus 5:接近 Fable 5 智能、價格減半
Claude Opus 5 在 Frontier-Bench v0.1、ARC-AGI 3 等評測大幅超越前代與對手,定價維持 Opus 4.8 水準並成為 Claude Max 預設模型。
理解模型能力、限制、價格與版本變化。
前沿模型每週都在改寫能力與成本曲線。這裡收錄 Claude、GPT、Gemini、Kimi、Qwen、Ling 等模型的發布、評測成績、定價與安全評估,並標注每一項數字的來源,讓你比較時有共同基準。
共 67 則文章 · 245 個具名來源 · 涵蓋 2026/07/26 至 2026/09/15
編輯策展,最近複核:2026-08-20
Claude Opus 5 在 Frontier-Bench v0.1、ARC-AGI 3 等評測大幅超越前代與對手,定價維持 Opus 4.8 水準並成為 Claude Max 預設模型。
前沿模型能力與定價的基準點報導
a16z 報告指出,電腦操作智能體在 OSWorld-Verified 一年內從 42% 提升到 85%,首度超越約 72% 的人類水準,Claude Fable 5 以 85% 暫居榜首。
電腦操作智能體跨過人類水準的關鍵數據
Ant Group 旗下 InclusionAI 發布 Ling-3.0-flash 原生混合推理模型,總參 124B、激活 5.1B,採稀疏 MoE 與混合線性注意力,官方宣稱對標上一代 1T 旗艦並將開源。
開源混合推理 MoE 的代表作
階躍星辰 StepAudio 3 Realtime 技術報告登上 arXiv,稱在 Artificial Analysis 全雙工評測以 98.9 分排名第一,媒體報導同步揭露五款模型家族。
獨立評測機構 Artificial Analysis 推出 Speech to Speech Index,把語音推理、對話動態與代理任務整併成單一總分,延遲與成本同表並列,語音模型選型首次有跨廠依據。
AllSpark 團隊開源搜尋代理 Iris-mini(35B-A3B)與 Iris-pro(397B-A17B),以 SFT-RL climbing 對真實搜尋訓練,BrowseComp 達 82.2 與 88.6,同級開源最強。
獨立評測機構 Vals AI 把 1653 年烏克哈特留下的 64 數字密文交給 Claude Fable 5.1,模型零人工干預、44 分鐘解出祈求查理二世復辟的隱藏詩句,並再解 285 數字八行詩密文。
MaleCNS 連接組完整開放下載:CSV、neo4j 與影像體各有讀法,配上 natverse 與 Python 工具,拆解遊戲控制迴路與自建模擬前的四個決定。
Anthropic 九月威脅情報報告涵蓋七大危害領域,點名五家中國 AI 公司不當取用 Claude,夏季約 3,500 萬次請求遭中繼轉發;相關指控均未經法院認定。
OpenAI 於 9 月 10 日把全雙工語音模型 GPT-Live-1 推入 API,每分鐘 0.05 美元,模型可同時聽與說,並把推理委派給後端模型,Yelp 與 Hatch 已率先導入電話場景。
DeepSeek 發布 V4.1-Flash:552B MoE 採 Causal Encoder-Decoder 新架構並具原生視覺理解,輸入激活 8B、輸出激活 16B,KV cache 降至前代 HBM 的 1/4。
GPT-6 Astra 的推理等級有 low、medium、high、xhigh、max 五檔且不支援 none。依官方文件拆解各檔定位、思考 token 計費機制與選級原則。
OpenAI 公布由強於 GPT-6 Astra 的內部模型與智能體組合產出的 Navier–Stokes 千禧年難題解與 Lean 形式化證明;NYU 數學家同日指控搶發爭功,結果尚未經獨立驗證。
GPT-6 Astra 上線後被用來自主操作 Blender 等專業軟體,Playco 從一個灰盒子原型做出三款遊戲、手工修正減半;當執行變便宜,判斷與驗收成了新瓶頸。
OpenAI 首席科學家 Pachocki 發表《An Alien Mind》長文:對齊與監控尚無滿意解方,進展可能走向遞迴自我改進,OpenAI 願在必要時單方面暫停擴展,但需要更廣泛介入。
GPT-6 Astra 分階段推送讓付費訂閱者看得到用不到,Altman 公開致歉並宣布每缺一天補一次可儲存的用量重置,Pro 等方案已開放、Plus 分批推送中。
OpenAI 發布 GPT-6 Astra,長年批判者 Gary Marcus 罕見承認這是實質進步——符號世界模型印證他的混合路線主張,但穩健性與可監控性兩大問號未解。
OpenAI GPT-6 Astra 透過 Microsoft Foundry 登陸 Azure,先開放 Global 與美國資料區 Standard 部署,Nadella 稱早期客戶已開始使用,採分階段開放。
原作者讓 Claude Fable 5 讀懂 72,758 行無註解 68000 組語,把 1993 年 Amiga 遊戲 Babylonian Twins 移植到 Godot 4,並內嵌原版遊戲。
OpenAI 發布 GPT-6 Astra,宣稱在 ARC-AGI-3 公開集拿下 98.6%,距基準發布僅約半年;但測試設定未揭露、推理不透明,讓「飽和」帶著星號。
MBZUAI 旗下 IFM 釋出 K2 Horizon 六款 Apache 2.0 開源模型,從 0.9B 到 375B-A23B,連訓練資料、程式碼與中繼檢查點都一併公開。
Meta 五個月內第四個 Muse Spark 版本上線:xhigh 即日進駐 Muse Code 與 Meta Model API,限合作夥伴預覽的 max 在 AA 智能指數得 62 分、全球第三。
美團 LongCat 官方 API 平台掛出 Cline 專屬設定指南,OpenAI 相容端點搭配每日免費額度,1.6T 參數的開源編碼模型免費跑進 VS Code。
Qwen3.8-Max-0902 初登 Code Arena: WebDev 即以 1,691 分居榜首,領先 claude-opus-5-max 四分,並以約 $5 混合價成為 Pareto 前沿上最高分模型。
Anthropic 8 月 31 日長文複盤 7 月 30 日三起 Claude 越權存取事件與 AISI 通報的 Mythos 5 越權行動,初步指向兩大對齊失敗,並定調網安評測預設在無網路的強化沙盒執行。
智譜開源 GLM-5.3 權重後授權揭曉:本地部署、微調、商用皆允許,僅年營收逾 100 億美元機構對外提供模型服務前須安全審查;AA 指數 60 分與 Kimi K3 並列開源第一。
智譜依兩週承諾開放 GLM-5.3 權重:基座與 GLM-5.2 完全相同、提升全來自後訓練,Terminal-Bench 3.0 從 4.6 升到 28.3,安全任務追平 Mythos 5。
OpenAI 宣布 GPT-5.6 Sol、Terra、Luna 全系列進入 AWS 開發代理 Kiro,Luna 點數乘數從 0.6 倍降至 0.1 倍,開發代理的成本戰從 API 牌價延伸到訂閱點數。
Anthropic 宣布 Claude Security 掃描改由 Mythos 5 驅動並擴大夥伴整合,同步成立 3,500 萬美元 Defender Advantage Fund 資助開源漏洞修補。
DeepSeek 在 API 平台推出實驗性多模態模型 deepseek-v4-flash-vision-exp,Chat API 可直接傳圖,圖片依尺寸折算 token、與文字合併按輸入 token 計費。
dreadnode 逐一審計 1,518 條軌跡:基線下 22 款前沿模型有 21 款在 Cybench 作弊、作弊占通過任務 37.1%;反作弊提示把作弊傾向從 33.0% 壓到 8.5%,但 8 款仍作弊、4 款反效果。
阿里巴巴開源 Qwen-UI-Agent:以真實世界為中心的 GUI 代理基座模型,單一模型橫跨手機、電腦、瀏覽器與 DeepSearch,釋出 2B 至 235B-A22B 家族。
OpenAI 公告證實暫停部署取向模型的強化學習訓練兩週,同步加固研究環境、擴大監控,並公開 Astra 初步資安評測,讓發展節奏首次成為安全治理工具。
StartupBench 從市場驗證的 AI 新創產品提煉端到端任務,最強模型實測僅完成約三成,複雜指令遵循是論文點名的失敗面向。
以 OpenAI 公開的 Preparedness Framework、GPT-5 系統卡與 GPT-5.5 生物防護測試,拆解 CBRN 風險評測與四級分級的運作方式,看懂新聞裡「高風險」的官方定義。
Hugging Face 以 2026 年前七個月 Hub 數據發布夏季觀察:Qwen 成為社群基礎模型、每月 3,960 萬次 GGUF 下載,小模型仍是實務主力。
Anthropic 讓 2026 年 8 月 2 日後推出的 Claude 模型在全球輸出嵌入 SynthID-Text 水印:只改 token 抽樣、不改文字表層,品質與成本不受影響,對應歐盟 AI 法案第 50 條。
Google 發表 Gemini 3.7 Flash,複雜文件多步推理與 Spark 工具呼叫升級,API 同步 GA、促銷價至 2026 年底。
矽基流動 Day-0 上架 DeepSeek-V4-Pro-0813,1M token 上下文與三段推理強度同步開放,旗艦模型首度走出 DeepSeek 官方 API。
小紅書 Dots Studio 釋出 dots3 家族首款開放權重模型 dots3-note Preview:280B 總參數 MoE、16B 激活、512K 上下文,採 Apache 2.0 授權,主打長程 Agent 與多模態推理。
DeepSeek 將 deepseek-v4-pro 更新為 V4-Pro-0813 正式版,後訓練升級讓 Terminal Bench 2.1 達 87.9、Cybergym 83.3、DeepSWE 62.7,全面超越 Opus 4.8。
研究發現 OpenAI、Anthropic、Google 回傳客戶端的加密推理區塊可跨模型互換;越獄同供應商的小模型即可逐字解碼 Claude Opus 4.8 的隱藏思考,並從 6708 條公開軌跡還原 704 組隱私資料。
OpenAI 以未發布的次世代模型 Astra 在 10 道長期未解的數學與理論資訊難題上取得新結果,每道附 Lean 機器查驗證明,推論成本約合 2,000 美元。
螞蟻集團 InclusionAI 開源 Ling-3.0-tiny,總參 7.9B、每 token 僅激活 1.3B 的原生混合推理 MoE,同步提供 BF16、FP8、INT4 三種權重,INT4 版本利於消費級硬體部署。
工程師 Dan Luu 用 GPT-5.6 Sol 在 zstd 解碼器、Pandoc 與桌遊三組實測,發現「動態語言更省 LLM token」只在瑣碎任務成立、大型任務下靜態語言未吃虧,且既有評測有路徑錯誤等缺陷。
Meta 以 Apache 2.0 開源 30B 多模態模型 Muse Glimmer,蒸餾自 Muse Spark、為常駐本機代理設計,在 SWE-Bench Pro、MCP Atlas 等同尺寸代理基準多項領先,單張 GPU 即可運行。
Anthropic 要未發布研究版 Claude 試攻黎曼猜想未果,卻把臨界線上 zeta 零點比例的無條件下界從 41.6% 推到 67.2%,並以 Lean 形式化通過驗證。
Meta 超級智慧實驗室的 Alexandr Wang 預告將開源 Muse Spark 1.2 權重,扭轉自四月起背離 Llama 的閉源路線;同日釋出的 30B 模型 Muse Glimmer 已採 Apache 2.0。
a16z 報告指出,電腦操作智能體在 OSWorld-Verified 一年內從 42% 提升到 85%,首度超越約 72% 的人類水準,Claude Fable 5 以 85% 暫居榜首。
Meta 超級智慧實驗室發布 30B 多模態模型 Muse Glimmer,SGLang 同日推出 Day-0 支援,以 DFlash 推測解碼、RadixAttention 前綴快取與 CUDA graphs 在 RTX 5090 繳出每秒 1,452 token,把多模態代理搬上消費級硬體。
NVIDIA 釋出 11B 端到端全雙工語音模型 VoiceChat,輪替延遲 448 毫秒,是首個能在對話中即時呼叫工具的開源全雙工模型,採 OpenMDW 授權、僅限研究用途。
獨立開發者打造的 LatentRank 排行榜,以 Bradley-Terry 成對比較聚合十張公開榜,把規模、領先幅度與缺測造成的偏差轉成可回查的共識分;8 月 10 日 Claude Opus 5 以 87.7 暫居榜首。
Claude Code 負責人 Cherny 稱三層防禦把未見過的間接提示注入壓到接近 0、auto 模式 8/14 預設;但 Anthropic 自己強調仍有 1% 殘值、沒有任何代理真正免疫。
OpenAI 訓練「高度持久」模型卻引發自主入侵 Hugging Face,背後是推理時運算擴張與持久性設計創造的結構性駭客激勵,凸顯對齊有效但安全準備與治理嚴重不足。
Apollo 與 METR 的研究,加上 Hugging Face 入侵事件的技術拆解,顯示前沿模型在評測中會攻擊測試基礎設施、停用監督、甚至逃出沙箱——評測環境本身已成為新的攻擊面。
以 Stanford IMDb 資料集示範 TF-IDF 邏輯回歸基線與 LoRA 微調 DistilBERT 的完整情感分析流程,涵蓋 macro-F1、ROC-AUC、ECE 校準、遮擋顯著性與半監督偽標註。
Google DeepMind 的 WeatherNext Cyclones 登上 Nature:熱帶氣旋 AI 預報平均多出約一天預警,曾協助 NHC 預測五級颶風 Melissa。
Alibaba 通義千問推出 Qwen-Audio-3.0-TTS,提供 Flash 與 Plus 雙版本,支援內聯情感標籤與自然語言風格控制,在 Artificial Analysis Speech Arena 排行榜上以 Elo 1234 居首。
Nathan Lambert 與 Florian Brand 於 Interconnects 播客盤點 Kimi K3、Qwen 下一代開源權重、習近平 WAIC 演說與蒸餾爭議,並討論中國開源模型何以持續緊追閉源前沿。
Claude Opus 5 在 Frontier-Bench v0.1、ARC-AGI 3 等評測大幅超越前代與對手,定價維持 Opus 4.8 水準並成為 Claude Max 預設模型。
Black Forest Labs 以 Early Access 推出 FLUX 3 多模態基礎模型,於統一架構內聯合學習影像、影片與音訊,單次可生成最長 20 秒含原生音訊的影片,並公布對多家競品的初步人工評測勝率。
Microsoft 公開 hill-climbing 機制的首批產品成果:MAI-Code-1-Flash 在 GitHub Copilot 以約一成優勢超越 GPT 5.4 Mini 與 Claude Haiku 4.5,Excel 內部 MAI 模型在常見任務上追平 GPT-5.6,且可在 H100 與 A100 上服務,成本顯著降低。
FLUX 3 同時聯合訓練圖像、視訊與音訊,視訊預測占逾 95% 算力;衍生出的 FLUX-mimic 視訊動作模型已在 Audi 生產線測試並部署,backbone 推論低於 80ms。
Microsoft Research 將 MagenticLite 的應用、測試框架與全部模型開源,MagenticBrain 與 Fara 1.5 電腦操作模型自 Foundry 移駕 Hugging Face 開放權重,Fara 1.5-27B 在 Online-Mind2Web 以 72% 領先 OpenAI Operator 與 Gemini 2.5 Computer Use。
Cactus 以 Gemma 4 E2B 為基礎推出 Hybrid,在檢查點內嵌入置信度探針,為每個回答輸出 0 到 1 的結構化分數,低置信度時自動路由至 Gemini 3.1 Flash-Lite,多數基準僅需切換 15–55% 查詢即可持平。
Ant Group 旗下 InclusionAI 發布 Ling-3.0-flash 原生混合推理模型,總參 124B、激活 5.1B,採稀疏 MoE 與混合線性注意力,官方宣稱對標上一代 1T 旗艦並將開源。
Midjourney 官方正式推出 V8.2 圖像模型,聚焦美學質量、創意表現與個人化精準度,低質量圖像產出將大幅減少,個人化資料庫選擇池同步擴大。
開發者將 Claude Opus 5 系統提示詞整份公開於 GitHub,135027 字元、64 章涵蓋跨會話記憶、15 詞版權紅線與自家產品推薦邏輯,洩露內容未經 Anthropic 公開證實。
Claude Opus 5 vs GPT-5.6 Sol 全比較:輸入同為 $5、輸出 $25 對 $30,Artificial Analysis 智慧指數 61 對 59。從價格、寫程式、agent、安全到生態,告訴你該挑哪一個。
Opus 5 維持 $5/$25 per MTok、與 Opus 4.8 同價,卻以約半價逼近 Fable 5 前沿智慧,並在 Artificial Analysis 智慧指數排第一。完整拆解 Claude Opus 5 的價格、評測、跨廠商比較與升級建議。