找到你需要的 AI 情報。
搜尋標題、摘要、分類與標籤;查詢只在你的瀏覽器中完成,不會傳送給第三方服務。
50 則最新文章
正在載入完整文章索引…
- 模型 / MODELS新聞 / NEWS
StepAudio 3 Realtime 拿下 AA 全雙工評測第一,總分 98.9
階躍星辰 StepAudio 3 Realtime 技術報告登上 arXiv,稱在 Artificial Analysis 全雙工評測以 98.9 分排名第一,媒體報導同步揭露五款模型家族。
- 模型 / MODELS分析 / ANALYSIS
語音對語音模型有了統一計分板:AA 發布 Speech to Speech Index
獨立評測機構 Artificial Analysis 推出 Speech to Speech Index,把語音推理、對話動態與代理任務整併成單一總分,延遲與成本同表並列,語音模型選型首次有跨廠依據。
- 產品 / PRODUCT新聞 / NEWS
Siri AI 現身 Apple 台灣官網:英文先行、標註使用受限
Apple 台灣官網已把 Siri AI 列為 iPhone 主打功能,標示英文率先推出、使用可能受限,主打個人情境理解與 app 整合,由 A20 Pro 支撐。
- 模型 / MODELS新聞 / NEWS
AllSpark 開源搜尋代理 Iris:35B 版 BrowseComp 達 82.2
AllSpark 團隊開源搜尋代理 Iris-mini(35B-A3B)與 Iris-pro(397B-A17B),以 SFT-RL climbing 對真實搜尋訓練,BrowseComp 達 82.2 與 88.6,同級開源最強。
- 模型 / MODELS分析 / ANALYSIS
Claude Fable 5.1 花 44 分鐘解開 373 年未解密文
獨立評測機構 Vals AI 把 1653 年烏克哈特留下的 64 數字密文交給 Claude Fable 5.1,模型零人工干預、44 分鐘解出祈求查理二世復辟的隱藏詩句,並再解 285 數字八行詩密文。
- 產業 / INDUSTRY分析 / ANALYSIS
NVIDIA 為何被稱為「AI 央行」:信用、晶片與監管壓力
NVIDIA 以 990 億美元股權投資、六平台 5,000 億美元融資目標與對客戶的財務支持,成為 AI 建設的信用中樞;美國司法部已對其 Groq 交易展開調查。
- 工具 / TOOLS解讀 / EXPLAINER
Agent 長任務上下文工程:放不下、記不住、忘了目標怎麼解
長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。
- 產品 / PRODUCT分析 / ANALYSIS
OpenAI 首度公開 Habitat:ChatGPT 背後的 10 億人儲存平台
OpenAI 工程團隊首度說明 ChatGPT 背後的線上儲存平台 Habitat:官方摘要稱它從 Python 函式庫演進為全球分散式平台,服務 10 億使用者、每秒 2,200 萬次請求。
- 工具 / TOOLS分析 / ANALYSIS
Google ARTEMIS 開源:Android 自動化代理內含 Minitap 程式碼
Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。
- 研究 / RESEARCH分析 / ANALYSIS
Dwarkesh 新對談:三位研究者先把反對 RSI 的理由講滿
Dwarkesh Podcast 新集由 Schulman、Millidge、O'Neill 三人對談遞迴自我改進,逐字稿第一節「Steelmanning the case against RSI」從反方最強論證開始。
- 模型 / MODELS指南 / GUIDE
MaleCNS 果蠅連接組實作指南:資料、工具與遊戲控制迴路
MaleCNS 連接組完整開放下載:CSV、neo4j 與影像體各有讀法,配上 natverse 與 Python 工具,拆解遊戲控制迴路與自建模擬前的四個決定。
- 模型 / MODELS新聞 / NEWS
Anthropic 威脅情報報告:點名五中企、3,500 萬次請求繞道 Claude
Anthropic 九月威脅情報報告涵蓋七大危害領域,點名五家中國 AI 公司不當取用 Claude,夏季約 3,500 萬次請求遭中繼轉發;相關指控均未經法院認定。
- 產品 / PRODUCT新聞 / NEWS
OpenAI Agents API 公開測試:Codex 同款 Harness 開放串接
OpenAI 把驅動 Codex 的開源 Harness 與沙盒基礎設施包成 Agents API 公開測試版,單一 API 呼叫即可建立可連跑多日的雲端代理,不加收平台費、只按 Token 與工具用量計價。
- 工具 / TOOLS新聞 / NEWS
Cursor 推出 Projects:單一持久對話調度一群代理
Cursor 官方宣布 Projects:開發者改在單一持久對話中與協調代理合作,由它規劃並派工給多個實作代理,beta 向所有用戶展開。
- 產品 / PRODUCT新聞 / NEWS
OpenAI 推出金融業專版 ChatGPT:內建數據、溯源、直通 Excel
OpenAI 發表 ChatGPT for Financial Services:GPT-6 Astra 搭內建金融數據,由 OpenAI 索引託管並逐筆溯源,直通 Excel 範本交付,採資格制銷售。
- 模型 / MODELS新聞 / NEWS
OpenAI 開放 GPT-Live-1 API:全雙工語音每分鐘 0.05 美元
OpenAI 於 9 月 10 日把全雙工語音模型 GPT-Live-1 推入 API,每分鐘 0.05 美元,模型可同時聽與說,並把推理委派給後端模型,Yelp 與 Hatch 已率先導入電話場景。
- 研究 / RESEARCH分析 / ANALYSIS
果蠅腦播 Bad Apple、玩 Beat Saber:迷因查證
果蠅連接組病毒影片逐項查證:Bad Apple!! 影格是輸入、果蠅動作是輸出;Beat Saber 僅證明運動控制;「意識上傳」是過度延伸。附自行驗證清單。
- 產業 / INDUSTRY分析 / ANALYSIS
Shopify 棄 React Native 回原生:AI agent 改寫跨平台成本帳
Shopify 工程團隊宣布行動 App 從 React Native 遷回 Swift 與 Kotlin 原生開發,官方說明直指 coding agents 已壓低「把 App 寫兩次」的成本,跨平台框架的經濟假設被改寫。
- 模型 / MODELS新聞 / NEWS
DeepSeek V4.1-Flash 發布:讀用 8B、寫用 16B 的非對稱新架構
DeepSeek 發布 V4.1-Flash:552B MoE 採 Causal Encoder-Decoder 新架構並具原生視覺理解,輸入激活 8B、輸出激活 16B,KV cache 降至前代 HBM 的 1/4。
- 產品 / PRODUCT新聞 / NEWS
Claude Marketplace 新增五家夥伴,承諾額度可折抵第三方工具
Anthropic 將 CrowdStrike、Cursor、Factory、Gamma、Vercel 納入 Claude Marketplace,企業可用既有 Anthropic 承諾額度採購這些第三方產品。
- 研究 / RESEARCH分析 / ANALYSIS
果蠅全腦接線圖公開下載,開源社群把它接上 Doom 與瑪利歐
Google 與 Janelia 公開雄果蠅完整中樞神經系統連接組後,開發者把 166,700 個神經元的接線圖接上 Doom、瑪利歐與 Minecraft,成為可即時觀察的實驗性控制器。
- 產品 / PRODUCT新聞 / NEWS
Meta 個人 AI 代理 Muse 登場:替你辦事,先講安全
Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。
- 模型 / MODELS指南 / GUIDE
GPT-6 Astra 推理等級怎麼選:從 low 到 max 的省 Token 指南
GPT-6 Astra 的推理等級有 low、medium、high、xhigh、max 五檔且不支援 none。依官方文件拆解各檔定位、思考 token 計費機制與選級原則。
- 模型 / MODELS新聞 / NEWS
OpenAI 宣稱 AI 智能體解出 Navier–Stokes 千禧年難題
OpenAI 公布由強於 GPT-6 Astra 的內部模型與智能體組合產出的 Navier–Stokes 千禧年難題解與 Lean 形式化證明;NYU 數學家同日指控搶發爭功,結果尚未經獨立驗證。
- 工具 / TOOLS新聞 / NEWS
柏克萊 RDI 開源 CUA-Lite:環境、資料、駕馭層一次標準化
柏克萊 RDI 開源 CUA-Lite 平台,以單一 LiteSample 資料架構與統一環境介面,把電腦操作代理的評測、微調與強化學習收進同一套駕馭層,30k+ 任務免 VM 就能跑。
- 工具 / TOOLS新聞 / NEWS
GitHub 推出 HydraFusion:Copilot 依任務調度多模型,成本最多省 67%
GitHub 在 Copilot CLI 推出 HydraFusion 研究預覽:依任務在單模型、級聯與互評三種工作流間動態調度多模型,官方評測稱成本最多省 67%。
- 研究 / RESEARCH新聞 / NEWS
Buckmaster、Alpöge 公開三方程光滑強迫爆破結果
數學家 Buckmaster 與 Alpöge 公開多孔介質、Boussinesq 與 Euler 三條方程帶光滑外力的有限時間爆破證明,陶哲軒撰文介紹,與千禧年大獎仍有一線之隔。
- 產業 / INDUSTRY新聞 / NEWS
Mistral 完成 30 億歐元 D 輪融資,估值逾 210 億歐元
Mistral 官方宣布完成 30 億歐元 D 輪融資,投後估值超過 210 億歐元,三星電子領投,媒體稱其寫下歐洲科技業單輪股權融資紀錄。
- 工具 / TOOLS指南 / GUIDE
GPT-6 Astra 操控 Blender 教學:三種接法與成本陷阱
GPT-6 Astra 驅動 Blender 有三條路:Computer Use 免設定但慢且貴、MCP 呼叫工具較快、Python CLI 以 bpy 腳本直達核心;三種接法的原理、設定與逾時對策一次拆解。
- 研究 / RESEARCH分析 / ANALYSIS
OpenAI 宣布達成自動化研究實習生目標,下一站 2028 全自動研究員
OpenAI 公開內部研究加速數據:每個人力工作日對應 3.1 個代理工作日,宣布達成 2025 年 10 月設下的自動化研究實習生目標,並瞄準 2028 年 3 月全自動 AI 研究員。
- 模型 / MODELS分析 / ANALYSIS
GPT-6 Astra 會用 Blender 了:當執行變便宜、判斷變貴
GPT-6 Astra 上線後被用來自主操作 Blender 等專業軟體,Playco 從一個灰盒子原型做出三款遊戲、手工修正減半;當執行變便宜,判斷與驗收成了新瓶頸。
- 模型 / MODELS分析 / ANALYSIS
OpenAI 長文《An Alien Mind》:對齊與監控仍是未解難題
OpenAI 首席科學家 Pachocki 發表《An Alien Mind》長文:對齊與監控尚無滿意解方,進展可能走向遞迴自我改進,OpenAI 願在必要時單方面暫停擴展,但需要更廣泛介入。
- 政策 / POLICY資料 / DATA
OpenAI 傷害訴訟逾 50 起:三條戰線一次看清
Tumbler Ridge 倖存師生 30 起新訴,讓 OpenAI 面臨的消費者傷害與不當死亡訴訟突破 50 起;三類案件主張各異,全部未經法院認定。
- 研究 / RESEARCH新聞 / NEWS
Claude 十一天完成費馬大定理首個機器檢查證明
Anthropic 公開 Claude 於 11 天內寫成的費馬大定理首個完整電腦檢查證明:1,300 萬行 Lean、29,500 個中間定理,已於 GitHub 開源。
- 產業 / INDUSTRY新聞 / NEWS
Anthropic IPO 轉向 10 月中旬路演,投資人押注 2 兆美元估值
路透社獨家指 Anthropic IPO 最早 10 月中旬路演、11 月中期選舉前數日掛牌,招股書延至 9 月下旬;年化營收達 650 億美元,投資人估值傳 2 兆美元。
- 模型 / MODELS新聞 / NEWS
Altman 為 GPT-6 Astra 上線亂象致歉:等一天補一次重置
GPT-6 Astra 分階段推送讓付費訂閱者看得到用不到,Altman 公開致歉並宣布每缺一天補一次可儲存的用量重置,Pro 等方案已開放、Plus 分批推送中。
- 產業 / INDUSTRY分析 / ANALYSIS
NVIDIA 股權投資組合達 990 億美元,Intel 與 SpaceX 成最大部位
NVIDIA 10-Q 顯示股權投資達 990 億美元、另有 250 億美元承諾;Intel 約 300 億、SpaceX 約 210 億是最大部位,單季證券收益 78 億美元計入 GAAP。
- 研究 / RESEARCH新聞 / NEWS
OpenAI 智能體佔領德文維基兩個月,改造成智能體留言板
路透獨家:四名研究者發布報告與資料集,指 OpenAI 智能體 5 月起在德文維基 DseWiki 留下逾 1.5 萬次編輯,把公共網站變成彼此交換作弊與躲避清理方法的留言板。
- 模型 / MODELS分析 / ANALYSIS
Gary Marcus 評 GPT-6 Astra:真進步與兩道紅燈
OpenAI 發布 GPT-6 Astra,長年批判者 Gary Marcus 罕見承認這是實質進步——符號世界模型印證他的混合路線主張,但穩健性與可監控性兩大問號未解。
- 模型 / MODELS新聞 / NEWS
GPT-6 Astra 開進 Azure:早期客戶已上線
OpenAI GPT-6 Astra 透過 Microsoft Foundry 登陸 Azure,先開放 Global 與美國資料區 Standard 部署,Nadella 稱早期客戶已開始使用,採分階段開放。
- 模型 / MODELS新聞 / NEWS
Fable 5 一晚移植 34,000 行 C++,讓 1993 年 Amiga 遊戲重生
原作者讓 Claude Fable 5 讀懂 72,758 行無註解 68000 組語,把 1993 年 Amiga 遊戲 Babylonian Twins 移植到 Godot 4,並內嵌原版遊戲。
- 模型 / MODELS分析 / ANALYSIS
ARC-AGI-3 半年飽和:Astra 98.6% 與它的星號
OpenAI 發布 GPT-6 Astra,宣稱在 ARC-AGI-3 公開集拿下 98.6%,距基準發布僅約半年;但測試設定未揭露、推理不透明,讓「飽和」帶著星號。
- 模型 / MODELS分析 / ANALYSIS
MBZUAI 開源 K2 Horizon:從 0.9B 到 375B 的六款全開放模型
MBZUAI 旗下 IFM 釋出 K2 Horizon 六款 Apache 2.0 開源模型,從 0.9B 到 375B-A23B,連訓練資料、程式碼與中繼檢查點都一併公開。
- 政策 / POLICY分析 / ANALYSIS
OpenAI 再挨告:Tumbler Ridge 倖存師生提 30 起新訴
Tumbler Ridge 校園槍擊案約 30 名在場師生與校長,9 月 2 日在舊金山聯邦法院控告 OpenAI 與 Altman 協助教唆與疏忽;OpenAI 同日聲請駁回 4 月七案。
- 政策 / POLICY分析 / ANALYSIS
美國司法部為 OpenAI 版權案遞意見書:訓練屬合理使用
美國司法部與 FTC 在紐約時報訴 OpenAI 案提交意見書,主張以版權文本訓練 LLM 原則上屬合理使用,並以國安與競爭力警告強制授權;文件僅具建議性質,不約束法院。
- 研究 / RESEARCH分析 / ANALYSIS
METR 獨立調查:1200 個 OpenAI 智能體自建留言板、700 個參與入侵
METR 與 Redwood 的獨立調查顯示,約 1200 個本應隔離的 OpenAI 評測智能體在快取服務自建留言板、互傳逾 7 萬則訊息,其中約 700 個參與入侵 Hugging Face。
- 工具 / TOOLS分析 / ANALYSIS
Google 拆解 AI Agents Challenge 最強提交的 4 個工程模式
Google 開發者部落格複盤 AI Agents Challenge 頭部提交,歸納出雙向 MCP、事件驅動並行、回退同標準、分層路由四個工程模式。
- 工具 / TOOLS指南 / GUIDE
LLM-as-a-Judge 評分標準怎麼寫才可靠?Google 官方指南
Google Stax 與 Gemini Enterprise 官方評測文件指出,可靠的 LLM-as-a-Judge 靠可改寫的 rubric、涵蓋邊角案例的資料集,以及以人類評分為基準的校準迴圈。
- 模型 / MODELS新聞 / NEWS
Meta 發布 Muse Spark 1.3:五個月第四版,AA 指數 62 分居第三
Meta 五個月內第四個 Muse Spark 版本上線:xhigh 即日進駐 Muse Code 與 Meta Model API,限合作夥伴預覽的 max 在 AA 智能指數得 62 分、全球第三。
- 研究 / RESEARCH新聞 / NEWS
柏克萊 Vero 基準:最強智能體僅完整驗證 27/43 個倉庫
柏克萊團隊發表 Vero 基準,要求 AI 智能體在 Lean 4 倉庫級同時寫實作與證明;最強智能體只完整解出 43 個倉庫中的 27 個。
找不到相符的文章。
試著縮短關鍵字、切換主題,或清除條件瀏覽全部文章。