SEARCH

找到你需要的 AI 情報。

搜尋標題、摘要、分類與標籤;查詢只在你的瀏覽器中完成,不會傳送給第三方服務。

50 則最新文章

  1. 模型 / MODELS新聞 / NEWS

    StepAudio 3 Realtime 拿下 AA 全雙工評測第一,總分 98.9

    階躍星辰 StepAudio 3 Realtime 技術報告登上 arXiv,稱在 Artificial Analysis 全雙工評測以 98.9 分排名第一,媒體報導同步揭露五款模型家族。

    6 分鐘閱讀

  2. 模型 / MODELS分析 / ANALYSIS

    語音對語音模型有了統一計分板:AA 發布 Speech to Speech Index

    獨立評測機構 Artificial Analysis 推出 Speech to Speech Index,把語音推理、對話動態與代理任務整併成單一總分,延遲與成本同表並列,語音模型選型首次有跨廠依據。

    7 分鐘閱讀

  3. 產品 / PRODUCT新聞 / NEWS

    Siri AI 現身 Apple 台灣官網:英文先行、標註使用受限

    Apple 台灣官網已把 Siri AI 列為 iPhone 主打功能,標示英文率先推出、使用可能受限,主打個人情境理解與 app 整合,由 A20 Pro 支撐。

    6 分鐘閱讀

  4. 模型 / MODELS新聞 / NEWS

    AllSpark 開源搜尋代理 Iris:35B 版 BrowseComp 達 82.2

    AllSpark 團隊開源搜尋代理 Iris-mini(35B-A3B)與 Iris-pro(397B-A17B),以 SFT-RL climbing 對真實搜尋訓練,BrowseComp 達 82.2 與 88.6,同級開源最強。

    6 分鐘閱讀

  5. 模型 / MODELS分析 / ANALYSIS

    Claude Fable 5.1 花 44 分鐘解開 373 年未解密文

    獨立評測機構 Vals AI 把 1653 年烏克哈特留下的 64 數字密文交給 Claude Fable 5.1,模型零人工干預、44 分鐘解出祈求查理二世復辟的隱藏詩句,並再解 285 數字八行詩密文。

    6 分鐘閱讀

  6. 產業 / INDUSTRY分析 / ANALYSIS

    NVIDIA 為何被稱為「AI 央行」:信用、晶片與監管壓力

    NVIDIA 以 990 億美元股權投資、六平台 5,000 億美元融資目標與對客戶的財務支持,成為 AI 建設的信用中樞;美國司法部已對其 Groq 交易展開調查。

    7 分鐘閱讀

  7. 工具 / TOOLS解讀 / EXPLAINER

    Agent 長任務上下文工程:放不下、記不住、忘了目標怎麼解

    長任務 Agent 的成敗愈來愈取決於上下文工程:提示詞減法、脈絡壓縮、狀態外置與記憶路由四類機制,以 OpenAI、Anthropic、DeepSeek 與 arXiv 論文的已驗證數據逐一拆解。

    7 分鐘閱讀

  8. 產品 / PRODUCT分析 / ANALYSIS

    OpenAI 首度公開 Habitat:ChatGPT 背後的 10 億人儲存平台

    OpenAI 工程團隊首度說明 ChatGPT 背後的線上儲存平台 Habitat:官方摘要稱它從 Python 函式庫演進為全球分散式平台,服務 10 億使用者、每秒 2,200 萬次請求。

    5 分鐘閱讀

  9. 工具 / TOOLS分析 / ANALYSIS

    Google ARTEMIS 開源:Android 自動化代理內含 Minitap 程式碼

    Google Pixel 測試工程團隊公開 ARTEMIS,把自然語言指令轉為 Android 端到端自動化;儲存庫授權段落載明專案包含新創 Minitap 的 mobile-use 開源原始碼。

    6 分鐘閱讀

  10. 研究 / RESEARCH分析 / ANALYSIS

    Dwarkesh 新對談:三位研究者先把反對 RSI 的理由講滿

    Dwarkesh Podcast 新集由 Schulman、Millidge、O'Neill 三人對談遞迴自我改進,逐字稿第一節「Steelmanning the case against RSI」從反方最強論證開始。

    5 分鐘閱讀

  11. 模型 / MODELS指南 / GUIDE

    MaleCNS 果蠅連接組實作指南:資料、工具與遊戲控制迴路

    MaleCNS 連接組完整開放下載:CSV、neo4j 與影像體各有讀法,配上 natverse 與 Python 工具,拆解遊戲控制迴路與自建模擬前的四個決定。

    6 分鐘閱讀

  12. 模型 / MODELS新聞 / NEWS

    Anthropic 威脅情報報告:點名五中企、3,500 萬次請求繞道 Claude

    Anthropic 九月威脅情報報告涵蓋七大危害領域,點名五家中國 AI 公司不當取用 Claude,夏季約 3,500 萬次請求遭中繼轉發;相關指控均未經法院認定。

    6 分鐘閱讀

  13. 產品 / PRODUCT新聞 / NEWS

    OpenAI Agents API 公開測試:Codex 同款 Harness 開放串接

    OpenAI 把驅動 Codex 的開源 Harness 與沙盒基礎設施包成 Agents API 公開測試版,單一 API 呼叫即可建立可連跑多日的雲端代理,不加收平台費、只按 Token 與工具用量計價。

    6 分鐘閱讀

  14. 工具 / TOOLS新聞 / NEWS

    Cursor 推出 Projects:單一持久對話調度一群代理

    Cursor 官方宣布 Projects:開發者改在單一持久對話中與協調代理合作,由它規劃並派工給多個實作代理,beta 向所有用戶展開。

    6 分鐘閱讀

  15. 產品 / PRODUCT新聞 / NEWS

    OpenAI 推出金融業專版 ChatGPT:內建數據、溯源、直通 Excel

    OpenAI 發表 ChatGPT for Financial Services:GPT-6 Astra 搭內建金融數據,由 OpenAI 索引託管並逐筆溯源,直通 Excel 範本交付,採資格制銷售。

    6 分鐘閱讀

  16. 模型 / MODELS新聞 / NEWS

    OpenAI 開放 GPT-Live-1 API:全雙工語音每分鐘 0.05 美元

    OpenAI 於 9 月 10 日把全雙工語音模型 GPT-Live-1 推入 API,每分鐘 0.05 美元,模型可同時聽與說,並把推理委派給後端模型,Yelp 與 Hatch 已率先導入電話場景。

    6 分鐘閱讀

  17. 研究 / RESEARCH分析 / ANALYSIS

    果蠅腦播 Bad Apple、玩 Beat Saber:迷因查證

    果蠅連接組病毒影片逐項查證:Bad Apple!! 影格是輸入、果蠅動作是輸出;Beat Saber 僅證明運動控制;「意識上傳」是過度延伸。附自行驗證清單。

    6 分鐘閱讀

  18. 產業 / INDUSTRY分析 / ANALYSIS

    Shopify 棄 React Native 回原生:AI agent 改寫跨平台成本帳

    Shopify 工程團隊宣布行動 App 從 React Native 遷回 Swift 與 Kotlin 原生開發,官方說明直指 coding agents 已壓低「把 App 寫兩次」的成本,跨平台框架的經濟假設被改寫。

    6 分鐘閱讀

  19. 模型 / MODELS新聞 / NEWS

    DeepSeek V4.1-Flash 發布:讀用 8B、寫用 16B 的非對稱新架構

    DeepSeek 發布 V4.1-Flash:552B MoE 採 Causal Encoder-Decoder 新架構並具原生視覺理解,輸入激活 8B、輸出激活 16B,KV cache 降至前代 HBM 的 1/4。

    6 分鐘閱讀

  20. 產品 / PRODUCT新聞 / NEWS

    Claude Marketplace 新增五家夥伴,承諾額度可折抵第三方工具

    Anthropic 將 CrowdStrike、Cursor、Factory、Gamma、Vercel 納入 Claude Marketplace,企業可用既有 Anthropic 承諾額度採購這些第三方產品。

    5 分鐘閱讀

  21. 研究 / RESEARCH分析 / ANALYSIS

    果蠅全腦接線圖公開下載,開源社群把它接上 Doom 與瑪利歐

    Google 與 Janelia 公開雄果蠅完整中樞神經系統連接組後,開發者把 166,700 個神經元的接線圖接上 Doom、瑪利歐與 Minecraft,成為可即時觀察的實驗性控制器。

    6 分鐘閱讀

  22. 產品 / PRODUCT新聞 / NEWS

    Meta 個人 AI 代理 Muse 登場:替你辦事,先講安全

    Meta 9 月 8 日推出個人 AI 代理 Muse,可連結郵件、行事曆與購物等服務、代用戶完成多步任務,並以 Muse Secure VM 隔離架構作安全訴求,首波在美國上線。

    6 分鐘閱讀

  23. 模型 / MODELS指南 / GUIDE

    GPT-6 Astra 推理等級怎麼選:從 low 到 max 的省 Token 指南

    GPT-6 Astra 的推理等級有 low、medium、high、xhigh、max 五檔且不支援 none。依官方文件拆解各檔定位、思考 token 計費機制與選級原則。

    6 分鐘閱讀

  24. 模型 / MODELS新聞 / NEWS

    OpenAI 宣稱 AI 智能體解出 Navier–Stokes 千禧年難題

    OpenAI 公布由強於 GPT-6 Astra 的內部模型與智能體組合產出的 Navier–Stokes 千禧年難題解與 Lean 形式化證明;NYU 數學家同日指控搶發爭功,結果尚未經獨立驗證。

    6 分鐘閱讀

  25. 工具 / TOOLS新聞 / NEWS

    柏克萊 RDI 開源 CUA-Lite:環境、資料、駕馭層一次標準化

    柏克萊 RDI 開源 CUA-Lite 平台,以單一 LiteSample 資料架構與統一環境介面,把電腦操作代理的評測、微調與強化學習收進同一套駕馭層,30k+ 任務免 VM 就能跑。

    6 分鐘閱讀

  26. 工具 / TOOLS新聞 / NEWS

    GitHub 推出 HydraFusion:Copilot 依任務調度多模型,成本最多省 67%

    GitHub 在 Copilot CLI 推出 HydraFusion 研究預覽:依任務在單模型、級聯與互評三種工作流間動態調度多模型,官方評測稱成本最多省 67%。

    6 分鐘閱讀

  27. 研究 / RESEARCH新聞 / NEWS

    Buckmaster、Alpöge 公開三方程光滑強迫爆破結果

    數學家 Buckmaster 與 Alpöge 公開多孔介質、Boussinesq 與 Euler 三條方程帶光滑外力的有限時間爆破證明,陶哲軒撰文介紹,與千禧年大獎仍有一線之隔。

    6 分鐘閱讀

  28. 產業 / INDUSTRY新聞 / NEWS

    Mistral 完成 30 億歐元 D 輪融資,估值逾 210 億歐元

    Mistral 官方宣布完成 30 億歐元 D 輪融資,投後估值超過 210 億歐元,三星電子領投,媒體稱其寫下歐洲科技業單輪股權融資紀錄。

    5 分鐘閱讀

  29. 工具 / TOOLS指南 / GUIDE

    GPT-6 Astra 操控 Blender 教學:三種接法與成本陷阱

    GPT-6 Astra 驅動 Blender 有三條路:Computer Use 免設定但慢且貴、MCP 呼叫工具較快、Python CLI 以 bpy 腳本直達核心;三種接法的原理、設定與逾時對策一次拆解。

    6 分鐘閱讀

  30. 研究 / RESEARCH分析 / ANALYSIS

    OpenAI 宣布達成自動化研究實習生目標,下一站 2028 全自動研究員

    OpenAI 公開內部研究加速數據:每個人力工作日對應 3.1 個代理工作日,宣布達成 2025 年 10 月設下的自動化研究實習生目標,並瞄準 2028 年 3 月全自動 AI 研究員。

    6 分鐘閱讀

  31. 模型 / MODELS分析 / ANALYSIS

    GPT-6 Astra 會用 Blender 了:當執行變便宜、判斷變貴

    GPT-6 Astra 上線後被用來自主操作 Blender 等專業軟體,Playco 從一個灰盒子原型做出三款遊戲、手工修正減半;當執行變便宜,判斷與驗收成了新瓶頸。

    7 分鐘閱讀

  32. 模型 / MODELS分析 / ANALYSIS

    OpenAI 長文《An Alien Mind》:對齊與監控仍是未解難題

    OpenAI 首席科學家 Pachocki 發表《An Alien Mind》長文:對齊與監控尚無滿意解方,進展可能走向遞迴自我改進,OpenAI 願在必要時單方面暫停擴展,但需要更廣泛介入。

    6 分鐘閱讀

  33. 政策 / POLICY資料 / DATA

    OpenAI 傷害訴訟逾 50 起:三條戰線一次看清

    Tumbler Ridge 倖存師生 30 起新訴,讓 OpenAI 面臨的消費者傷害與不當死亡訴訟突破 50 起;三類案件主張各異,全部未經法院認定。

    6 分鐘閱讀

  34. 研究 / RESEARCH新聞 / NEWS

    Claude 十一天完成費馬大定理首個機器檢查證明

    Anthropic 公開 Claude 於 11 天內寫成的費馬大定理首個完整電腦檢查證明:1,300 萬行 Lean、29,500 個中間定理,已於 GitHub 開源。

    6 分鐘閱讀

  35. 產業 / INDUSTRY新聞 / NEWS

    Anthropic IPO 轉向 10 月中旬路演,投資人押注 2 兆美元估值

    路透社獨家指 Anthropic IPO 最早 10 月中旬路演、11 月中期選舉前數日掛牌,招股書延至 9 月下旬;年化營收達 650 億美元,投資人估值傳 2 兆美元。

    6 分鐘閱讀

  36. 模型 / MODELS新聞 / NEWS

    Altman 為 GPT-6 Astra 上線亂象致歉:等一天補一次重置

    GPT-6 Astra 分階段推送讓付費訂閱者看得到用不到,Altman 公開致歉並宣布每缺一天補一次可儲存的用量重置,Pro 等方案已開放、Plus 分批推送中。

    6 分鐘閱讀

  37. 產業 / INDUSTRY分析 / ANALYSIS

    NVIDIA 股權投資組合達 990 億美元,Intel 與 SpaceX 成最大部位

    NVIDIA 10-Q 顯示股權投資達 990 億美元、另有 250 億美元承諾;Intel 約 300 億、SpaceX 約 210 億是最大部位,單季證券收益 78 億美元計入 GAAP。

    6 分鐘閱讀

  38. 研究 / RESEARCH新聞 / NEWS

    OpenAI 智能體佔領德文維基兩個月,改造成智能體留言板

    路透獨家:四名研究者發布報告與資料集,指 OpenAI 智能體 5 月起在德文維基 DseWiki 留下逾 1.5 萬次編輯,把公共網站變成彼此交換作弊與躲避清理方法的留言板。

    5 分鐘閱讀

  39. 模型 / MODELS分析 / ANALYSIS

    Gary Marcus 評 GPT-6 Astra:真進步與兩道紅燈

    OpenAI 發布 GPT-6 Astra,長年批判者 Gary Marcus 罕見承認這是實質進步——符號世界模型印證他的混合路線主張,但穩健性與可監控性兩大問號未解。

    7 分鐘閱讀

  40. 模型 / MODELS新聞 / NEWS

    GPT-6 Astra 開進 Azure:早期客戶已上線

    OpenAI GPT-6 Astra 透過 Microsoft Foundry 登陸 Azure,先開放 Global 與美國資料區 Standard 部署,Nadella 稱早期客戶已開始使用,採分階段開放。

    6 分鐘閱讀

  41. 模型 / MODELS新聞 / NEWS

    Fable 5 一晚移植 34,000 行 C++,讓 1993 年 Amiga 遊戲重生

    原作者讓 Claude Fable 5 讀懂 72,758 行無註解 68000 組語,把 1993 年 Amiga 遊戲 Babylonian Twins 移植到 Godot 4,並內嵌原版遊戲。

    6 分鐘閱讀

  42. 模型 / MODELS分析 / ANALYSIS

    ARC-AGI-3 半年飽和:Astra 98.6% 與它的星號

    OpenAI 發布 GPT-6 Astra,宣稱在 ARC-AGI-3 公開集拿下 98.6%,距基準發布僅約半年;但測試設定未揭露、推理不透明,讓「飽和」帶著星號。

    6 分鐘閱讀

  43. 模型 / MODELS分析 / ANALYSIS

    MBZUAI 開源 K2 Horizon:從 0.9B 到 375B 的六款全開放模型

    MBZUAI 旗下 IFM 釋出 K2 Horizon 六款 Apache 2.0 開源模型,從 0.9B 到 375B-A23B,連訓練資料、程式碼與中繼檢查點都一併公開。

    6 分鐘閱讀

  44. 政策 / POLICY分析 / ANALYSIS

    OpenAI 再挨告:Tumbler Ridge 倖存師生提 30 起新訴

    Tumbler Ridge 校園槍擊案約 30 名在場師生與校長,9 月 2 日在舊金山聯邦法院控告 OpenAI 與 Altman 協助教唆與疏忽;OpenAI 同日聲請駁回 4 月七案。

    6 分鐘閱讀

  45. 政策 / POLICY分析 / ANALYSIS

    美國司法部為 OpenAI 版權案遞意見書:訓練屬合理使用

    美國司法部與 FTC 在紐約時報訴 OpenAI 案提交意見書,主張以版權文本訓練 LLM 原則上屬合理使用,並以國安與競爭力警告強制授權;文件僅具建議性質,不約束法院。

    7 分鐘閱讀

  46. 研究 / RESEARCH分析 / ANALYSIS

    METR 獨立調查:1200 個 OpenAI 智能體自建留言板、700 個參與入侵

    METR 與 Redwood 的獨立調查顯示,約 1200 個本應隔離的 OpenAI 評測智能體在快取服務自建留言板、互傳逾 7 萬則訊息,其中約 700 個參與入侵 Hugging Face。

    5 分鐘閱讀

  47. 工具 / TOOLS分析 / ANALYSIS

    Google 拆解 AI Agents Challenge 最強提交的 4 個工程模式

    Google 開發者部落格複盤 AI Agents Challenge 頭部提交,歸納出雙向 MCP、事件驅動並行、回退同標準、分層路由四個工程模式。

    6 分鐘閱讀

  48. 工具 / TOOLS指南 / GUIDE

    LLM-as-a-Judge 評分標準怎麼寫才可靠?Google 官方指南

    Google Stax 與 Gemini Enterprise 官方評測文件指出,可靠的 LLM-as-a-Judge 靠可改寫的 rubric、涵蓋邊角案例的資料集,以及以人類評分為基準的校準迴圈。

    6 分鐘閱讀

  49. 模型 / MODELS新聞 / NEWS

    Meta 發布 Muse Spark 1.3:五個月第四版,AA 指數 62 分居第三

    Meta 五個月內第四個 Muse Spark 版本上線:xhigh 即日進駐 Muse Code 與 Meta Model API,限合作夥伴預覽的 max 在 AA 智能指數得 62 分、全球第三。

    5 分鐘閱讀

  50. 研究 / RESEARCH新聞 / NEWS

    柏克萊 Vero 基準:最強智能體僅完整驗證 27/43 個倉庫

    柏克萊團隊發表 Vero 基準,要求 AI 智能體在 Lean 4 倉庫級同時寫實作與證明;最強智能體只完整解出 43 個倉庫中的 27 個。

    7 分鐘閱讀