輸出是否可靠
不只看示範畫面;確認結果品質、失敗模式、可重現性,以及人工覆核要付出多少成本。
這裡集中收錄工具實測與產品分析;文章會明確說明證據來自實際操作、官方資料或第三方評測,不把功能公告包裝成親自實測。
不只看示範畫面;確認結果品質、失敗模式、可重現性,以及人工覆核要付出多少成本。
釐清資料保存、權限、供應商依賴與地端選項,避免功能好用卻跨過團隊不能接受的邊界。
把價格、延遲、整合與維運放在同一張決策表,而不是只比較模型分數或行銷功能清單。
OpenRouter 推出 Classifiers 測試版,讓企業對每次 AI 請求附加結構化元資料,按任務類型、部門、合規類別與成本中心分類,非同步執行不增加推論延遲。
Anthropic 官方部落格揭露為 Claude Opus 5 與 Fable 5 移除 Claude Code 超過 80% 系統提示詞,編碼評測無顯著退步,並提出五條上下文工程新規則與 claude doctor 指令。
開源工具 claude-thermos 以本地反向代理監控 Claude Code 會話,在主智能體等待子智能體時自動刷新提示詞快取,作者量測可省下約 22% 帳單。
Anthropic 將 Claude 語音模式從 Haiku 升級到 Opus 與 Sonnet,新增連接工具呼叫與 11 種語言,搶進行動語音助理市場。
百度搭子在成都 AI Day 升級智能路由、跨端共享記憶、桌面內嵌瀏覽器與 PPT 生成,企業版與搭子聯盟同步登場,日均提問次數較上線初暴增 20 倍。
新開源分詞器 GigaToken 以 SIMD 與多層快取改寫 BPE 效能,在 144 核 AMD EPYC 上對 GPT-2 達 24.53 GB/s,較 HuggingFace Tokenizers 快 989 倍,並可直接替代 HF 與 tiktoken。
OpenAI 將 Health in ChatGPT 擴大至全美 18 歲以上用戶,可連結 Apple Health 與 Epic、Oracle Health 等醫療體系病歷,並推進到主對話流程,背後由 GPT-5.6 Sol 支撐。
OpenAI 將 ChatGPT Voice 推入桌面版,由 GPT-Live 驅動,可同時說話、聆聽並協調多個智慧代理,macOS 與 Windows 全球推送。
Runway 在 Agent 中上線 Workflows,使用者可透過自然語言建立、執行、編輯節點式工作流,把生成式模型串成可規模化重複使用的內容產線。
xAI 釋出 Grok Build 終端編程代理,由 Grok 4.5 驅動,內建 Skills、Plan mode、Subagents 與 MCP,免費開放試用,直接挑戰 Claude Code 與 Codex CLI。
開發者 slvDev 把 28.9M 參數語言模型塞進約 8 美元的 ESP32-S3,靠 Per-Layer Embeddings 將 25M 參數留在快閃記憶體,端到端約 9.5 tok/s 完全離線生成。