三週一次的改版節奏:Pro 與 Ultra 訂閱戶先拿到 3.7 Flash

Google 在 2026 年 8 月 13 日於官方部落格發表 Gemini 3.7 Flash,距離前一代 3.6 Flash 的推出僅相隔三週,是 Google 近期模型迭代最密集的一次。這波更新首先向 Gemini 應用程式中的 Google AI Pro 與 Google AI Ultra 訂閱用戶開放,涵蓋超過 160 個國家與地區;免費用戶何時跟進,官方公告並未載明。

在定位上,Google 把 3.7 Flash 稱為「至今最聰明的工作馬模型(workhorse model)」,主力場景是程式開發與代理式(agentic)工作流程。相較於追求極限能力的高階型號,「工作馬」系列強調在速度、成本與智力之間取得平衡,是多數日常任務實際呼叫到的模型。也因為它是被呼叫最多的一層,三週一次的改版才會直接影響大量使用者的日常體驗——從聊天問答、文件整理到程式輔助,都落在這個型號的服務範圍。

值得留意的是發表時機:Google 母公司 Alphabet 才在 2026 年第二季財報中揭露 Gemini 應用的用戶規模與 AI 相關成本走勢,緊接著就以三週節奏更新主力模型,顯示 Flash 系列已經是 Google 日常營運與對外競爭的核心武器(相關數字整理可見 Alphabet Q2 財報與 Gemini 用戶數報導)。

效能重點:複雜文件的多步推理明顯進步

這次改版最明確的量化進步,出現在複雜文件處理。Google 官方公告列出的評測結果顯示,3.7 Flash 在 GDP.pdf 評測上拿下 34.0%,前代 3.6 Flash 為 22.0%,一個世代就拉開 12 個百分點。GDP.pdf 衡量的是模型處理專家級 PDF 文件、並在其中執行多步推理的能力——也就是把長文件讀懂、交叉比對多處內容再回答的場景,正是知識工作中最消耗人工的環節。

除了單一評測,Google DeepMind模型卡說明,3.7 Flash 的評測範圍涵蓋推理、程式開發、代理式工具使用、多模態與多輪對話等面向。對使用者的意義在於:這不是只衝單一分數的改版,而是針對「模型被實際使用的完整鏈路」做評測——尤其代理式工具使用與多輪對話,正是 AI 助理長時間執行任務時最容易出錯的地方。

兩輛運載文件卷軸的紙製馬車分別通過兩座秤橋,載運較多文件的一輛明顯走在前方。
圖1 在同樣的複雜文件評測上,3.7 Flash 對長文件的多步推理表現較前代明顯提升。

Gemini Spark 同步換上新模型

發表內容另一個重點,是 Google 的個人 AI 代理 Gemini Spark 已改跑 3.7 Flash。Spark 在 3.5 世代即以 Flash 模型驅動,負責全天候替用戶處理代辦任務;這次換上新模型後,官方公告特別點出它對 Google Workspace 應用的工具呼叫有所改進,知識工作效率隨之提升。

用白話拆解「工具呼叫改進」:代理任務的成敗,很大程度取決於模型每一步決定「呼叫哪個工具、帶什麼參數、要不要再確認一次」。例如要從多份文件與郵件彙整出一份摘要,模型必須正確判斷先抓哪個檔案、用什麼條件搜尋、結果夠不夠完整。工具呼叫越準,代理就越不需要人類中途接手。對已訂閱 Pro 或 Ultra 的用戶來說,這項升級不需要另行設定,Spark 的表現會隨模型一起提高。

API 端同步正式可用:促銷價只到 2026 年底

模型不只是聊天應用的升級,開發者端也同步到位。Gemini API 官方發行說明確認 3.7 Flash 已達正式可用(GA)狀態,並提供促銷價至 2026 年 12 月 31 日:輸入每百萬 token 0.75 美元、輸出每百萬 token 3.75 美元。

發行說明載明的期限背後有個必須看清楚的計價結構:2027 年 1 月 1 日起恢復標準價,輸入 1.50 美元、輸出 7.50 美元,等於輸出價是促銷價的兩倍。對照前代 3.6 Flash 輸出每百萬 token 1.50 美元的定價,3.7 Flash 的標準價明顯高於前代——Google 用促銷窗口降低開發者的試用門檻,但長期部署的成本模型應以標準價計算,而不是今天的促銷價。

一座驛站櫃檯上放著硬幣與紙片組成的計量秤,旁邊的撕頁日曆停在年底。
圖2 促銷價讓開發者能用較低成本試用新模型,但期限過後將回到兩倍的標準價。

開發工具鏈當天跟進

模型生態的採用速度也是這次發表的一個訊號。GitHub 的官方變更紀錄顯示,3.7 Flash 已於同日進入 GitHub Copilot,按供應商定價計費。變更紀錄載明的這項時程意味著:開發者不必等 Google 自家產品逐步鋪開,主流程式開發工具在發表當天就能選用新模型。

對以程式開發為主的用戶,這縮短了「模型發表」到「實際在日常工作流裡用到」的距離。3.7 Flash 主打的除錯、議題解析與可用等級程式碼生成等場景,正好落在 Copilot 這類工具的核心用途上,第一天就能被真實工作負載檢驗。

對訂閱戶與開發者的實際影響

把這次更新拆成三類受影響的人來看,下一步各自清楚。首先是 Gemini 應用的 Pro 與 Ultra 訂閱戶:升級已經生效,最有感的預期會是多文件、多步驟的任務,例如彙整資料、長文件的交叉問答,以及交給 Spark 的代理任務。其次是 API 開發者:促銷價是低門檻的評估窗口,適合現在就把 3.7 Flash 放進評測管線,與現行模型做同一組任務的對比;但在做 2027 年的預算時,務必以 1.50/7.50 美元的標準價試算,避免把促銷價當成常態。最後是企業採購端:模型已達 GA,進入正式可用階段,整合評估可以啟動,但同樣要看清標準價的長期成本。

另外值得注意定價策略的訊號:前代 3.6 Flash 用的是壓低輸出 token 價格的路線,3.7 Flash 則改走「高標準價+限時促銷」。這種結構對 Google 有利於先用低價換取遷移量、再在明年恢復價格,對開發者則是明確的時間壓力——促銷期結束前後的用量與遷移數據,會是觀察這個策略是否奏效的指標,見〈OpenAI 大砍 Luna 價格〉。

尚待驗證的部分與後續觀察指標

有幾件事官方資料沒有給出答案。第一,免費層與更廣泛企業方案的開放時程未載明,本文不做推測。第二,網路上流傳的各項第三方評測分數,除非出現在 Google 官方文件或 DeepMind 模型卡上,本文一律不採;模型卡上的完整評測表格(含各項基準的分項數字)應以原始頁面為準。第三,公告強調的速度與 token 效率改善屬於方向性描述,實際的延遲與成本表現仍需在各自的工作負載上量測。

後續值得追蹤的指標有三個:一是 2027 年 1 月 1 日恢復標準價前後,API 用量是否出現明顯回落,這能檢驗促銷策略的實際黏著度;二是 Gemini Spark 在 Workspace 實際任務中的工具呼叫成功率,這比任何單項評測分數更能反映代理式工作的可用性;三是三週一次的改版節奏是否延續——如果成立,模型版本的「新鮮度」本身將變成訂閱與採購決策的一部分,而不是一次性的升級事件。