降價現場:7 月 30 日起的官方價目
這一波調價的第一手依據,是 OpenAI 官方文章〈Advancing the price-performance frontier with GPT-5.6〉:自 7 月 30 日起,Terra 每百萬輸入 token 2 美元、輸出 12 美元,Luna 更低。對照 OpenAI API 定價文件,gpt-5.6-luna 的標準輸入為每百萬 0.20 美元、快取輸入 0.02 美元、輸出 1.20 美元;同一份文件也載明,資料駐留端點要再加收 10%。
兩組數字放在一起看,重點不是「降了多少」,而是結構:同一個 GPT-5.6 家族內,Luna 與 Terra 的輸入、輸出單價都剛好差 10 倍。OpenAI 等於把「便宜一個數量級」正式寫進產品線價目表,而不是短期促銷。這個定價動作發生在 Anthropic 於 7 月 24 日發表 Claude Opus 5 之後一週內,兩家美國前線實驗室在旗艦發表節奏上貼身競爭,定價就成了下一個正面交鋒的戰場。
值得注意的是,OpenAI 把這篇文章的標題直接定為「推進價格效能前緣」——定價本身已經被當成產品訊息來溝通,而不只是後台的費率更新。對開發者來說,這代表選型決策的時間軸變了:牌價調整會在幾週內改變不同供應商之間的相對成本,值得定期重算,見〈Gemini 3.7 Flash 促銷價〉。
降價為何成立:分層、快取與批次的三重槓桿
單價能壓到 0.20 美元這個量級,靠的不是單一技巧,而是三個互相疊加的槓桿。
第一是家族分層。GPT-5.6 用 Terra 與 Luna 兩個層級把工作負載分開:需要較強能力的任務走 Terra,高頻、格式化、可大量平行的任務走 Luna。當大量推理需求可以被導向較小的模型,供應端就能用較低的單價覆蓋這一塊需求,Luna 與 Terra 之間整整 10 倍的價差,就是把「能力分層」直接換算成「價格分層」。
第二是快取。多數應用的 API 呼叫都帶著重複的系統提示、工具定義與長上下文;這些前綴一旦命中快取,輸入成本就從 0.20 美元降到 0.02 美元,再砍一個數量級。對客服、文件問答、程式碼助理這類「同一套上下文反覆跑」的場景,快取才是真正決定帳單的變數。
第三是批次與服務層級的細分。OpenAI 的定價文件把標準、優先與批次等處理層級分開計價,資料駐留再另外加收 10%;這種細分讓願意交換延遲或彈性的客戶換到更低單價,也讓牌價有更多下調空間。Anthropic 端也有對應設計:Claude Opus 產品頁載明快取最高可省 90%、批次模式省 50%。換句話說,兩家都在把「一次性牌價」改造成「依使用方式浮動的成本結構」。

中國對手的價格地板:DeepSeek 的官方數字
這波降價的壓力來源,必須回到中國供應商的官方價目表才能看清。DeepSeek 官方定價文件對現行兩個模型列出的人民幣牌價是:快取命中輸入每百萬 0.02 元與 0.025 元、未命中輸入 1 元與 3 元、輸出 2 元與 6 元;以約 7 元人民幣兌 1 美元換算,相當於快取命中輸入約 0.0028/0.0035 美元、未命中約 0.14/0.42 美元、輸出約 0.28/0.85 美元。
拿 Luna 的新價對比最便宜欄位:輸出 1.20 美元仍是 0.28 美元的約 4.3 倍;快取命中輸入 0.02 美元對 0.0028 美元,差距約 7 倍。也就是說,OpenAI 把主力模型拉進「0.x 美元」這個數量級之後,的確首度與中國供應商站在同一個量級對話,但整個市場的價格地板仍然在中國陣營手上。對成本極度敏感、且能接受在地緣與合規上另做評估的團隊,這個價差大到不能假裝不存在,見〈V4-Pro 上架矽基流動〉。
這也解釋了美國兩家為何急著重新定價:當能力差距縮小,單價就從次要採購條件變成主要決策變數。OpenAI 選擇直接砍 Luna 牌價搶量;Anthropic 則用另一種方式回應。
Anthropic 的選擇:旗艦單價不動,靠折扣結構應戰
Anthropic 官方的 Claude Opus 頁面目前載明的旗艦定價,是每百萬輸入 5 美元、輸出 25 美元,並標示快取最高可省 90%、批次省 50%。換算下來,Opus 的輸入是 Luna 的 25 倍、輸出約 21 倍;但若輸入大多命中快取,實際輸入成本會落在 0.50 美元這一級,與 Terra 的標準輸入相當。
7 月 24 日發表的 Claude Opus 5 延續了這個價位帶。Anthropic 的策略因此很清楚:旗艦牌價不動,把優惠做進使用模式——你要嘛為最強能力付足額單價,要嘛用快取與批次把成本壓下來。這與 OpenAI 直接下調 Luna 牌價形成對比:一邊用「看得見的低價」搶高頻用量,一邊用「用得聰明就便宜」留住重度開發者。
對企業採購來說,兩種定價哲學需要不同的談判與架構策略:前者看的是單價乘上用量,後者看的是快取命中率與批次占比。同一個工作負載在兩家的最終成本,可能相差一個數量級,也可能幾乎打平,取決於流量形狀。
換算成帳單:一億 token 的三種月費
單價數字容易失真,直接換算成月帳單更具體。假設一個應用每月消耗 1 億輸入 token 加 1 億輸出 token:
- 走 gpt-5.6-luna:輸入 20 美元加輸出 120 美元,約 140 美元。
- 走 DeepSeek 最便宜欄位:輸入 14 美元加輸出 28 美元,約 42 美元。
- 走 Claude Opus:輸入 500 美元加輸出 2,500 美元,約 3,000 美元。
三種選擇相差超過 20 倍。再疊加上槓桿:若 Luna 的輸入有八成命中快取,輸入成本降到約 5.6 美元,總帳單約 126 美元;同樣條件下的 Opus 約 2,640 美元。可以看到,快取對 Luna 帳單的絕對影響只有十幾美元,但對 Opus 是數百美元級——模型越貴,工程優化越值錢。

實務上的下一步並非全押最便宜的模型,而是分層路由:分類、抽取、格式轉換、批量摘要這類任務走 Luna;困難推理、長鏈代理與高風險決策走旗艦模型;可延遲的工作進批次;重複上下文一律啟用快取。按這個架構重排之後,多數團隊的總成本會落在「全用旗艦」與「全用低階」之間,但品質損失遠小於成本降幅。
單價不等於總成本:四個但書
把這波降價解讀成「AI 變便宜了」之前,有四個限制必須放在桌上。
第一,token 用量本身是變數。不同模型對同一任務產生的思考長度、輸出格式與重試次數都不同;單價乘上 token 數才是成本,只比每百萬單價會誤判。第二,服務層級會加價。OpenAI 文件明載資料駐留端點加收 10%,優先與快速處理另有費率;Anthropic 的折扣則綁定快取與批次等特定使用方式,用不到就享受不到。第三,品質與可靠度不在定價頁上。低階層的錯誤率、延遲穩定性與代理任務成功率,最終都會以重工、監控與人工審核的成本回來。第四,這場價格戰還在進行中:Anthropic 官方尚未宣布旗艦牌價調整,OpenAI 也只調整了 GPT-5.6 家族的部分層級,兩家後續是否再動價、快取折扣是否擴大,都是值得按季追蹤的指標。
另外要誠實標出一條界線:各家模型的實際品質差距,無法從官方定價頁推得,本文也沒有進行自有評測;帳單試算用的是牌價直乘,未計入階梯折扣、承諾用量或企業議價。
結論:選型從選模型變成設計成本結構
這次調價的實質意義,是 API 選型的主導變數從「哪個模型最強」移向「我的流量形狀配哪個成本結構」。OpenAI 用 Luna 把高頻推理的單價壓進 0.x 美元級,直接正面迎戰中國供應商的價格地板;Anthropic 守住旗艦牌價,把折扣藏在快取與批次裡。兩條路線都把定價變成了工程問題。
開發者與企業可以立刻做的三件事:盤點自家工作負載中可降級至低階層的比例;為重複上下文啟用快取、為可延遲批次啟用批次模式;建立按月重算的 cost per task 指標,而不是只盯牌價。模型牌價會繼續變,但「按流量形狀設計成本結構」這個能力,在可見的價格戰週期內都會持續增值。





