Cactus 以 Gemma 4 E2B 為基礎推出 MIT 開源的 Hybrid 模型,在檢查點內嵌入置信度探針、為每個回答輸出 0 到 1 的結構化分數,低置信度時自動路由至 Gemini 3.1 Flash-Lite,多數基準僅需切換 15–55% 查詢即可持平。
檢查點內嵌探針,置信度結構化輸出
Cactus 以 Gemma 4 E2B 為基底推出 Hybrid,後訓練階段在模型檢查點內植入一支置信度探針(probe),為每個生成的答案回傳一個 0 到 1 之間的結構化分數,而非從答案文字解析。運作邏輯很直接:置信度高時直接在裝置端回覆,低於門檻(範例為 0.85)就把請求轉給更大的雲端模型。Gemma 4 E2B 是 Gemma 系列中最小的成員,鎖定離線與隱私優先的端側場景。同樣把「簡單查詢走快、難題才升級」做成動態切換的,還有 Ant 的〈Ling-3.0-flash〉混合推理 MoE——兩者印證同一趨勢:不是每個請求都值得啟動完整推理或最大的模型。
15–55% 路由即持平 Flash-Lite
Cactus 公布的切換比例顯示,端側模型自己處理大多數查詢,僅把困難題交棒。以 FP16 為例,ChartQA 只需路由 15–20% 即可追平 Gemini 3.1 Flash-Lite,MMBench 與 MMAU 約 30–35%,最困難的 MMLU-Pro 則需 45–55%;4-bit 與 3-bit 量化會把所需切換比例往上推,MMLU-Pro 在 4-bit 接近 90%。換言之,量化的省記憶體代價會直接反映在雲端呼叫頻率上,部署前需把這條取捨算進成本。
跨模態訊號而非死記答案
較值得注意的是探針的鑑別力。Cactus 自評 AUROC 在 12 個留出集平均達 0.814,明顯高於以 token 熵為基線的 0.549;其中 ARC-Easy 0.888、MMBench 0.840、GigaSpeech 0.876。最具說服力的一組數字:探針完全未以音訊資料訓練,卻在四個音訊基準(兩個轉錄、一個音訊選題、一個跨域轉錄)拿下 0.79–0.88 AUROC,暗示它讀的是隱藏狀態中與模態無關的正確性訊號,而非背誦訓練分布。
落地限制與整合
模型以 MIT 授權開源,Gemma 本身仍受 Gemma 條款約束,權重放在 Hugging Face 的 Cactus Hybrid 集合。整合路徑涵蓋 Cactus 自家 SDK、MLX、Transformers 與 llama.cpp,但 llama.cpp 需先編譯補丁才能讓回應帶出 confidence 欄位;Transformers 載入必須用顯式 .to(device),device_map="auto" 會讓留在 meta 裝置的權重導致置信度讀取崩潰。對想自建端側路由管的團隊,這是一份可複現的起點,但量化與硬體組合仍需自行基準化。部署後若還要追蹤請求用途、部門與成本歸屬,可接著看〈OpenRouter Classifiers 的非同步請求分類〉;前者決定「該不該升級模型」,後者回答「流量為何發生、費用算給誰」。