Ant Group 旗下 InclusionAI 於 7 月 24 日發布 Ling-3.0-flash,為 124B 總參、5.1B 激活的稀疏 MoE 原生混合推理模型,主打低成本推論,官方宣稱對標上一代 1T 旗艦並將開源。
124B 總參、5.1B 激活的稀疏架構
Ant Group 旗下 InclusionAI 團隊於 7 月 24 日透過「螞蟻百靈」官方公眾號發布 Ling-3.0-flash,定位為新一代原生混合推理模型。模型總參數量 124B,每次推理僅激活 5.1B,採 1/64 稀疏 MoE 與原生混合線性注意力架構,設計訴求是在大參數量下壓低單次推理的算力成本。HuggingFace 上對應的 inclusionAI/Ling-3.0-flash 模型卡目前回傳 HTTP 401,模型確實存在但為有限存取,權重與完整模型卡尚未對外公開。
對標上一代 1T 旗艦的宣稱
官方宣稱 Ling-3.0-flash 在傳統推理、指令遵循與長文本等指標上「對標甚至超越」上一代旗艦 Ling-2.6-1T(總參量約 1T)。此比較為廠商單方公布,未附獨立第三方評測,相關基準分數尚無法在公開模型卡或論文中查證。inclusionAI 的 HuggingFace 組織頁可見 Ling 2.6 1T 等前代模型的推論空間,佐證旗艦傳承脈絡。
長輸入延遲與 Agent 訓練數據
官方並列出兩項工程數據:在長輸入情境下,首字延遲(TTFT)降低 60% 至 80% 以上;訓練階段擴展至 10,000+ 個可交互環境,用以強化 Agent 場景的能力。這兩項數字同樣來自官方公告,外部尚無法獨立重現,實際改善幅度仍待模型公開後的社群實測。
開源與 API 推論通道
延續 Ling 系列的開源策略,Ling-3.0-flash 預告將開源權重並提供免費 API;inclusionAI 同時維護 HuggingFace、ModelScope,以及 ZenMux 與 OpenRouter 等推論通道。對想以低成本跑強 Agent 的團隊而言,5.1B 激活量意味推論成本接近中小型稠密模型,但「對標 1T 旗艦」的實測表現與 TTFT 改善幅度,仍須等權重完全公開後才能驗證。從產業視角看,中國 AI 業者普遍把自有模型與算力視為長期立足之本(見崑崙萬維方漢的 WAIC 觀點),Ling-3.0-flash 以稀疏架構壓低推論成本,正是這條路線的具體推進。