Kimi K3 之後:開源節奏加速

Nathan Lambert 在 Interconnects 季度開源模型盤點節目中與 Florian Brand 指出,Kimi K3 上週發布後,開源陣營的速度明顯加快。Kimi K3 權重尚未公開,節目中 Lambert 引述資訊表示權重據報將於 7 月 27 日釋出,目前僅能透過 API 使用,而 API 因需求過載頻繁回報錯誤。Lambert 自費訂閱 200 美元的最高方案,獲得 1 百萬 token 上下文與較穩定的請求優先權。

同一週內,Qwen 預告下一代大型模型將採開放權重,被 Lambert 稱為策略上的重大轉變;習近平於 WAIC 的演說亦將開源與開放明確列為國家戰略層級的承諾。三件事疊加,讓開源議程從模型發布上升到政策與產業路線。

開源升格為國家戰略:WAIC 演說的政策訊號

習近平在 WAIC 演說中將開源與開放明確列為戰略層級承諾,這個訊號的政策分量不能低估。過去開源權重是個別實驗室的商業選擇——把模型免費釋出以換取生態與影響力;當它被寫入國家層級的產業敘事,意味著開源前沿模型會獲得政策、算力調度與資金配置的有形支持,而不只是依靠廠商的意願。

這對開閉源競爭格局的意義在於:差距收斂不完全是技術追趕的自然結果,而是有國家意志在後面加速。對中國以外的決策者,這改變了「開源是否可信長期維護」的計算——只要政策方向不變,Qwen、Kimi 等梯隊的開源節奏較可能延續,而非短期市場行銷。但政策訊號與實際能力仍是兩回事,後續仍需以可重跑評測檢驗模型真實表現。

中國開源梯隊的資本效率之謎

節目核心辯論在於:中國實驗室為何能持續緊追閉源前沿。Lambert 提出,若下一代模型對 Anthropic 成本為 100 億美元、對 Kimi 僅 40 億美元,這種資本效率差距將是結構性優勢——但需注意這組數字是 Lambert 的推估,Kimi 與 Anthropic 均未公開實際訓練成本,差距的真實幅度仍無法獨立查證,宜視為方向性觀察而非已證實的數字。

開放模型可達到接近前沿閉源模型的能力,但訓練與部署成本明顯較低。

*圖2 同一座前沿模型,資本效率差距成為結構性優勢。*原因可能涵蓋人才教育體系更聚焦於 LLM、薪資與算力成本較低,以及中國廠商「追趕而非突破前沿」的目標設定。

Brand 補充,赴中期間觀察到研究團隊多為兩三百人、平均年齡偏低,且專注於單一模型表現。算力方面,LongCat 兩週前發布的模型據報完全以中國本土晶片訓練,外界推測為 Huawei Ascend 系列;繞過出口管制的晶片使用量在過去六到九個月亦顯著上升。Brand 任職於 Prime Intellect,相關觀察為其個人與節目立場。

蒸餾爭議與開閉源差距的反向收斂

針對 Ben Thompson 引發的知識蒸餾論戰,兩人主張許多「蒸餾認定」過於草率。開閉源差距方面,Lambert 先前預期資本密集度會讓差距擴大,實際卻朝反向發展;去年年終預測為「差距維持在數個月內」仍大致成立,但開源模型龐大化(如 500B 至 700B MoE)使推理與微調的基礎設施門檻上升,Kimi K3 微調據報需一整個 B300 節點才能載入權重,這將延後真正擴散的時間點。

對 AI 決策者而言,訊號明確:開源前沿的可得性正在提高,但「拿到權重」與「能在自家場域落地」之間的工程落差並未消失,評估導入時程仍需把推理基建與後訓練能力計入成本。要把節目中的通用能力與政策討論拉回更完整的生態證據,可先看 Hugging Face 對 2026 夏季開源模型的盤點;能力面則可對照 Kimi K3 在 AISI/CAISI 網路能力評測的實測結果,後者呈現的是資安任務能力,而非對訓練成本推估的驗證。

取得模型權重不等於完成部署,推理基礎設施與 B300 節點才是自建落地的主要瓶頸。
圖3 取得權重與自家落地之間,基建門檻仍未消失。