Kimi Linear 是月之暗面 Kimi Team 提出的混合線性注意力架構,以自研 KDA(Kimi Delta Attention)精煉 Gated DeltaNet,搭配多頭潛在注意力 MLA 採 3:1 分層混合;論文宣稱在相同訓練配方下,於短上下文、長上下文與強化學習三場景首度全面超越全注意力,KV cache 最多降 75%、1M 上下文解碼吞吐提升 6 倍,並開源 KDA kernel、vLLM 實作與 Base/Instruct 權重。

線性注意力的老門檻:效率換來表達力落差

注意力機制是 Transformer 的核心,也是它吃記憶體的源頭:序列每長一倍,要快取的鍵值(KV cache)就線性膨脹,長上下文的推論成本於是居高不下。線性注意力的思路,是用一個固定大小的遞迴狀態(RNN-like state)取代不斷堆疊的 KV,把記憶體占用與序列長度脫鉤。問題在於,多數線性注意力變體在表達力上跟不上全注意力,尤其在需要精確回憶細節的任務上落後,因此過去多半只能在「效率」與「品質」之間取捨。Kimi Linear 由月之暗面(Moonshot AI)的 Kimi Team 提出,宣稱在公平比較下首次打破這個取捨。

Kimi Linear 與全注意力的對比:線性注意力過去在表達力落後,Kimi Linear 在短上下文、長上下文與強化學習三場景首次追平並超越

圖① 論文宣稱 Kimi Linear 是第一個在公平比較下、於短上下文、長上下文與強化學習三場景都超越全注意力的混合線性注意力架構。(來源:Kimi Linear 論文)

KDA:用更細的閘控精煉 Gated DeltaNet

Kimi Linear 的核心模組是 KDA(Kimi Delta Attention)。它並非從零發明,而是建立在 Gated DeltaNet 之上,關鍵改動是把原本的閘控做得更細緻(finer-grained gating),目標是更有效地運用那塊有限的「有限狀態 RNN 記憶體」。可以把這塊記憶體想成一個固定容量的工作區:線性注意力把歷史資訊壓縮進去,容量固定,能寫多少、保留多少、覆寫多少,都由閘控決定。Gated DeltaNet 已經用閘控管理這個取捨,KDA 進一步把閘控的粒度切細,等於給同一個工作區更精準的「寫入、保留、遺忘」控制,藉此在固定容量下擠出更高的表達力。這是它能在後續比較中追上全注意力的技術基礎。

3:1 混合:多數層走線性,少量層保留全注意力

不過 Kimi Linear 並非把每一層都換成 KDA,而是採取分層混合:每四層裡,三層使用線性的 KDA,僅一層保留全注意力(論文使用的全注意力是多頭潛在注意力 MLA)。這個 3:1 的比例是刻意安排——大部分層享有線性注意力的常數記憶體優勢,同時靠少量全注意力層維持模型在關鍵環節的精確比對能力。論文的說法是,這個比例在降低記憶體用量的同時,品質「維持甚至超越」全注意力。混合架構而非全盤替換,是這類效率改進在工程上更穩妥的路徑;它與〈SANA-Video 2.0〉把線性注意力用於影片生成的思路同屬一個技術家族,兩者都以混合線性注意力換取長序列的效率。

Kimi Linear 的 3:1 分層混合:每四層有三層走線性 KDA,僅一層保留全注意力 MLA

圖② 3:1 的 KDA 對全注意力比例,讓多數層享有線性注意力的常數記憶體,同時保留少量全注意力層維持表達力。(來源:Kimi Linear 論文)

75%、6 倍與 6.3 倍:長上下文推論的實際意義

效率數字集中在長上下文場景。KV cache 最多降低 75%;在 1M(百萬)token 的上下文,解碼吞吐提升 6 倍;長序列的單 token 生成延遲(TPOT)較 MLA 快 6.3 倍。基準成績上,4k 上下文的 MMLU-Pro 達 51.0,128k 上下文的 RULER 在 84.3 且為 Pareto 最佳、伴隨 3.98 倍加速。對部署團隊的意義是:長上下文服務的瓶頸往往不是算力,而是 KV cache 的記憶體占用與隨上下文膨脹的延遲——線性注意力把這兩者與序列長度脫鉤後,1M 上下文才從「勉強能跑」變得「可務實服務」。這條效率曲線與〈騰訊 AngelSpec〉把推論加速拆成多層疊加、以及〈GigaToken〉在分詞環節擠出端到端成本槓桿,指向同一個結論:真實部署的提速從來不是單一技巧的功勞。

KV cache 最多降低 75%、1M 上下文解碼吞吐提升 6 倍的長上下文效率優勢

圖③ 線性注意力把 KV cache 與序列長度脫鉤,長上下文的記憶體壓力與延遲隨之大幅下降。(來源:Kimi Linear 論文)

開源範圍與看待數字的兩點提醒

KDA kernel 開源在 FLA(flash-linear-attention)專案的 fla/ops/kda,可透過 pip install -U fla-core(≥0.4.0)取得;同步釋出 vLLM 部署實作,以及 48B 總參數/3B 啟動參數 MoE 的 Base 與 Instruct 兩份權重(HuggingFace:moonshotai/Kimi-Linear-48B-A3B-Base-Instruct),授權為 MIT,原生支援 1M 上下文。模型以 5.7T token 訓練。看待這組結果有兩點必須留意。其一,「全面超越全注意力」是論文在自家 48B/3B 規模、相同訓練配方下的結論,能否外推到更大規模或不同資料分布,仍待獨立驗證。其二,所有效率數字(75%、6 倍、6.3 倍)皆為長上下文與特定並發條件下的最佳值,實際增益隨工作負載浮動;遷移評估前應以自身硬體與流量重新量測。kernel 與權重皆已開源,降低了重現與驗證門檻。