arXiv 論文 SANA-Video 2.0 以 3:1 混合線性與 softmax 注意力的擴散 Transformer,在單張 H100 上以約 13 秒生成 720p/5 秒影片、較 Wan 2.2-A14B 快約 120 倍,自測 VBench 達 84.30。
混合注意力:用 25% softmax 換回全秩表達力
SANA-Video 2.0 是 NVIDIA、MIT 與香港大學團隊(Junsong Chen、Enze Xie、Song Han、Daquan Zhou、Ping Luo 等)發表的混合影片擴散 Transformer,提供 5B 與 14B 兩種規模,目標是在單張 GPU 上生成最高 720p 影片。核心問題在於:純線性注意力擴展性佳但會失去全秩 token 交互,純 softmax 又帶來二次複雜度。論文提出的 Hybrid Linear-Softmax Attention 以 3:1 比例混合閘控線性注意力與週期性閘控 softmax 錨點,並透過降解析度代理實驗把 25% softmax 定為品質與效率的最佳平衡。
深層有效秩提升約 12%
為了把 softmax 錨點刷新後的表徵沿深度傳遞,團隊設計 Block Attention Residuals(AttnRes),將已完成的塊摘要路由到後續線性層,實現錨點特徵再利用,使深層有效秩提升約 12%。值得注意的是模型採從頭訓練,直接學習完整混合架構,而非對預訓練模型做事後線性化,這也是其在長序列仍能保持擴展性的關鍵。
單張 H100、720p/5 秒影片 13.06 秒
實測數字才是重點。40 步取樣下,SANA-Video 2.0 在單張 H100 上以 480p 解析度、13.2 秒取得 VBench 84.30,與規模遠更大的 softmax DiT 表現相當但延遲大幅降低。720p/60 秒條件下,編譯後的 DiT 前向傳播比同等全 softmax 基線快 3.2 倍,且差距隨影片長度增加而擴大。再疊加全棧 Sol-Engine 優化(核心融合、快取、稀疏注意力)額外提速 3.58 倍,5B 模型在 720p/5 秒只需 13.06 秒,比 Wan 2.2-A14B 在同一張 H100 上快 120 倍。
對開發者的意義
對做影片生成的開發者而言,這組數字直接動搖成本結構:過去需要多卡或長時間推理的高解析度長影片,現在單卡可在十秒級完成,自架推論的單位成本有望顯著下降。需留意 84.30 為論文自測結果,實際美學與動態穩定度仍待第三方橫評;120 倍的對比來自單一硬體配置,部署前應以自身工作負載重新量測,再決定是否從 Wan、HunyuanVideo 等既有路線遷移。同一時期的〈FLUX 3〉選擇影像、影片、音訊聯合學習,兩者分別代表推論效率與統一多模態的不同優先序。在圖像生成端,〈Midjourney V8.2〉則把競爭焦點轉向主觀美學與個性化,呈現生成模型另一種差異化優先序。