Black Forest Labs 推出 FLUX 3 多模態基礎模型,在統一架構內聯合學習影像、影片、音訊,單次可生成最長 20 秒附原生音訊的影片,初步人工評測對 Grok Imagine Video 勝率 69%、對 Runway Gen-4.5 達 77%。
統一架構聯合學習影像、影片、音訊
Black Forest Labs 於 7 月 23 日宣布,以 Early Access 方式推出 FLUX 3 多模態基礎模型。不同於將各類輸出交給獨立模型,FLUX 3 在同一架構內同步學習影像、影片與音訊,理由是任一單一模態都只是同一物理現實的投影,唯有聯合訓練才能讓「聲音對應撞擊、運動服從質量、未來銜接過去」等相互約束同時成立。模型建構於其先前提出的 Self-Flow 框架,並在此代大幅擴展運算與資料規模。在生成式模型走向統一架構的趨勢下,FLUX 3 與各自分工的同期模型形成路線對比——如主打美學個人化的〈Midjourney V8.2〉,或同樣鎖定影片生成的〈SANA-Video 2.0〉。
單次生成 20 秒附原聲影片
在影片能力上,FLUX 3 可在單次生成中輸出最長 20 秒、附帶原生音訊的影片,支援文生影片、圖生影片、影片生影片、輸入影片與音訊續寫、關鍵幀轉影片、多語言對話,以及將多個片段串接為多鏡頭序列。官方補充,模型在人物表情捕捉、聲音與物理事件關聯、多語言生成等方面表現較突出,並具備風格與長寬比的多樣性。影像生成與編輯能力則預計在後續數週進入 Early Access。
初步評測與開放路線圖
官方公布以 10 秒、720p 帶聲音的文生影片進行初步人工評測。在這項早期測試中,FLUX 3 被偏好的比例為:對 Grok Imagine Video 達 69%、Kling v3 Pro 60%、Seedance 2.0 與 Gemini Omni Flash 各 52%、Runway Gen-4.5 達 77%、Luma Ray 3.2 達 93%。Black Forest Labs 強調結果仍屬初步,Early Access 期間會持續改善。
商用部署方面,FLUX 3 已與 Mimic Robotics 合作推出 FLUX-mimic 影片-動作模型,並在 Audi 的實際產線任務中測試,作為機器人動作預測的探索方向。FLUX-mimic 在 Audi 產線的實際部署任務與推論規格,詳見〈FLUX-mimic 攜手 mimic 在 Audi 產線部署〉。若需求集中在語音而非影音聯合生成,Qwen-Audio-3.0-TTS 的盲測排名與定價提供了另一條可比較的品質軸。後續將分階段釋出 FLUX 3 Video、FLUX 3 Image、研究與商用夥伴用的 FLUX-mimic 與 FLUX 3 Action,以及開源權重的 FLUX 3 Dev。對決策者而言,觀察重點在於統一架構能否壓低多模態內容產製成本,以及開源骨幹釋出後對在地應用鏈的擴散效應。