Black Forest Labs 的 FLUX 3 多模態基礎模型延伸至 Physical AI,與 mimic 共同打造的 FLUX-mimic 視訊動作模型已在 Audi 產線實際部署,單一 backbone 同時承載視訊生成與動作預測、推論低於 80ms。
視訊是真正的難點
Black Forest Labs 將 FLUX 系列從圖像生成推進到 FLUX 3:一個從最初就聯合訓練圖像、視訊與音訊的單一基礎模型。官方公告指出,視訊預測是整個訓練中最昂貴的一環,占總算力成本 95% 以上;相對之下,音訊在 720p 含音訊視訊中只占不到 0.5% 的 token。要逼真生成視訊,模型被迫學會接觸、運動、重量與因果關係,這正是 FLUX 3 被定位為「世界如何運作」模型、而非單純內容生成模型的原因。FLUX 3 作為多模態基礎模型的完整發表規格與初步影音評測,詳見〈FLUX 3 推出,單次生成 20 秒附聲影片〉。
單一 backbone 同時生成與控制
FLUX 3 同時成為 FLUX-mimic 的基礎。這款與 mimic robotics 合作的視訊動作模型,把動作視為與音訊、視訊影格同形態的低維表徵。官方在大規模訓練中實測,加入動作預測後,text-to-video 與 image-to-video 的人類評分一度下滑最多 10%,但經過 3500 步訓練即恢復原有水準。Black Forest Labs 據此主張:動作預測不需另立基礎模型,同一個 backbone 即可同時承載生成與控制。
FLUX-mimic 在 mimic 最佳化的部署堆疊下,backbone 從輸入到世界表徵可在單張 NVIDIA RTX 5090 上以低於 80ms 完成,整套機器人系統反應時間為 101ms,接近人類視覺反應速度的數量級。
從實驗室走到 Audi 產線
mimic 已將 FLUX-mimic 部署於 Audi 產線的實際任務,涵蓋零件分揀入盤、電子控制單元插入緊配合件、零組件組裝,以及密封條、線材等軟性可變材料處理——這些過去向來是傳統自動化難以經濟化的工作。Audi Production Lab 的 Christoph Schneider 表示,這些機器人解決了傳統機器手臂根本無法勝任的軟體操作,對協助員工、提升效率與擴大彈性自動化具重大潛在影響。
對決策者的訊號很明確:生成式世界模型與實體機器人正在同一個 backbone 上收斂。當模型先把世界學好,新任務只需要把既有知識解碼成動作,樣本效率與可轉移性由此而生,而非靠任務專屬工程。