工具 / TOOLS指南 / GUIDE
MiniMax-H3 開源全模態影片模型:用 ComfyUI API 無頭生成影片與音訊
MiniMax 官方開源的全模態影片模型 MiniMax-H3,一次前向傳遞同時生成影片與原生立體聲音訊;ComfyUI 0.30.0 起原生支援,可用 Python 經 API 無頭驅動、不必開圖形介面。
AI 影片生成:模型能力、版權爭議與產品落地。
共 4 則文章,依發布時間排序
MiniMax 官方開源的全模態影片模型 MiniMax-H3,一次前向傳遞同時生成影片與原生立體聲音訊;ComfyUI 0.30.0 起原生支援,可用 Python 經 API 無頭驅動、不必開圖形介面。
ByteDance Seed 團隊的 Seedance 2.5 單次生成 30 秒影音、多輪續寫延伸到數分鐘,支援 30 圖+10 影+10 音多模態參考與時間戳鏡頭控制;火山方舟文件指單次生成時長提升至 30 秒。
Black Forest Labs 以 Early Access 推出 FLUX 3 多模態基礎模型,於統一架構內聯合學習影像、影片與音訊,單次可生成最長 20 秒含原生音訊的影片,並公布對多家競品的初步人工評測勝率。
arXiv 論文 SANA-Video 2.0 以 5B/14B 混合影片擴散 Transformer,在單張 H100 上以 13.06 秒生成 720p/5 秒影片,比 Wan 2.2-A14B 快 120 倍,為影片生成成本結構帶來新變數。