Black Forest Labs 發布 FLUX 3:多模態流動模型全面超越 Seedance 2.0 與 Gemini Omni,更要教 AI 操控機器人

Black Forest Labs 在 7 月 23 日發布 FLUX 3,採用統一多模態流動模型架構,單次生成即可同時產生 20 秒影片與原生同步音訊。在圖像、影片生成 benchmark 上超越 Seedance 2.0、Gemini Omni 與 Grok Imagine。更驚人的是 FLUX-mimic 讓影片生成模型直接操控 Audi 產線的工業機器人。

  • Dennis
  • 4 分鐘閱讀
Black Forest Labs 發布 FLUX 3:多模態流動模型全面超越 Seedance 2.0 與 Gemini Omni,更要教 AI 操控機器人

Black Forest Labs(BFL)在 2026 年 7 月 23 日丟出核彈級產品——FLUX 3,一個真正的「多模態流動模型」(Multimodal Flow Model)。這不是那種把圖像、影片、音訊各自獨立訓練再拼裝的模型,而是在同一個底層架構中共同訓練所有模態,讓它們互相學習、互相約束 [1]。

結果非常驚人:FLUX 3 在影像生成和影片生成 benchmark 上全面超越了 Seedance 2.0、Gemini Omni 和 Grok Imagine,而且還能一次生出20 秒的影片 + 原生同步音訊

但這還不是最瘋狂的部分——FLUX 3 有一個叫 FLUX-mimic 的分支,直接把影片生成模型變成了 Audi 產線上的工業機器人大腦。

統一多模態架構:不是拼裝,是融合

FLUX 3 的核心技術奠基於 BFL 自研的 Self-Flow 對齊方法 [2],透過大幅擴展計算與數據資源,在同一個模型中實現多模態的「生成」與「理解」:

  • 圖像學習空間結構與構圖
  • 影片還原時間動態與物理定律
  • 音訊揭示機械運動與聲學的因果關係
  • 語言將所有感知連結到抽象指令與目標

這種「多模態共同訓練」的結果是:模型內部的各要素能相互約束與學習。例如在生成一支爵士鼓演奏影片時,鼓棒敲擊的畫面與對應的聲音是原生同步生成的,不需要額外的口型同步或音效後製 [3]。

全面超越對手的基準成績

FLUX 3 的 benchmark 成績相當驚人:

競爭對手圖像生成影片生成(含音訊)文字渲染
Seedance 2.0❌ 落後❌ 落後❌ 落後
Gemini Omni❌ 落後❌ 落後⚠️ 接近
Grok Imagine❌ 落後❌ 落後❌ 落後

FLUX 3 Image 模組雖然尚未全面開放(預計數週內推出 early access),但中期訓練的初步評估顯示,它在複雜提示詞的理解能力上進步顯著——能準確處理多主體、空間關係、屬性綁定等難題,並且具備極高的多語言文字渲染精度 [4]。

FLUX 3 Video:20 秒原生影片 + 音訊

FLUX 3 Video 是首個開放早期測試的模組,帶來了真正下一個世代的影片生成能力:

核心特色

功能說明
生成長度最長 20 秒 高品質影片
原生音訊精準同步的聲音,不需額外後製
文字生成影片(T2V)從文字描述直接生成
圖像生成影片(I2V)以起始幀或視覺參考生成
影片生成影片(V2V)轉換既有影片風格與內容
關鍵幀生成從多張關鍵幀推算完整動畫
多語言對話角色可說多國語言,嘴型與音訊原生同步
文字渲染AI 影片文字不再模糊變形

FLUX-mimic:當影片生成模型學會操控機器人

這可能是 FLUX 3 最具深遠影響的部分。BFL 與機器人公司 mimic 合作推出了 FLUX-mimic——一個將影片生成模型轉化為「影片動作模型(Video-Action Model)」的技術 [5]。

傳統的機器人訓練需要大量真實操作數據,成本高昂且耗時。FLUX-mimic 的思路完全不同:它從大量的機器人操作影片中學習物理因果律——如果你把螺絲起子轉 90 度,螺絲會下沉多少;如果你抓取一個杯子,要施多少力才不會捏碎它。

最驚人的是,FLUX-mimic 已經在 Audi 的生產線上進行實際測試 [6]。工業機器人只需少量的操作數據,就能透過 FLUX-mimic 學會複雜的組裝任務。這等於是把影片生成模型的「想像力」變成機器人的「肌肉記憶」。

為什麼這比大多數人想像的更重要

目前的機器人學習主要依賴兩種方式:

  1. 模仿學習:需要大量人類操作示範數據
  2. 強化學習:需要大量模擬環境和計算資源

FLUX-mimic 開創了第三條路——從影片中學習物理世界模型。這意味著:

  • 數據效率暴增:少數操作影片就能學會新技能
  • 泛化能力強:學到的不是機械的動作序列,而是背後的物理因果關係
  • 成本大幅降低:不需要昂貴的真實機器人數據採集

FLUX 3 的影像生成即將來臨

雖然 Image 模組尚未開放,但根據 midtraining 的初步評估,FLUX 3 Image 比前代 FLUX.2 有顯著進步 [4]。主要提升在於:

  1. 複雜多主體場景的精確生成
  2. 空間關係與屬性綁定的理解力
  3. 多語言文字渲染——中文字不再莫名其妙
  4. 風格多樣性——寫實、插畫、3D 渲染任君挑選

產業影響

FLUX 3 的發布標誌著多模態 AI 進入新階段。不再只是「文字轉圖片」或「文字轉影片」這種單一模態任務,而是真正的模態融合——圖像、影片、音訊、語言在同一個系統中協同工作。

更關鍵的是,FLUX-mimic 把影片生成技術帶到了物理世界。如果 AI 能從觀看 YouTube 影片中學會操控機器人,那工業自動化的面貌將徹底改變。

Black Forest Labs 這次不是發布了一個模型,而是展示了 AI 從「數位內容生成」跨越到「物理世界操作」的可能性。這,才是真正的 Game Changer。


來源

  1. Black Forest Labs - FLUX 3 官方部落格 (bfl.ai)
  2. BFL - Self-Flow 技術基礎
  3. VentureBeat - Black Forest Labs launches FLUX 3 (2026-07-23)
  4. BFL - FLUX 3 Image midtraining 評估
  5. Black Forest Labs - FLUX 3 x mimic 官方介紹 (bfl.ai/blog/flux-3-mimic)
  6. The Rundown AI - Black Forest Labs teaches video AI to run robots
  7. Unite.ai - mimic Robotics Introduces FLUX-mimic to Audi’s Factory Floor