Black Forest Labs(BFL)在 2026 年 7 月 23 日丟出核彈級產品——FLUX 3,一個真正的「多模態流動模型」(Multimodal Flow Model)。這不是那種把圖像、影片、音訊各自獨立訓練再拼裝的模型,而是在同一個底層架構中共同訓練所有模態,讓它們互相學習、互相約束 [1]。
結果非常驚人:FLUX 3 在影像生成和影片生成 benchmark 上全面超越了 Seedance 2.0、Gemini Omni 和 Grok Imagine,而且還能一次生出20 秒的影片 + 原生同步音訊。
但這還不是最瘋狂的部分——FLUX 3 有一個叫 FLUX-mimic 的分支,直接把影片生成模型變成了 Audi 產線上的工業機器人大腦。
統一多模態架構:不是拼裝,是融合
FLUX 3 的核心技術奠基於 BFL 自研的 Self-Flow 對齊方法 [2],透過大幅擴展計算與數據資源,在同一個模型中實現多模態的「生成」與「理解」:
- 圖像學習空間結構與構圖
- 影片還原時間動態與物理定律
- 音訊揭示機械運動與聲學的因果關係
- 語言將所有感知連結到抽象指令與目標
這種「多模態共同訓練」的結果是:模型內部的各要素能相互約束與學習。例如在生成一支爵士鼓演奏影片時,鼓棒敲擊的畫面與對應的聲音是原生同步生成的,不需要額外的口型同步或音效後製 [3]。
全面超越對手的基準成績
FLUX 3 的 benchmark 成績相當驚人:
| 競爭對手 | 圖像生成 | 影片生成(含音訊) | 文字渲染 |
|---|---|---|---|
| Seedance 2.0 | ❌ 落後 | ❌ 落後 | ❌ 落後 |
| Gemini Omni | ❌ 落後 | ❌ 落後 | ⚠️ 接近 |
| Grok Imagine | ❌ 落後 | ❌ 落後 | ❌ 落後 |
FLUX 3 Image 模組雖然尚未全面開放(預計數週內推出 early access),但中期訓練的初步評估顯示,它在複雜提示詞的理解能力上進步顯著——能準確處理多主體、空間關係、屬性綁定等難題,並且具備極高的多語言文字渲染精度 [4]。
FLUX 3 Video:20 秒原生影片 + 音訊
FLUX 3 Video 是首個開放早期測試的模組,帶來了真正下一個世代的影片生成能力:
核心特色
| 功能 | 說明 |
|---|---|
| 生成長度 | 最長 20 秒 高品質影片 |
| 原生音訊 | 精準同步的聲音,不需額外後製 |
| 文字生成影片(T2V) | 從文字描述直接生成 |
| 圖像生成影片(I2V) | 以起始幀或視覺參考生成 |
| 影片生成影片(V2V) | 轉換既有影片風格與內容 |
| 關鍵幀生成 | 從多張關鍵幀推算完整動畫 |
| 多語言對話 | 角色可說多國語言,嘴型與音訊原生同步 |
| 文字渲染 | AI 影片文字不再模糊變形 |
FLUX-mimic:當影片生成模型學會操控機器人
這可能是 FLUX 3 最具深遠影響的部分。BFL 與機器人公司 mimic 合作推出了 FLUX-mimic——一個將影片生成模型轉化為「影片動作模型(Video-Action Model)」的技術 [5]。
傳統的機器人訓練需要大量真實操作數據,成本高昂且耗時。FLUX-mimic 的思路完全不同:它從大量的機器人操作影片中學習物理因果律——如果你把螺絲起子轉 90 度,螺絲會下沉多少;如果你抓取一個杯子,要施多少力才不會捏碎它。
最驚人的是,FLUX-mimic 已經在 Audi 的生產線上進行實際測試 [6]。工業機器人只需少量的操作數據,就能透過 FLUX-mimic 學會複雜的組裝任務。這等於是把影片生成模型的「想像力」變成機器人的「肌肉記憶」。
為什麼這比大多數人想像的更重要
目前的機器人學習主要依賴兩種方式:
- 模仿學習:需要大量人類操作示範數據
- 強化學習:需要大量模擬環境和計算資源
FLUX-mimic 開創了第三條路——從影片中學習物理世界模型。這意味著:
- 數據效率暴增:少數操作影片就能學會新技能
- 泛化能力強:學到的不是機械的動作序列,而是背後的物理因果關係
- 成本大幅降低:不需要昂貴的真實機器人數據採集
FLUX 3 的影像生成即將來臨
雖然 Image 模組尚未開放,但根據 midtraining 的初步評估,FLUX 3 Image 比前代 FLUX.2 有顯著進步 [4]。主要提升在於:
- 複雜多主體場景的精確生成
- 空間關係與屬性綁定的理解力
- 多語言文字渲染——中文字不再莫名其妙
- 風格多樣性——寫實、插畫、3D 渲染任君挑選
產業影響
FLUX 3 的發布標誌著多模態 AI 進入新階段。不再只是「文字轉圖片」或「文字轉影片」這種單一模態任務,而是真正的模態融合——圖像、影片、音訊、語言在同一個系統中協同工作。
更關鍵的是,FLUX-mimic 把影片生成技術帶到了物理世界。如果 AI 能從觀看 YouTube 影片中學會操控機器人,那工業自動化的面貌將徹底改變。
Black Forest Labs 這次不是發布了一個模型,而是展示了 AI 從「數位內容生成」跨越到「物理世界操作」的可能性。這,才是真正的 Game Changer。
來源:
- Black Forest Labs - FLUX 3 官方部落格 (bfl.ai)
- BFL - Self-Flow 技術基礎
- VentureBeat - Black Forest Labs launches FLUX 3 (2026-07-23)
- BFL - FLUX 3 Image midtraining 評估
- Black Forest Labs - FLUX 3 x mimic 官方介紹 (bfl.ai/blog/flux-3-mimic)
- The Rundown AI - Black Forest Labs teaches video AI to run robots
- Unite.ai - mimic Robotics Introduces FLUX-mimic to Audi’s Factory Floor
