以開源影像模型 FLUX.1 一戰成名的德國實驗室 Black Forest Labs(BFL),在 7 月 23 日投下了一顆核彈級產品:FLUX 3。這不只是他們的第一個影片生成模型,更是史上首個「一個架構、四種輸出」的多模態基礎模型——影像、影片、音訊、機器人動作預測,全部塞進同一套權重。
FLUX 3 是什麼?
FLUX 3 是一個多模態流匹配基礎模型(Multimodal Flow Matching Foundation Model),採用 BFL 自家的 Self-Flow 訓練方法,在單一架構中聯合訓練影像、影片與音訊,甚至延伸至機器人動作預測。
背後的哲學很簡單:沒有任何單一模態能完整描述世界。影像捕捉某一瞬間的空間結構,影片還原時間與物理動態,音訊揭露機械事件與聲音之間的因果關係,機器人動作則展示物理互動。把它們放在一起訓練,各模態會互相約束——聲音必須對上撞擊、運動必須服從質量,模型因此能建立對物理世界的深刻理解。
| 特性 | FLUX 3 |
|---|---|
| 模型類型 | 多模態流匹配基礎模型 |
| 聯合訓練模態 | 影像 + 影片 + 音訊(單一架構) |
| 延伸輸出 | 機器人動作預測(FLUX-mimic) |
| 單次生成影片長度 | 最長 20 秒(含原生同步音訊) |
| 訓練算力占比 | 影片預測 >95%,音訊 <0.5% token |
| 發布日期 | 2026 年 7 月 23 日 |
FLUX 3 Video 支援文字轉影片、圖片轉影片、參考片段轉影片(角色一致性)、關鍵影格轉場控制,甚至能用 agentic 方式串接多個片段成為長序列——而且音訊(對話、音效、環境音)是原生同步生成的,不是後製配音。
Self-Flow:讓模態互相「教學」
FLUX 3 的核心技術 Self-Flow 其實在 2026 年 3 月就已發表,這次只是把規模推上極限。它結合了流匹配目標與自監督特徵重建目標,讓各模態在訓練中互相牽制、彼此強化。執行長 Robin Rombach 的說法是:「影像傳達結構,影片教會動態,音訊攜帶時序與物理事件,動作揭露因果關係——每個訊號都教會其他訊號無法教的事。」
基準測試:贏得很漂亮,但要注意小字
BFL 公布了初步人類偏好測試(10 秒、720p 文字轉影片),結果相當亮眼:
| 對手 | FLUX 3 勝率 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
⚠️ 但請注意小字:這是 BFL 官方自行測量的初步結果,測試的是「早期候選模型」而非正式版,目前沒有任何第三方獨立測試。而且最關鍵的兩個對手(Seedance 2.0 與 Gemini Omni Flash)勝率只有 52%——幾乎是擲硬幣。VentureBeat 的分析更指出,Seedance 2.0 因 Netflix、華納、迪士尼等片商的法律威脅而無限期延後國際發布,真正該在意的是 Google 隨時可用的 Gemini Omni Flash。
FLUX-mimic:從像素到機器人手指
這次發布最出人意料的,是攜手蘇黎世機器人新創 mimic robotics 推出的 FLUX-mimic——一個「影片-動作模型(Video-Action Model)」,專為通用機器人靈巧操作設計。
它的運作原理很巧妙:動作解碼器不讀取生成的像素,而是直接讀取影片骨幹網路預測未來的「潛在特徵」,因此只需單次前向傳遞就能生成機器人動作——在單張 RTX 5090 GPU 上以低於 80 毫秒的延遲於終端運行,完全不需要資料中心。
graph LR
A[FLUX 3 影片骨幹<br/>預測場景如何演變] --> B[輕量動作解碼器<br/>讀取潛在特徵]
B --> C[直接去噪<br/>機器人動作序列]
C --> D[機器人執行<br/>軟體物件操作]mimic robotics 宣稱資料效率比傳統 VLA(視覺-語言-動作)模型高 10 倍、收斂速度快 2 倍。關鍵的「oracle 實驗」更證明:控制問題本質上就是視覺預測問題——影片模型預測越準,動作就越完美。
奧迪工廠實測:101 毫秒的反應速度
FLUX-mimic 不是紙上談兵——它已經在奧迪的實際生產線上測試,任務是安裝具彈性的車門密封條。這類「軟體物件操作」對傳統自動化機器人來說幾乎是不可能的任務(軟性材料會變形、難以定位),但 FLUX-mimic 的反應時間約 101 毫秒,接近人類反射神經速度。
奧迪生產實驗室的 Christoph Schneider 表示,機器人已能解決傳統系統無法處理的複雜軟體操作任務,公司正在評估將這項技術擴展到更多生產與物流環節。
發布策略:分階段、還不便宜
| 產品線 | 模態 | 狀態(7/24 止) | 價格 |
|---|---|---|---|
| FLUX 3 Video | 文字/圖片/影片/關鍵影格 → 影片+音訊 | 封閉搶先體驗(需審核) | 未公布 |
| FLUX 3 Action | 影片-動作(機器人) | 封閉搶先體驗(需審核) | 未公布 |
| FLUX 3 Image | 次世代影像生成 | 「數週內」推出 | 未公布 |
| FLUX 3 Dev | 開源權重完整骨幹 | 2026 年稍晚(最後) | 未公布 |
目前沒有任何公開 API 或定價,Video 與 Action 都要向 BFL 申請並逐案審核。開源權重的 FLUX 3 Dev 被排在最後——這延續了 BFL 靠開源 FLUX.1 打天下的傳統,但也意味著這次他們想先靠閉源版本賺一輪。
結語:一張世界模型,兩種用途
「同一套模型,既能生成一片逼真的海浪,也能幫機器人安裝車門。」——這是 BFL 對「視覺智慧」的終極賭注:創意生成、模擬、電腦使用與機器人,都是同一種能力的延伸,而非不同的產品類別。FLUX 3 選擇了一條與眾不同的路:不做拼裝的多模態,只訓練一個真正的世界模型。至於這張賭注能不能兌現,就要等開源版本釋出、獨立基準測試上線後才能見真章了。
參考來源:Latent Space · mimic robotics 技術文章 · MarkTechPost · Digital Applied 分析
