MiniMax 在 8 月 3 日正式開源第三代影片生成模型 H3(Hailuo 3.0):單一模型吃進文字、圖片、影片與音訊,一次輸出最高 2K、15 秒、附原生立體聲的影片,ComfyUI 首日原生支援,記憶體優化後連 RTX 3060 都能本地跑。
這是 Hailuo 系列第一次開源權重,也是目前「最強開源權重影片模型」的有力候選人。想玩的人今天就能動手:更新 ComfyUI 到 0.30.0,下載工作流模板,把權重丟進對應資料夾,RTX 3060 以上的顯示卡就能生成帶聲音的 AI 影片。本文帶你一次看懂它強在哪、怎麼選權重、以及跟 Kling、Seedance、Veo 的差距。
MiniMax H3 是什麼?
MiniMax H3 是 MiniMax 在 2026 年 7 月 31 日於世界人工智慧大會(WAIC)發表的「通用全模態生成系統」,8 月 3 日在 Hugging Face 釋出開源權重。它屬於 Hailuo 產品線的第三代:
| 版本 | 發布時間 | 定位 |
|---|---|---|
| Hailuo 01 | 2024 | 從零驗證影片生成可行性 |
| Hailuo 02 / 2.3 | 2025 – 2026 初 | 原生 1080p、6–10 秒、指令跟隨改善 |
| MiniMax H3 | 2026-07-31 | 通用全模態生成:2K、15 秒、原生立體聲 |
跟前代最大的差別:Hailuo 02/2.3 只能吃「提示詞或一張圖」、輸出靜音影片;H3 可以同時吃進文字、多張圖片、參考影片與音訊,輸出畫面與聲音一起生成的影片——對話、音效、環境音在同一次推理中完成,不是後製合成的。
全模態輸入:一次最多 12 個檔案
H3 的殺手鐧是「全模態上下文理解」。過去你要分別用三個模型做角色一致性、動作轉移、聲音克隆,H3 直接把所有素材丟進同一個上下文,模型自己判斷每個素材的角色:
flowchart LR
A[文字提示詞<br>最多 7,000 字元] --> E
B[圖片<br>最多 9 張] --> E
C[影片<br>最多 3 段<br>每段 2–15 秒] --> E
D[音訊<br>最多 3 段<br>需搭配圖/影片] --> E
E[H3 全模態上下文] --> F[H3-Base 生成 768p<br>影片 + 原生立體聲]
F --> G[H3-Regenerate-2K<br>重繪為原生 2K]具體上限:文字提示詞 7,000 字元、圖片 9 張、參考影片 3 段(總長 15 秒內)、參考音訊 3 段(總長 15 秒內,不能單獨輸入,必須搭配圖片或影片),全部加起來最多 12 個檔案。官方舉的例子很直白:丟一張角色照片(外觀)+一段希區考克電影的運鏡(鏡頭運動)+一段演唱音軌(聲音與節奏),再用一句話描述「讓照片裡的角色上台、用這段運鏡、跟著這段音樂唱」,H3 會自動理解每個素材的用途。
輸出規格:2K、15 秒、24 FPS、原生立體聲
| 項目 | 規格 |
|---|---|
| 解析度 | 原生 2K(短邊 1440px,16:9 約 2560×1440);預設輸出短邊 768px |
| 影片時長 | 4–15 秒(整數秒) |
| 幀率 | 24 FPS(固定) |
| 音訊 | 32 kHz 雙聲道立體聲,與畫面同一次推理生成 |
| 比例 | 21:9、16:9、4:3、1:1、3:4、9:16 |
| 語言 | 穩定支援 11 種(含中文、英文、日文等) |
特別值得一提的是「原生 2K」不是事後超解析:官方採用 In-Context Regeneration(上下文內重繪) 技術,模型先生成 768p 草稿,再重新讀取原始多模態上下文做一次高解析度生成,所以小字、Logo、紋理等細節是「從語意還原」,而不是靠放大演算法瞎猜。
系統架構:三個模組、兩個開源 Checkpoint
H3 完整系統由三個模組組成,但不是全部都開源:
| 模組 | 參數量 | 開源? | 功能 |
|---|---|---|---|
| H3-Context-IR | — | ❌ 僅 API | 解析文字/圖片/影音之間的關係,轉成結構化表徵 |
| H3-Base | 331 億 | ✅ | 核心 Omni Transformer,生成 768p 影片+原生立體聲 |
| H3-Regenerate-2K | — | ❌ 僅 API | 用原始上下文把 768p 重繪成原生 2K |
開源的是 H3-Base 的兩個任務型 Checkpoint:
- FL2VA:文字生影片(T2V)、首幀/尾幀控制(支援 0–2 張圖片輸入)
- Ref2VA:全模態參考模式(9 圖+3 影片+3 音訊的混合輸入)
兩個 Checkpoint 是獨立分區,切換使用時要重啟推理伺服器。
ComfyUI 首日支援:4 個新節點、6 套官方模板
開源當天,ComfyUI 官方庫就合併了 PR #15224(8 月 3 日),新增 4 個專屬節點:EmptyMiniMaxH3LatentAV、MiniMaxH3ImageToVideo、MiniMaxH3ReferenceToVideo、MiniMaxH3SigmaShift,並提供 6 套官方工作流模板(本地 T2V/I2V/R2V 3 套+API 3 套)。
重點是硬體門檻被大幅壓低。ComfyUI 團隊把約 40% 的 modulation 權重剪枝成等價的查找表(無損畫質),加上 int8 量化與自訂 kernel,整體記憶體占用從全精度 123.6 GB 降到 42.5 GB(-66%),再搭配動態 VRAM 卸載,官方宣稱 RTX 3060 就能本地運行這顆 2K 影片模型。
權重怎麼選?官方給的 GPU 指南:
| 顯示卡 | VRAM | 建議下載 |
|---|---|---|
| RTX 4070 Ti Super / 4080 等 | 16 GB | 擴散模型 INT4(約 11.3 GB)+文字編碼器 INT4(15 GB) |
| RTX 3090 / 4090 等 | 24 GB | 擴散模型 INT8(約 19.5–21 GB)+文字編碼器 INT8(27 GB) |
| RTX 5090 等 Blackwell | — | NVFP4(12.5 GB,僅限 Blackwell 架構) |
| 任何人(通用) | — | 兩個 VAE 都必載:影片 VAE FP16(5.21 GB)+音訊 VAE FP32(605 MB) |
文字編碼器沿用 Qwen3-VL-32B;BF16 完整版擴散模型則要 61.7 GB,一般使用者直接選量化版即可。H3-Base 可透過 SGLang、vLLM、diffusers 與 ComfyUI 部署。
授權條款:免費商用有營收門檻
H3 採用 MiniMax H3 社群授權協議(Community License Agreement):年營收低於 2,000 萬美元的組織可免費商用,但必須標明來源(Attribution);超過這個規模的企業需要另外洽談授權。這跟 MiniMax 早期 M 系列(M2、M2.5)的 MIT 授權不同,商用前建議先讀完整條款。
價格與競品比較:編輯能力第一、價格只要一半
H3 的 API 按生成秒數計費,定價非常侵略性:
| 項目 | 價格 |
|---|---|
| 2K 輸出 | 每秒 $0.13 美元 |
| 768p 輸出 | 每秒 $0.09 美元(封閉測試中) |
| 參考圖片 | 前 5 張免費,第 6 張起每張 $0.04 |
| 參考音訊 | 免費 |
| 參考影片輸入 | 依輸入時長以輸出等級費率計費 |
在 Artificial Analysis 的盲測榜單上,H3 的影片編輯(Video Editing)Elo 1130 排名第一,領先 Seedance 2.0 高達 95 分;文字生影片 1242 分也小贏 Seedance 的 1225 分,只有圖片生影片小輸 12 分。跟其他主流模型的比較:
| 比較維度 | MiniMax H3 | Seedance 2.5 | Kling 3.0 | Google Veo 3.1 |
|---|---|---|---|---|
| 最大解析度 | 原生 2K | 1080p | 原生 4K | 4K(僅 8 秒) |
| 最長時長 | 15 秒(可擴展到約 30 秒) | 30 秒 | 15 秒 | 8 秒 |
| 參考輸入 | 9 圖+3 影+3 音(≤12 檔) | 約 50 檔 | 較有限 | 3 張圖 |
| 音訊 | 原生立體聲 | 原生立體聲 | 5 語言對話+唇形同步 | 48kHz 高保真 |
| 編輯能力 | 指令式編輯(Elo 1130 #1) | 參考驅動 | 元素/角色綁定 | — |
| 價格 | $0.13/秒 | 略高於 H3 | $0.18–0.25/秒 | 分級計費 |
| 開源 | 開源權重(社群授權) | 封閉 | 封閉 | 封閉 |
簡單總結:要 4K 大螢幕展示或多鏡頭敘事選 Kling 3.0,要物理真實感選 Veo 3.1,要超長片段的敘事選 Seedance 2.5;但如果你要做短影音、產品廣告、需要多素材混編與反覆修改鏡頭,H3 在品質、價格與本地部署彈性上是目前最均衡的選擇。對企業來說,如果在意完全開源的 Apache 2.0 授權與端側部署,阿里巴巴的 Wan 2.7 仍是另一個選項,只是畫質停留在 1080p。
台灣創作者怎麼開始?
- 更新 ComfyUI 到 0.30.0(或直接用 Comfy Cloud)
- 從模板庫下載
video_minimax_h3_t2v.json(文字生影片)或video_minimax_h3_i2v.json(圖片生影片) - 依工作流註解把權重放到
models/diffusion_models、models/text_encoders、models/vae - 寫提示詞、接上參考幀或素材,按下 Run
不想搞本地環境的話,也可以直接到 Hailuo AI App、MiniMax Hub(送 3 次免費生成)或 Open Platform API 試用,OpenRouter 上也有 minimax/hailuo-3。
延伸閱讀
- ComfyUI:最強大的開源擴散模型 GUI,採用節點式工作流程
- ComfyUI HunyuanVideo Wrapper:在 ComfyUI 中生成 Hunyuan 影片
- FLUX 3 重磅登場:一個模型包辦影像、影片、音訊與機器人動作
- MiniMax M2:開源AI模型如何簡化複雜任務?
- LocalAI:自託管 OpenAI API 相容推理伺服器
