MiniMax H3 開源了!2K 影片+原生立體聲+ComfyUI 首日支援,RTX 3060 就能跑

MiniMax 於 8 月 3 日正式開源影片生成模型 H3(Hailuo 3.0):單一模型吃進文字、圖片、影片與音訊四種輸入,一次輸出最高 2K、15 秒、附原生立體聲的影片,ComfyUI 首日原生支援(PR #15224),記憶體優化 66% 後連 RTX 3060 都能本地運行。本文整理輸出規格、三模組架構、權重選擇指南、授權條款與競品比較。

  • Dennis
  • 7 分鐘閱讀
MiniMax H3 開源了!2K 影片+原生立體聲+ComfyUI 首日支援,RTX 3060 就能跑

MiniMax 在 8 月 3 日正式開源第三代影片生成模型 H3(Hailuo 3.0):單一模型吃進文字、圖片、影片與音訊,一次輸出最高 2K、15 秒、附原生立體聲的影片,ComfyUI 首日原生支援,記憶體優化後連 RTX 3060 都能本地跑。

這是 Hailuo 系列第一次開源權重,也是目前「最強開源權重影片模型」的有力候選人。想玩的人今天就能動手:更新 ComfyUI 到 0.30.0,下載工作流模板,把權重丟進對應資料夾,RTX 3060 以上的顯示卡就能生成帶聲音的 AI 影片。本文帶你一次看懂它強在哪、怎麼選權重、以及跟 Kling、Seedance、Veo 的差距。

MiniMax H3 是什麼?

MiniMax H3 是 MiniMax 在 2026 年 7 月 31 日於世界人工智慧大會(WAIC)發表的「通用全模態生成系統」,8 月 3 日在 Hugging Face 釋出開源權重。它屬於 Hailuo 產品線的第三代:

版本發布時間定位
Hailuo 012024從零驗證影片生成可行性
Hailuo 02 / 2.32025 – 2026 初原生 1080p、6–10 秒、指令跟隨改善
MiniMax H32026-07-31通用全模態生成:2K、15 秒、原生立體聲

跟前代最大的差別:Hailuo 02/2.3 只能吃「提示詞或一張圖」、輸出靜音影片;H3 可以同時吃進文字、多張圖片、參考影片與音訊,輸出畫面與聲音一起生成的影片——對話、音效、環境音在同一次推理中完成,不是後製合成的。

全模態輸入:一次最多 12 個檔案

H3 的殺手鐧是「全模態上下文理解」。過去你要分別用三個模型做角色一致性、動作轉移、聲音克隆,H3 直接把所有素材丟進同一個上下文,模型自己判斷每個素材的角色:

flowchart LR
    A[文字提示詞<br>最多 7,000 字元] --> E
    B[圖片<br>最多 9 張] --> E
    C[影片<br>最多 3 段<br>每段 2–15 秒] --> E
    D[音訊<br>最多 3 段<br>需搭配圖/影片] --> E
    E[H3 全模態上下文] --> F[H3-Base 生成 768p<br>影片 + 原生立體聲]
    F --> G[H3-Regenerate-2K<br>重繪為原生 2K]

具體上限:文字提示詞 7,000 字元、圖片 9 張、參考影片 3 段(總長 15 秒內)、參考音訊 3 段(總長 15 秒內,不能單獨輸入,必須搭配圖片或影片),全部加起來最多 12 個檔案。官方舉的例子很直白:丟一張角色照片(外觀)+一段希區考克電影的運鏡(鏡頭運動)+一段演唱音軌(聲音與節奏),再用一句話描述「讓照片裡的角色上台、用這段運鏡、跟著這段音樂唱」,H3 會自動理解每個素材的用途。

輸出規格:2K、15 秒、24 FPS、原生立體聲

項目規格
解析度原生 2K(短邊 1440px,16:9 約 2560×1440);預設輸出短邊 768px
影片時長4–15 秒(整數秒)
幀率24 FPS(固定)
音訊32 kHz 雙聲道立體聲,與畫面同一次推理生成
比例21:9、16:9、4:3、1:1、3:4、9:16
語言穩定支援 11 種(含中文、英文、日文等)

特別值得一提的是「原生 2K」不是事後超解析:官方採用 In-Context Regeneration(上下文內重繪) 技術,模型先生成 768p 草稿,再重新讀取原始多模態上下文做一次高解析度生成,所以小字、Logo、紋理等細節是「從語意還原」,而不是靠放大演算法瞎猜。

系統架構:三個模組、兩個開源 Checkpoint

H3 完整系統由三個模組組成,但不是全部都開源

模組參數量開源?功能
H3-Context-IR❌ 僅 API解析文字/圖片/影音之間的關係,轉成結構化表徵
H3-Base331 億核心 Omni Transformer,生成 768p 影片+原生立體聲
H3-Regenerate-2K❌ 僅 API用原始上下文把 768p 重繪成原生 2K

開源的是 H3-Base 的兩個任務型 Checkpoint:

  • FL2VA:文字生影片(T2V)、首幀/尾幀控制(支援 0–2 張圖片輸入)
  • Ref2VA:全模態參考模式(9 圖+3 影片+3 音訊的混合輸入)

兩個 Checkpoint 是獨立分區,切換使用時要重啟推理伺服器。

ComfyUI 首日支援:4 個新節點、6 套官方模板

開源當天,ComfyUI 官方庫就合併了 PR #15224(8 月 3 日),新增 4 個專屬節點:EmptyMiniMaxH3LatentAVMiniMaxH3ImageToVideoMiniMaxH3ReferenceToVideoMiniMaxH3SigmaShift,並提供 6 套官方工作流模板(本地 T2V/I2V/R2V 3 套+API 3 套)。

重點是硬體門檻被大幅壓低。ComfyUI 團隊把約 40% 的 modulation 權重剪枝成等價的查找表(無損畫質),加上 int8 量化與自訂 kernel,整體記憶體占用從全精度 123.6 GB 降到 42.5 GB(-66%),再搭配動態 VRAM 卸載,官方宣稱 RTX 3060 就能本地運行這顆 2K 影片模型。

權重怎麼選?官方給的 GPU 指南:

顯示卡VRAM建議下載
RTX 4070 Ti Super / 4080 等16 GB擴散模型 INT4(約 11.3 GB)+文字編碼器 INT4(15 GB)
RTX 3090 / 4090 等24 GB擴散模型 INT8(約 19.5–21 GB)+文字編碼器 INT8(27 GB)
RTX 5090 等 BlackwellNVFP4(12.5 GB,僅限 Blackwell 架構)
任何人(通用)兩個 VAE 都必載:影片 VAE FP16(5.21 GB)+音訊 VAE FP32(605 MB)

文字編碼器沿用 Qwen3-VL-32B;BF16 完整版擴散模型則要 61.7 GB,一般使用者直接選量化版即可。H3-Base 可透過 SGLang、vLLM、diffusers 與 ComfyUI 部署。

授權條款:免費商用有營收門檻

H3 採用 MiniMax H3 社群授權協議(Community License Agreement):年營收低於 2,000 萬美元的組織可免費商用,但必須標明來源(Attribution);超過這個規模的企業需要另外洽談授權。這跟 MiniMax 早期 M 系列(M2、M2.5)的 MIT 授權不同,商用前建議先讀完整條款。

價格與競品比較:編輯能力第一、價格只要一半

H3 的 API 按生成秒數計費,定價非常侵略性:

項目價格
2K 輸出每秒 $0.13 美元
768p 輸出每秒 $0.09 美元(封閉測試中)
參考圖片前 5 張免費,第 6 張起每張 $0.04
參考音訊免費
參考影片輸入依輸入時長以輸出等級費率計費

在 Artificial Analysis 的盲測榜單上,H3 的影片編輯(Video Editing)Elo 1130 排名第一,領先 Seedance 2.0 高達 95 分;文字生影片 1242 分也小贏 Seedance 的 1225 分,只有圖片生影片小輸 12 分。跟其他主流模型的比較:

比較維度MiniMax H3Seedance 2.5Kling 3.0Google Veo 3.1
最大解析度原生 2K1080p原生 4K4K(僅 8 秒)
最長時長15 秒(可擴展到約 30 秒)30 秒15 秒8 秒
參考輸入9 圖+3 影+3 音(≤12 檔)約 50 檔較有限3 張圖
音訊原生立體聲原生立體聲5 語言對話+唇形同步48kHz 高保真
編輯能力指令式編輯(Elo 1130 #1)參考驅動元素/角色綁定
價格$0.13/秒略高於 H3$0.18–0.25/秒分級計費
開源開源權重(社群授權)封閉封閉封閉

簡單總結:要 4K 大螢幕展示或多鏡頭敘事選 Kling 3.0,要物理真實感選 Veo 3.1,要超長片段的敘事選 Seedance 2.5;但如果你要做短影音、產品廣告、需要多素材混編與反覆修改鏡頭,H3 在品質、價格與本地部署彈性上是目前最均衡的選擇。對企業來說,如果在意完全開源的 Apache 2.0 授權與端側部署,阿里巴巴的 Wan 2.7 仍是另一個選項,只是畫質停留在 1080p。

台灣創作者怎麼開始?

  1. 更新 ComfyUI 到 0.30.0(或直接用 Comfy Cloud)
  2. 從模板庫下載 video_minimax_h3_t2v.json(文字生影片)或 video_minimax_h3_i2v.json(圖片生影片)
  3. 依工作流註解把權重放到 models/diffusion_modelsmodels/text_encodersmodels/vae
  4. 寫提示詞、接上參考幀或素材,按下 Run

不想搞本地環境的話,也可以直接到 Hailuo AI App、MiniMax Hub(送 3 次免費生成)或 Open Platform API 試用,OpenRouter 上也有 minimax/hailuo-3

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。