MiniMax H3 Colab 完整教學 2026:用 Google 官方 Colab CLI 把 1–9 張參考圖變成 12 秒帶原生音訊影片,不必自備 GPU

killkli/minimax-h3-colab-skill 是一支 2026 年 9 月底出現的 Codex 技能:它把 MiniMax H3 的 Ref2VA(參考圖轉影片)推論整包搬進 Google Colab,本機只負責上傳圖片與 prompt,GPU 由 Colab 出,跑完把帶音訊的 MP4 下載回來。本文拆解它的安裝與 OAuth2 授權、runner 與批次 manifest、<Picture N> 對位規則、4–15 秒長度與模型分工,以及最容易被忽略的成本陷阱——Colab session 是計費 VM,24 小時 keep-alive 上限,忘記 stop 就會一直燒 compute units。

  • Dennis
  • 9 分鐘閱讀
MiniMax H3 Colab 完整教學 2026:用 Google 官方 Colab CLI 把 1–9 張參考圖變成 12 秒帶原生音訊影片,不必自備 GPU

想試 MiniMax H3 的影片生成,最常見的卡點不是 prompt,而是顯卡:H3 是重量級模型,本機跑不動、雲端 GPU 又要自己開機器裝環境。2026 年 9 月底出現一支小型開源專案,把這件事整包搬進 Google Colab——你的電腦只負責上傳參考圖與 prompt,實際推論在 Colab 的 GPU 上跑,完成後把 帶原生音訊的 MP4 下載回本機。

這篇要拆解的對象是 killkli/minimax-h3-colab-skill,以及它背後真正的主角:Google 在 2026 年 6 月推出的官方 Colab CLI。這兩件事放在一起,才解釋了為什麼「一支技能腳本」有機會取代過去一整套雲端 GPU 教學。

📌 先講清楚:H3 模型本身(開源權重、2K、原生立體聲、ComfyUI 支援)已經有專文整理,見文末〈延伸閱讀〉。本文聚焦在「怎麼用 Colab 把它跑起來」這個實作層。

一、這支專案是什麼?先看誠實的體檢表

項目現況(2026-09-30 實查)
儲存庫killkli/minimax-h3-colab-skill
說明Standalone Codex skill for MiniMax H3 Colab reference-to-video generation
星數 / Fork81 stars / 8 forks
建立時間2026-09-26(4 天前)
主要語言Jupyter Notebook(另有 30KB 的 Python runner)
授權條款⚠️ 未標示(無 LICENSE)
內含檔案SKILL.md、scripts/runner.py、assets/MiniMax_H3_Turbo_Colab.ipynb、run_colab_inference.sh、install.sh、tests/test_runner.py

必須先講白的兩點:

  1. 這是一個非常年輕、非常小的專案(4 天、81 顆星)。它不是社群驗證過的工具鏈,而是「一個人把可行的做法整理成技能」的成果。適合拿來學習與實驗,但要有「隨時可能改動或停更」的預期。
  2. 沒有授權條款。在法律上,沒有 LICENSE 代表預設保留所有權利——你可以讀、可以自己跑,但轉散布或商用前必須先問作者。這點常被忽略,卻是最實際的風險。

二、為什麼現在可行?關鍵是 Google 官方的 Colab CLI

這支技能之所以能成立,靠的不是 H3,而是 Colab CLI(google-colab-cli)——Google 在 2026 年 6 月推出的官方命令列工具,讓你能從終端機直接租用 Colab 的遠端 runtime。

它解決的正是「只會說 bash 的程式」的痛點:過去 Colab 的價值綁在瀏覽器上,而 shell 腳本、CI 流程、以及只能在終端機操作的 AI agent,全都吃不到這份免費/低價 GPU。Colab CLI 把同一批機器用指令吐出來:

指令作用
colab new [--gpu T4|A100|H100…] [--tpu …]租一台新的 VM(開始計費)
colab exec -f script.py在遠端執行本機程式碼
colab upload / colab download傳檔案上去、把產物拉回來
colab install在遠端裝套件
colab usage查方案與 compute unit 餘額
colab stop釋放 VM(停止計費)

官方 README 明列支援 T4、L4、G4、H100、A100 等 GPU 與 TPU runtime,並強調它是為「headless 自動化與 AI agent 整合」設計的——這也解釋了為什麼 H3 這種模型會被包成「給 Codex 用的技能」:整條流程都能用 bash 驅動。

官方文件裡有一句心智模型值得畫重點:

一個 session 就是一台租來的 VM 上活著的 Jupyter kernel。colab new 配置一台計費 VM,colab stop 釋放它。除了 24 小時的 keep-alive 上限之外,沒有任何機制會自動回收它。

換句話說:忘記 stop,就會一直燒錢。(後面第八節專門講這一塊。)

三、它怎麼運作?本機只做兩件事

整條鏈路的分工非常乾淨:

  1. 本機:準備 1–9 張參考圖 + 一份 UTF-8 的 prompt 文字檔,上傳到 Colab。
  2. Colab GPU:跑 MiniMax_H3_Turbo_Colab.ipynb,用 H3 做 Ref2VA(參考圖轉影片+音訊)推論。
  3. 下載:把產出的 MP4 存回你指定的路徑。

本機不需要安裝 H3、不需要 GPU、不需要下載模型權重——這也是它相對「本機跑 ComfyUI」最大的差別:換來的是每次都重新配置的遠端環境,以及按使用量計費的成本結構。

四、安裝與授權:四步就能跑第一次推論

git clone https://github.com/killkli/minimax-h3-colab-skill.git
cd minimax-h3-colab-skill
./install.sh

uv python install 3.12
uv tool install --python 3.12 google-colab-cli
colab --auth=oauth2 usage      # 第一次會引導 Google OAuth2 授權

幾個容易踩到的細節:

  • runner 只需要 Python 3.11+,而且只用標準函式庫;但 Colab CLI 本身需要 Python 3.12+。作者用 uv 另外管理 CLI 的 Python,就是為了不污染系統或 Studio 的環境。
  • 安裝路徑:有設 CODEX_HOME 就裝到 $CODEX_HOME/skills/minimax-h3-colab,沒設就是 ~/.codex/skills/minimax-h3-colab。技能名稱叫 minimax-h3-colab。
  • install.sh 的設計相當穩健:可重複執行、預設不覆蓋既有安裝,而且採「先寫暫存目錄、再原子改名」;要換版本得明確加 --force,舊目錄會被移到帶時間戳的 .backup.* 方便回滾。
  • 它只把 SKILL.md、scripts/、assets/ 複製進 Codex。Git 資料、測試、README、輸出檔都不會進去。

💡 不想裝 Codex 也能用:runner 就是一支普通的 Python 腳本,直接從 clone 下來的目錄執行也可以(第七節的批次指令就是這種用法)。

五、單支影片:命令與環境變數

./run_colab_inference.sh \
  --image /absolute/path/reference_1.png \
  --image /absolute/path/reference_2.jpg \
  --prompt /absolute/path/prompt.txt \
  --output /absolute/path/intro.mp4

行為規則:

  • --image 可重複 1–9 次,順序固定:第 1 張對應 prompt 裡的 <Picture 1>,第 2 張對應 <Picture 2>,依此類推。
  • 省略 --output 時,MP4 會存到第一張參考圖旁邊,檔名加 _minimax_h3.mp4。
  • prompt 檔以 UTF-8 原樣上傳,runner 不翻譯、不摘要、不改寫。你寫什麼,模型就看到什麼。

可調的環境變數:

變數預設說明
COLAB_AUTHoauth2認證策略,可改 adc(若環境已有 Google ADC)
COLAB_GPUA100傳給 colab new 的 GPU 型號
COLAB_HIGH_MEM1設 0 就不傳 --high-mem
COLAB_EXEC_TIMEOUT3600單次 Notebook 執行逾時(秒)
H3_DURATION_SECONDS12影片長度,只能 4–15 秒

例如要一支 8 秒的影片:

H3_DURATION_SECONDS=8 ./run_colab_inference.sh \
  --image /absolute/path/reference.png \
  --prompt /absolute/path/prompt.txt

六、批次推論:一份 manifest 跑完一串影片

H3 的模型載入很貴,一支一支跑等於每次都要重新載入模型。正確做法是把所有工作寫進同一份 jobs.json,讓它們共用同一個 Colab session 與已載入的模型狀態:

{
  "jobs": [
    {
      "id": "intro",
      "title": "Presenter introduction",
      "reference_images": ["/abs/girl-front.png", "/abs/girl-side.png"],
      "prompt_file": "/abs/intro-prompt.txt",
      "duration_seconds": 8,
      "output_name": "intro"
    },
    {
      "id": "demo",
      "title": "CLI demo",
      "reference_images": ["/abs/girl-front.png"],
      "prompt": "A concise Ref2VA prompt referring to <Picture 1>.",
      "duration_seconds": 12,
      "output_name": "demo"
    }
  ]
}
python3 scripts/runner.py batch \
  --manifest /absolute/path/jobs.json \
  --gpu A100 --timeout 10800 \
  --output-dir /absolute/path/outputs \
  --progress /absolute/path/outputs/progress.json

這個 runner 的幾個設計值得肯定:

  • 建立 session 之前先驗證所有本機輸入(檔案不存在、prompt 空白、時長越界,都不會浪費一次 VM 配置)。
  • 逐工作上傳圖片與 prompt → 執行 Notebook → 下載並驗證 MP4 → 再處理下一項。
  • 後續工作失敗時,已完成的輸出仍會保留。
  • 自己建立的 session 會在清理階段停止,即使中途逾時或出錯也會嘗試停掉;若是重用既有 session,則需要 --stop-on-complete 才會停。

七、Prompt 與圖片規則:<Picture N> 是整件事的核心

這套流程最需要理解的,是 「檔案」與「主體」的對位:

  • 每個工作需要 1–9 張非空白本機參考圖,順序固定。
  • <Picture N> 只依上傳順序對應,不會自己去猜哪張是主角。
  • prompt 不可引用超過該工作圖片數量的 <Picture N>(只有 2 張圖卻寫 <Picture 5> 就是錯的)。
  • 每支影片長度限制 4–15 秒。
  • 對話要用 <d>[Chinese] …</d> 這種寫法放在對應的分鏡裡。

若你的程式需要組合出導引式 prompt,runner 內建 compose_ref2va_prompt helper,會產生 subject_definitions、summary、retention_analysis、有順序的 shot 區塊、overall_soundscape 與 non_diegetic_music 等欄位——這正好對上 H3 官方 prompt 指南的結構。寫 prompt 前建議先讀 MiniMax 官方的 Ref2VA 指南,能省下大量來回。

⚠️ 補充一個容易混淆的點:H3 模型本身支援的參考素材比這支技能更廣(官方 Ref2VA 可吃 ≤9 張圖、≤3 段影片、≤3 段音訊)。這支技能的 runner 只處理圖片。要混合影片/音訊參考,得自己改。

八、最容易被忽略的成本陷阱:session 是計費 VM

這是本文想強調最多次的一段。

事實說明
colab new 就開始計費一台 VM 被配置出來就開始消耗 compute units,不是「跑完才算」
沒有自動回收官方原文:除了 24 小時 keep-alive 上限,沒有任何機制會自動釋放
因此必須明確 stopcolab stop,或批次流程的清理階段(這支 runner 有做)
免費額度不可靠免費用戶的 GPU 是「有就用、不保證」,session 上限約 12 小時、閒置約 90 分鐘斷線
付費方式官方 Pay As You Go 為 $9.99 / 100 compute units;Pro+ 月費 $49.99。A100 的實際折算各家估算落差很大(約 $1.5–$3.5/小時)

關於價格,這裡刻意不給單一數字:Colab 不公布固定 per-GPU 時價,而是用 compute unit 動態計價,不同來源換算出來的 A100 時價差距超過兩倍。要抓預算,請以你自己帳號的 colab usage 實際扣抵為準。

實務建議:批次跑之前先 colab usage 看餘額;跑完務必確認 session 已停止(colab sessions);不要把 colab exec 逾時當成「機器掛了」就重跑——官方明確提醒逾時不等於遠端 kernel 已停止,它可能還在算,盲目重試只會變成兩倍成本。

九、安全與隱私:OAuth 憑證絕對不要進 repo

這支專案的 README 特別強調、也值得所有人記住的一條:

不要把憑證、Token 或瀏覽器狀態放進儲存庫、prompt 或工作 manifest。

原因很實在:prompt 是原樣上傳到遠端的,manifest 也常在團隊間傳來傳去。一旦 OAuth token 混進這些檔案,等於把它交給了任何看得到那份檔案的人。Token 交給 Colab CLI 自己的本機設定存放就好。

十、限制與風險(務必先讀)

限制影響
專案僅 4 天、81 星、無授權條款不宜直接商用或再散布,改動風險自負
Colab CLI 只支援 Linux / macOS⚠️ Windows 目前不支援,Windows 使用者要先想辦法(WSL 或改用其他路徑)
GPU 配置不保證有 compute unit ≠ 一定配得到 A100;高記憶體 runtime 更是看運氣,作者也要求「配置失敗要老實回報」而不是硬重試
只支援圖片參考模型本身能吃影片與音訊參考,這支 runner 不行
依賴 Colab 服務條款與配額你的產能上限由 Google 的方案決定,不是由你的機器決定
遠端環境每次重建不像本機 ComfyUI 那樣有穩定的可重現環境

十一、誰適合用?誰不適合?

適合:手邊沒有強力 GPU、想先驗證 H3 效果的人;需要把「參考圖轉影片」接進自動化流程(例如每週為商品產生影片)的人;正在研究「怎麼讓 AI agent 驅動雲端 GPU」的開發者。

不適合:需要大量、穩定、可預測成本的產線(長期算下來,租固定 GPU 或自架更划算);必須在 Windows 上跑的人;需要混合影片/音訊參考的專案。

結語

這支專案真正有價值的,不是它 30KB 的 runner,而是它示範了一種正在成形的分工:把「貴的算力」外包給雲端、把「流程控制」留給本機的腳本或 agent。H3 負責生成,Colab CLI 負責出機器,runner 負責把工作排好隊、跑完、收乾淨。

而在這條鏈路裡,最需要人類紀律的其實是最無聊的一件事:記得關機器。

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

訂閱即表示同意收到 most.tw 電子報,隨時可一鍵退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友