想試 MiniMax H3 的影片生成,最常見的卡點不是 prompt,而是顯卡:H3 是重量級模型,本機跑不動、雲端 GPU 又要自己開機器裝環境。2026 年 9 月底出現一支小型開源專案,把這件事整包搬進 Google Colab——你的電腦只負責上傳參考圖與 prompt,實際推論在 Colab 的 GPU 上跑,完成後把 帶原生音訊的 MP4 下載回本機。
這篇要拆解的對象是 killkli/minimax-h3-colab-skill,以及它背後真正的主角:Google 在 2026 年 6 月推出的官方 Colab CLI。這兩件事放在一起,才解釋了為什麼「一支技能腳本」有機會取代過去一整套雲端 GPU 教學。
📌 先講清楚:H3 模型本身(開源權重、2K、原生立體聲、ComfyUI 支援)已經有專文整理,見文末〈延伸閱讀〉。本文聚焦在「怎麼用 Colab 把它跑起來」這個實作層。
一、這支專案是什麼?先看誠實的體檢表
| 項目 | 現況(2026-09-30 實查) |
|---|---|
| 儲存庫 | killkli/minimax-h3-colab-skill |
| 說明 | Standalone Codex skill for MiniMax H3 Colab reference-to-video generation |
| 星數 / Fork | 81 stars / 8 forks |
| 建立時間 | 2026-09-26(4 天前) |
| 主要語言 | Jupyter Notebook(另有 30KB 的 Python runner) |
| 授權條款 | ⚠️ 未標示(無 LICENSE) |
| 內含檔案 | SKILL.md、scripts/runner.py、assets/MiniMax_H3_Turbo_Colab.ipynb、run_colab_inference.sh、install.sh、tests/test_runner.py |
必須先講白的兩點:
- 這是一個非常年輕、非常小的專案(4 天、81 顆星)。它不是社群驗證過的工具鏈,而是「一個人把可行的做法整理成技能」的成果。適合拿來學習與實驗,但要有「隨時可能改動或停更」的預期。
- 沒有授權條款。在法律上,沒有 LICENSE 代表預設保留所有權利——你可以讀、可以自己跑,但轉散布或商用前必須先問作者。這點常被忽略,卻是最實際的風險。
二、為什麼現在可行?關鍵是 Google 官方的 Colab CLI
這支技能之所以能成立,靠的不是 H3,而是 Colab CLI(google-colab-cli)——Google 在 2026 年 6 月推出的官方命令列工具,讓你能從終端機直接租用 Colab 的遠端 runtime。
它解決的正是「只會說 bash 的程式」的痛點:過去 Colab 的價值綁在瀏覽器上,而 shell 腳本、CI 流程、以及只能在終端機操作的 AI agent,全都吃不到這份免費/低價 GPU。Colab CLI 把同一批機器用指令吐出來:
| 指令 | 作用 |
|---|---|
colab new [--gpu T4|A100|H100…] [--tpu …] | 租一台新的 VM(開始計費) |
colab exec -f script.py | 在遠端執行本機程式碼 |
colab upload / colab download | 傳檔案上去、把產物拉回來 |
colab install | 在遠端裝套件 |
colab usage | 查方案與 compute unit 餘額 |
colab stop | 釋放 VM(停止計費) |
官方 README 明列支援 T4、L4、G4、H100、A100 等 GPU 與 TPU runtime,並強調它是為「headless 自動化與 AI agent 整合」設計的——這也解釋了為什麼 H3 這種模型會被包成「給 Codex 用的技能」:整條流程都能用 bash 驅動。
官方文件裡有一句心智模型值得畫重點:
一個 session 就是一台租來的 VM 上活著的 Jupyter kernel。
colab new配置一台計費 VM,colab stop釋放它。除了 24 小時的 keep-alive 上限之外,沒有任何機制會自動回收它。
換句話說:忘記 stop,就會一直燒錢。(後面第八節專門講這一塊。)
三、它怎麼運作?本機只做兩件事
整條鏈路的分工非常乾淨:
- 本機:準備 1–9 張參考圖 + 一份 UTF-8 的 prompt 文字檔,上傳到 Colab。
- Colab GPU:跑
MiniMax_H3_Turbo_Colab.ipynb,用 H3 做 Ref2VA(參考圖轉影片+音訊)推論。 - 下載:把產出的 MP4 存回你指定的路徑。
本機不需要安裝 H3、不需要 GPU、不需要下載模型權重——這也是它相對「本機跑 ComfyUI」最大的差別:換來的是每次都重新配置的遠端環境,以及按使用量計費的成本結構。
四、安裝與授權:四步就能跑第一次推論
git clone https://github.com/killkli/minimax-h3-colab-skill.git
cd minimax-h3-colab-skill
./install.sh
uv python install 3.12
uv tool install --python 3.12 google-colab-cli
colab --auth=oauth2 usage # 第一次會引導 Google OAuth2 授權
幾個容易踩到的細節:
runner只需要 Python 3.11+,而且只用標準函式庫;但 Colab CLI 本身需要 Python 3.12+。作者用uv另外管理 CLI 的 Python,就是為了不污染系統或 Studio 的環境。- 安裝路徑:有設
CODEX_HOME就裝到$CODEX_HOME/skills/minimax-h3-colab,沒設就是~/.codex/skills/minimax-h3-colab。技能名稱叫minimax-h3-colab。 install.sh的設計相當穩健:可重複執行、預設不覆蓋既有安裝,而且採「先寫暫存目錄、再原子改名」;要換版本得明確加--force,舊目錄會被移到帶時間戳的.backup.*方便回滾。- 它只把
SKILL.md、scripts/、assets/複製進 Codex。Git 資料、測試、README、輸出檔都不會進去。
💡 不想裝 Codex 也能用:
runner就是一支普通的 Python 腳本,直接從 clone 下來的目錄執行也可以(第七節的批次指令就是這種用法)。
五、單支影片:命令與環境變數
./run_colab_inference.sh \
--image /absolute/path/reference_1.png \
--image /absolute/path/reference_2.jpg \
--prompt /absolute/path/prompt.txt \
--output /absolute/path/intro.mp4
行為規則:
--image可重複 1–9 次,順序固定:第 1 張對應 prompt 裡的<Picture 1>,第 2 張對應<Picture 2>,依此類推。- 省略
--output時,MP4 會存到第一張參考圖旁邊,檔名加_minimax_h3.mp4。 - prompt 檔以 UTF-8 原樣上傳,runner 不翻譯、不摘要、不改寫。你寫什麼,模型就看到什麼。
可調的環境變數:
| 變數 | 預設 | 說明 |
|---|---|---|
COLAB_AUTH | oauth2 | 認證策略,可改 adc(若環境已有 Google ADC) |
COLAB_GPU | A100 | 傳給 colab new 的 GPU 型號 |
COLAB_HIGH_MEM | 1 | 設 0 就不傳 --high-mem |
COLAB_EXEC_TIMEOUT | 3600 | 單次 Notebook 執行逾時(秒) |
H3_DURATION_SECONDS | 12 | 影片長度,只能 4–15 秒 |
例如要一支 8 秒的影片:
H3_DURATION_SECONDS=8 ./run_colab_inference.sh \
--image /absolute/path/reference.png \
--prompt /absolute/path/prompt.txt
六、批次推論:一份 manifest 跑完一串影片
H3 的模型載入很貴,一支一支跑等於每次都要重新載入模型。正確做法是把所有工作寫進同一份 jobs.json,讓它們共用同一個 Colab session 與已載入的模型狀態:
{
"jobs": [
{
"id": "intro",
"title": "Presenter introduction",
"reference_images": ["/abs/girl-front.png", "/abs/girl-side.png"],
"prompt_file": "/abs/intro-prompt.txt",
"duration_seconds": 8,
"output_name": "intro"
},
{
"id": "demo",
"title": "CLI demo",
"reference_images": ["/abs/girl-front.png"],
"prompt": "A concise Ref2VA prompt referring to <Picture 1>.",
"duration_seconds": 12,
"output_name": "demo"
}
]
}
python3 scripts/runner.py batch \
--manifest /absolute/path/jobs.json \
--gpu A100 --timeout 10800 \
--output-dir /absolute/path/outputs \
--progress /absolute/path/outputs/progress.json
這個 runner 的幾個設計值得肯定:
- 建立 session 之前先驗證所有本機輸入(檔案不存在、prompt 空白、時長越界,都不會浪費一次 VM 配置)。
- 逐工作上傳圖片與 prompt → 執行 Notebook → 下載並驗證 MP4 → 再處理下一項。
- 後續工作失敗時,已完成的輸出仍會保留。
- 自己建立的 session 會在清理階段停止,即使中途逾時或出錯也會嘗試停掉;若是重用既有 session,則需要
--stop-on-complete才會停。
七、Prompt 與圖片規則:<Picture N> 是整件事的核心
這套流程最需要理解的,是 「檔案」與「主體」的對位:
- 每個工作需要 1–9 張非空白本機參考圖,順序固定。
<Picture N>只依上傳順序對應,不會自己去猜哪張是主角。- prompt 不可引用超過該工作圖片數量的
<Picture N>(只有 2 張圖卻寫<Picture 5>就是錯的)。 - 每支影片長度限制 4–15 秒。
- 對話要用
<d>[Chinese] …</d>這種寫法放在對應的分鏡裡。
若你的程式需要組合出導引式 prompt,runner 內建 compose_ref2va_prompt helper,會產生 subject_definitions、summary、retention_analysis、有順序的 shot 區塊、overall_soundscape 與 non_diegetic_music 等欄位——這正好對上 H3 官方 prompt 指南的結構。寫 prompt 前建議先讀 MiniMax 官方的 Ref2VA 指南,能省下大量來回。
⚠️ 補充一個容易混淆的點:H3 模型本身支援的參考素材比這支技能更廣(官方 Ref2VA 可吃 ≤9 張圖、≤3 段影片、≤3 段音訊)。這支技能的 runner 只處理圖片。要混合影片/音訊參考,得自己改。
八、最容易被忽略的成本陷阱:session 是計費 VM
這是本文想強調最多次的一段。
| 事實 | 說明 |
|---|---|
colab new 就開始計費 | 一台 VM 被配置出來就開始消耗 compute units,不是「跑完才算」 |
| 沒有自動回收 | 官方原文:除了 24 小時 keep-alive 上限,沒有任何機制會自動釋放 |
| 因此必須明確 stop | colab stop,或批次流程的清理階段(這支 runner 有做) |
| 免費額度不可靠 | 免費用戶的 GPU 是「有就用、不保證」,session 上限約 12 小時、閒置約 90 分鐘斷線 |
| 付費方式 | 官方 Pay As You Go 為 $9.99 / 100 compute units;Pro+ 月費 $49.99。A100 的實際折算各家估算落差很大(約 $1.5–$3.5/小時) |
關於價格,這裡刻意不給單一數字:Colab 不公布固定 per-GPU 時價,而是用 compute unit 動態計價,不同來源換算出來的 A100 時價差距超過兩倍。要抓預算,請以你自己帳號的
colab usage實際扣抵為準。
實務建議:批次跑之前先 colab usage 看餘額;跑完務必確認 session 已停止(colab sessions);不要把 colab exec 逾時當成「機器掛了」就重跑——官方明確提醒逾時不等於遠端 kernel 已停止,它可能還在算,盲目重試只會變成兩倍成本。
九、安全與隱私:OAuth 憑證絕對不要進 repo
這支專案的 README 特別強調、也值得所有人記住的一條:
不要把憑證、Token 或瀏覽器狀態放進儲存庫、prompt 或工作 manifest。
原因很實在:prompt 是原樣上傳到遠端的,manifest 也常在團隊間傳來傳去。一旦 OAuth token 混進這些檔案,等於把它交給了任何看得到那份檔案的人。Token 交給 Colab CLI 自己的本機設定存放就好。
十、限制與風險(務必先讀)
| 限制 | 影響 |
|---|---|
| 專案僅 4 天、81 星、無授權條款 | 不宜直接商用或再散布,改動風險自負 |
| Colab CLI 只支援 Linux / macOS | ⚠️ Windows 目前不支援,Windows 使用者要先想辦法(WSL 或改用其他路徑) |
| GPU 配置不保證 | 有 compute unit ≠ 一定配得到 A100;高記憶體 runtime 更是看運氣,作者也要求「配置失敗要老實回報」而不是硬重試 |
| 只支援圖片參考 | 模型本身能吃影片與音訊參考,這支 runner 不行 |
| 依賴 Colab 服務條款與配額 | 你的產能上限由 Google 的方案決定,不是由你的機器決定 |
| 遠端環境每次重建 | 不像本機 ComfyUI 那樣有穩定的可重現環境 |
十一、誰適合用?誰不適合?
適合:手邊沒有強力 GPU、想先驗證 H3 效果的人;需要把「參考圖轉影片」接進自動化流程(例如每週為商品產生影片)的人;正在研究「怎麼讓 AI agent 驅動雲端 GPU」的開發者。
不適合:需要大量、穩定、可預測成本的產線(長期算下來,租固定 GPU 或自架更划算);必須在 Windows 上跑的人;需要混合影片/音訊參考的專案。
結語
這支專案真正有價值的,不是它 30KB 的 runner,而是它示範了一種正在成形的分工:把「貴的算力」外包給雲端、把「流程控制」留給本機的腳本或 agent。H3 負責生成,Colab CLI 負責出機器,runner 負責把工作排好隊、跑完、收乾淨。
而在這條鏈路裡,最需要人類紀律的其實是最無聊的一件事:記得關機器。
延伸閱讀
- MiniMax H3 開源了!2K 影片+原生立體聲+ComfyUI 首日支援(模型本身的完整解析)
- 2026 AI 影片生成工具完整比較(H3 與其他工具的定位)
- ComfyUI 入門教學 2026(想在本機跑 H3 的路線)
資料來源
- 專案儲存庫:killkli/minimax-h3-colab-skill(README / README.zh-TW / SKILL.md,2026-09-30 讀取)
- Google 官方:Introducing the Google Colab CLI、googlecolab/google-colab-cli(含官方
colab-operator技能說明) - 套件頁:google-colab-cli on PyPI
- 方案價格:Colab Paid Services Pricing
- MiniMax 官方 prompt 指南:MiniMax-H3 Ref2VA 影片 prompt 寫作指南
