MiniMind:用 3 塊錢、2 小時從零訓練自己的語言模型!55K Stars 開源專案完整解析

MiniMind 是 GitHub 上 55K+ Stars 的超熱門開源專案——號稱用 3 塊人民幣成本、2 小時訓練時間,就能在單張 RTX 3090 上從零訓練出 64M 參數的超小語言模型。本文完整解析 MiniMind 的模型架構、全階段訓練流程(Pretrain/SFT/LoRA/RLHF/GRPO/Agentic RL)、訓練成本實測,以及它為什麼是 LLM 學習者最好的起點。

  • Dennis
  • 3 分鐘閱讀
MiniMind:用 3 塊錢、2 小時從零訓練自己的語言模型!55K Stars 開源專案完整解析

MiniMind:用 3 塊錢、2 小時從零訓練自己的語言模型!

想訓練自己的大語言模型,最常聽到的門檻是:「沒有幾百張 GPU、幾千萬預算,想都別想。」

但 GitHub 上一個 55K+ Stars 的開源專案 MiniMind 直接打破這個迷思——用 3 塊人民幣的伺服器成本、2 小時訓練時間,就能從零訓練出一個 64M 參數的超小語言模型

🎯 MiniMind 是什麼?

「大道至簡」——這不是用 LoRA 微調別人的模型,而是從每一行代碼開始,從 0 親手訓練一個語言模型

項目內容
Repojingyaogong/minimind
Stars/Forks55.1K / 7.2K
授權Apache 2.0(完全免費)
最小模型64M 參數(約 GPT-3 的 1/2700)
訓練成本3 元人民幣 + 2 小時(單張 RTX 3090)
核心訴求全階段代碼從 0 實現,不依賴高層抽象框架

「用樂高自己拼出一架飛機,遠比坐在頭等艙裡飛行更讓人興奮。」

📦 模型系列(全部開源)

模型參數量發布
minimind-3(主線)64M2026.04
minimind-3-moe198M-A64M2026.04
minimind2104M2025.04
minimind2-small26M2025.04
minimind2-moe145M2025.04
minimind-v126M 系列2024

另有延伸專案:MiniMind-V(視覺多模態)、MiniMind-O(Omni 全模態)、MiniMind-dLM(擴散語言模型)、MiniMind-Linear(線性注意力)。

🔧 技術亮點

1. 完整的訓練鏈路(不只推理)

MiniMind 覆蓋了 LLM 訓練的全生命周期,而且全部從 0 用 PyTorch 原生實現:

Tokenizer 訓練 → Pretrain 預訓練 → SFT 監督微調 → LoRA
→ RLHF (DPO) → RLAIF (PPO / GRPO / CISPO)
→ Tool Use → Agentic RL → 模型蒸餾 → 長文本外推 (YaRN)

核心演算法不依賴 transformers / trl / peft 的高層封裝——每行程式碼都看得懂、可修改。

2. 對齊 Qwen3 生態

主線架構對齊 Qwen3 / Qwen3-MoE,支援 Dense + MoE 兩種結構,並內建 <think><tool_call> 等模板標記——訓練出來就可以跑 Agent 與思考模式。

3. 相容主流生態

  • 推理:llama.cpp / vllm / ollama 都支援
  • 訓練:可搭配 Llama-Factory 等框架
  • 部署:提供 OpenAI API 相容伺服器,可接 FastGPT、Open-WebUI
  • 分散式:單機單卡 / DDP / DeepSpeed

💰 訓練成本實測(單張 RTX 3090)

階段時間成本
Pretrain 預訓練~1.21h~1.57 人民幣
SFT 微調~1.10h~1.43 人民幣
Tool Call~0.9h~1.17 人民幣
RLAIF 強化學習~1.1h~1.43 人民幣
Pretrain + SFT 合計~2.31h~3.0 人民幣

📌 註:3090 租卡約 1.3 人民幣/小時;「2 小時」指 SFT 階段單卡 3090 跑 1 epoch 實測。

關鍵:從 0 訓練出 minimind-3 Zero 對話模型,總成本不到 3 塊錢——一杯手搖飲的價格。

🧠 架構設計哲學(值得學習)

MiniMind 主線選擇 dim=768, n_layers=8,背後是小模型 Scaling Law 的工程取捨:

  • 深度 vs 寬度:MobileLLM 研究發現參數量固定時,「深而窄」比「寬而淺」更會學——30~42 層的狹長結構在常識推理、QA 上表現更好
  • d_model < 512 時詞嵌入維度太窄,加層數也補不回來
  • d_model > 1536 時,加層數比加寬更划算

這套「小模型參數分配」的實驗經驗,對想自己動手訓練的人非常有參考價值。

🎯 適合誰?

對象為什麼
LLM 學習者每一行程式碼都看得懂,是理解 Transformer 的最佳教材
研究人員完整 RLHF/GRPO/Agentic RL 實作可複現
想驗證想法的開發者幾塊錢就能跑完整訓練實驗
教育/教學比付費課程更紮實的免費教材

⚠️ 要知道的限制

  • 64M 模型能力有限——它是「教學級」模型,不是 GPT-4 殺手,主要價值在理解原理
  • 需要基本 PyTorch 基礎——專案假設你已經懂深度學習
  • 訓練數據以中文為主(高質量開源數據集),英文能力相對弱

💎 總結

MiniMind 的價值不在於「做出多強的模型」,而在於把 LLM 訓練的門檻從幾千萬降到 3 塊錢——讓每個人都能親手從 0 建構一個語言模型,理解每一層、每一個 loss、每一行代碼背後的原理。

如果你一直想「真正搞懂大模型是怎麼訓練出來的」,這是最值得從頭到尾跟一遍的開源專案。


資料來源:jingyaogong/minimind GitHub Repo(README,查證 2026-08-25)|Star 數 55.1K 為 2026-08 數據

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友