Qwen 3.8 是阿里巴巴 2026 年 8 月推出的開源模型系列:旗艦 Qwen3.8-2.4T-A95B 是首個開放權重的 Qwen-Max 等級模型(2.4 兆參數、95B 激活、512 專家 MoE、262K context),另有 27B 稠密版適合個人本地部署。本文整理硬體需求、量化選項、部署指令與評測成績,教你怎麼選。
Qwen 3.8 是什麼?
Qwen 3.8 是阿里巴巴 Qwen 開源模型家族的最新世代,也是目前最強的中文開源模型系列。它最大的意義在於:首次把「Qwen-Max 等級」的旗艦模型開放權重——以前你只能在 API 上花錢用 Qwen-Max,現在你可以把它的核心權重抓下來自己部署。
發布時間線:
| 日期 | 事件 |
|---|---|
| 2026-08-03 | 阿里巴巴推出 Qwen 3.8 系列,上線雲端 API(Qwen3.8-Max) |
| 2026-08-12 | 開源權重正式釋出:Qwen3.8-2.4T-A95B(Hugging Face / ModelScope) |
| 2026-08-14(預定) | Qwen3.8-27B 稠密版權重釋出(適合個人單卡部署) |
家族三兄弟:怎麼分?
Qwen 3.8 家族目前有三個主要版本,用途完全不同:
| 版本 | 架構 | 參數量 | 適合誰 | 狀態 |
|---|---|---|---|---|
| Qwen3.8-2.4T-A95B(開源旗艦) | 稀疏 MoE | 總共 2.4 兆、激活 95B | 企業 / 多 GPU 叢集 | ✅ 已開源(2026-08-12) |
| Qwen3.8-27B(本地甜點級) | Dense 稠密 | 約 270 億 | 個人開發者 / 單卡部署 | ⏳ 權重預定 8/14 釋出 |
| Qwen3.8-Max(雲端 API) | 商業版 | — | 不想管硬體的人 | ✅ 已上線 |
三個版本的關係:開源的 2.4T-A95B 就是 Qwen3.8-Max 的核心「純文字解碼器」。Max API 版本額外多出多模態視覺輸入、可關閉思考模式、預設 1M context、內建工具鏈等商業化功能;開源版本則只有文字、強制開啟思考模式(無法關閉)、預設 262K context。
旗艦 2.4T-A95B 規格深度解析
graph TD
A[Qwen3.8-2.4T-A95B] --> B[總參數 2.4 兆<br/>每次激活 95B]
A --> C[92 層混合注意力骨幹<br/>23 層全注意力 + 69 層線性注意力]
A --> D[512 個 MoE 專家<br/>10 個路由 + 1 個共享]
A --> E[Context 262K 原生<br/>可延伸至 1M]
A --> F[Gated DeltaNet 線性注意力<br/>取代無限增長的 KV Cache]核心規格重點:
- 稀疏 MoE 架構:總參數 2.4 兆,但每個 token 只激活約 950 億參數(A95B = Active 95B),推理成本遠低於同規模稠密模型。
- 512 個專家:每個 token 由 10 個路由專家 + 1 個共享專家處理,分工極細。
- 混合注意力骨幹:92 層中 23 層是傳統全注意力(Gated Attention),69 層是 Gated DeltaNet 線性注意力——用常駐的循環狀態取代無限增長的 KV Cache,這是它能撐起超長 context 的關鍵。
- 超長 context:原生 262,144 token(262K),可透過 RoPE 延伸至 1,010,000 token(1M)。
- 思考控制:支援
reasoning_effort(xhigh預設 /medium/low)調整推理深度與成本;多輪對話可用preserve_thinking保留歷史推理,省 token。 - 授權條款(qwen3.8-max 授權):年營收低於 5,000 萬美元或僅供內部使用免費;超過門檻或用於特定程式碼/生產力 Agent 服務需商業洽談——不是純 Apache 2.0,商用前務必讀條款。
硬體需求:從 4.9TB 到 397GB
2.4T 參數聽起來嚇人,但不同精度/量化等級的需求差很多:
| 精度 | 模型大小 | 最低部署配置 | 適合誰 |
|---|---|---|---|
| BF16(無失真) | ~4.9 TB | 3 個 8×B300 節點(24 張 GPU) | 資料中心 |
| FP8 | ~2.3–2.5 TB | 2 個 8×B300 節點,或 24× H200 | 大型企業 |
| FP4(NVFP4 / MXFP4) | ~1.32–1.45 TB | 單個 8×B300 節點(或 8×MI355X) | 中型企業 |
| 1-bit 極限壓縮(Unsloth UD-IQ1_XXXS) | 397 GB(縮減 91%) | 512GB 統一記憶體 Mac Studio、或 410GB+ RAM/VRAM 工作站 | 高階個人玩家 |
如果你是個人開發者,真正的重點在 Qwen3.8-27B 稠密版:
| 精度 | 所需顯存 | 建議顯卡 |
|---|---|---|
| BF16 | ~54 GB | H100 / H200 |
| FP8 | ~27 GB | RTX 5090(32GB)、L40S |
| 4-bit 量化(Q4_K_M) | ~15–17 GB | RTX 3090 / RTX 4090 或任何 24GB 顯存消費級顯卡 |
💡 也就是說:只要你有 RTX 3090/4090 等級的 24GB 顯存,8/14 權重釋出後,就能用 4-bit 量化在本地跑 Qwen 3.8 等級的程式碼生成與推理能力——這是目前「單卡能跑的最強開源中文模型」候選。
部署教學:四種主流框架
1. vLLM(Day-0 支援,生產環境首選)
pip install vllm
vllm serve "Qwen/Qwen3.8-2.4T-A95B"
# OpenAI 相容 API
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{"model": "Qwen/Qwen3.8-2.4T-A95B", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'
vLLM 支援官方 BF16/FP8 權重,也支援 NVFP4(NVIDIA 優化)與 MXFP4(AMD 優化)格式,內建 Paged Attention 與多 token 預測(MTP),是 MoE 並發推理的首選。
2. SGLang(Blackwell 最佳化)
pip install sglang
python3 -m sglang.launch_server \
--model-path "Qwen/Qwen3.8-2.4T-A95B" \
--host 0.0.0.0 --port 30000
SGLang 針對 NVIDIA Blackwell(B300)與 AMD Instinct(MI350 系列)寫了高度優化的 Attention 與 MoE 融合算子,多節點部署效率極佳。
3. llama.cpp + GGUF(Mac / CPU 混合環境)
Unsloth 提供從 1-bit(UD-IQ1_S)到 8-bit 的完整 GGUF 量化系列,可在 Apple Silicon(Metal)與一般 CPU/GPU 混合硬體上流暢推理:
# 下載 1-bit 極限壓縮版(397GB,512GB Mac Studio 可跑)
ollama run hf.co/unsloth/Qwen3.8-2.4T-A95B-GGUF:BF16
4. Ollama(27B 最期待的一站式方案)
2.4T 目前以 GGUF 引導方式部署;等 27B 權重釋出後,預期會直接進 Ollama 官方庫:
ollama run qwen3.8:27b # 27B 釋出後,一條指令搞定
評測成績:跟 Claude、GPT 平起平坐?
根據官方模型卡(以 Qwen3.8-Max 為基準),Qwen 3.8 在 Agent 與科研任務上表現驚人:
| 評測項目 | Qwen3.8-Max | Claude Fable 5 | GPT-5.6 Sol (max) | Claude Opus 4.8 | 說明 |
|---|---|---|---|---|---|
| OSWorld-Verified | 86.1 🏆 | 85.0 | 83.2 | — | 桌面自主操作,三家中最強 |
| PaperBench | 93.0 🏆 | 88.8 | 90.5 | 80.3 | 科研論文重現 |
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 84.6 | 終端機 Agent |
| SWE-bench Pro | 67.7 | 80.0 | 64.6 | 69.2 | GitHub 真實 issue 解題 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.0 | 科學推理(與 Fable 5 並列) |
| AndroidBench | 75.1 | 84.5 | 74.0 | 69.8 | 手機操作 |
| HLE(人類最後考試) | 43.6 | 53.3 | 47.2 | 45.7 | 困難知識題 |
亮點解讀:OSWorld-Verified 與 PaperBench 直接打敗 Claude Fable 5 與 GPT-5.6 Sol;SWE-bench Pro 落後 Fable 5(80.0)但領先 GPT-5.6 Sol(64.6)。跟上一代旗艦 Qwen3.7-Max(約 700B–1T 規模)相比,Qwen 3.8 把規模一舉推到 2.4 兆參數,知識儲備提升約 2.4–3.4 倍。
另一個賣點是多日長時自主任務:官方宣稱能連續 16 天自主開發(265 次 commit)、自主閱讀並重現學術論文(約 125 小時運行,最終程式碼性能擊敗原論文指標)。
怎麼選?個人 vs 企業
flowchart TD
A[你想怎麼用 Qwen 3.8?] --> B{有 24GB 顯存<br/>想本地跑?}
B -->|是| C[等 8/14 的 Qwen3.8-27B<br/>4-bit 量化 15-17GB]
B -->|否| D{預算與需求?}
D -->|個人小額| E[阿里雲 Token Plan<br/>Lite 方案 $6/月]
D -->|企業正式部署| F{隱私要求?}
F -->|可上雲| G[Qwen3.8-Max API<br/>多模態 + 1M context]
F -->|必須私有化| H[2.4T-A95B<br/>FP4 單節點 或 1-bit 工作站]- 個人開發者:等 8/14 的 Qwen3.8-27B。RTX 3090/4090(24GB)用 4-bit 量化即可流暢跑,適合程式碼補全、本地知識庫(RAG)、注重隱私的高頻日常任務。沒有高階硬體?阿里雲 Token Plan Lite 只要 $6/月。
- 中小型企業:FP4 量化後可單節點部署(8×B300 或 8×MI355X),或直接簽商業授權用 API。
- 大型企業 / 資料中心:2.4T-A95B 的 BF16/FP8 多節點部署,適合程式碼安全審查、跨部門流程模擬、多子 Agent 並發編排等場景。
⚠️ 注意:開源版 2.4T-A95B 是「純文字 + 強制思考模式」——沒有視覺能力、不能關閉思考 trace,且預設 context 是 262K(非 API 版的 1M)。需要多模態或 1M context 請直接走 Qwen3.8-Max API。
資料來源
- Qwen/Qwen3.8-2.4T-A95B 官方模型卡(Hugging Face)
- NVIDIA Developer Blog:Serve Qwen3.8-2.4T-A95B on GB300 NVL72
- vLLM Recipes:Qwen/Qwen3.8-2.4T-A95B
- daily.dev:Qwen3.8-2.4T-A95B lands with day-0 vLLM support
- Latent Space AINews:Qwen 3.8 Max(2.4T) and 27B
延伸閱讀
- Ollama:以類 Docker 簡潔風格在本機執行開源 LLM — 本地跑模型最簡單的入門工具
- ik_llama.cpp:具有 IQ4_NL 和進階量化的 llama.cpp 分支 — GGUF 量化的進階玩法
- Meta Muse Glimmer 開源了!30B 本地 AI Agent 模型,Apache 2.0 授權、24GB 顯示卡就能跑 — 另一款 24GB 顯存可跑的開源模型,可對照比較
- Mira Murati 新創 Thinking Machines 發表 Inkling:9750 億參數開源模型 — 同樣主打「超大參數開源」的另一個選擇
- 2026 精選 350+ AI 開源專案完整地圖:Agent、LLM、RAG 工具實戰推薦 — 更多值得收藏的開源 AI 專案
