Qwen 3.8 開源模型完整指南:2.4T-A95B 旗艦開源、27B 本地部署怎麼選?硬體需求、量化與評測一次看懂(2026)

Qwen 3.8 是阿里巴巴 2026 年 8 月推出的開源模型系列:旗艦 Qwen3.8-2.4T-A95B 是首個開放權重的 Qwen-Max 等級模型(2.4 兆參數、95B 激活、512 專家 MoE、262K context),另有 27B 稠密版適合個人本地部署。本文整理硬體需求、量化選項、部署指令與評測成績,教你怎麼選。

  • Dennis
  • 7 分鐘閱讀
Qwen 3.8 開源模型完整指南:2.4T-A95B 旗艦開源、27B 本地部署怎麼選?硬體需求、量化與評測一次看懂(2026)

Qwen 3.8 是阿里巴巴 2026 年 8 月推出的開源模型系列:旗艦 Qwen3.8-2.4T-A95B 是首個開放權重的 Qwen-Max 等級模型(2.4 兆參數、95B 激活、512 專家 MoE、262K context),另有 27B 稠密版適合個人本地部署。本文整理硬體需求、量化選項、部署指令與評測成績,教你怎麼選。

Qwen 3.8 是什麼?

Qwen 3.8 是阿里巴巴 Qwen 開源模型家族的最新世代,也是目前最強的中文開源模型系列。它最大的意義在於:首次把「Qwen-Max 等級」的旗艦模型開放權重——以前你只能在 API 上花錢用 Qwen-Max,現在你可以把它的核心權重抓下來自己部署。

發布時間線:

日期事件
2026-08-03阿里巴巴推出 Qwen 3.8 系列,上線雲端 API(Qwen3.8-Max)
2026-08-12開源權重正式釋出:Qwen3.8-2.4T-A95B(Hugging Face / ModelScope)
2026-08-14(預定)Qwen3.8-27B 稠密版權重釋出(適合個人單卡部署)

家族三兄弟:怎麼分?

Qwen 3.8 家族目前有三個主要版本,用途完全不同:

版本架構參數量適合誰狀態
Qwen3.8-2.4T-A95B(開源旗艦)稀疏 MoE總共 2.4 兆、激活 95B企業 / 多 GPU 叢集✅ 已開源(2026-08-12)
Qwen3.8-27B(本地甜點級)Dense 稠密約 270 億個人開發者 / 單卡部署⏳ 權重預定 8/14 釋出
Qwen3.8-Max(雲端 API)商業版不想管硬體的人✅ 已上線

三個版本的關係:開源的 2.4T-A95B 就是 Qwen3.8-Max 的核心「純文字解碼器」。Max API 版本額外多出多模態視覺輸入、可關閉思考模式、預設 1M context、內建工具鏈等商業化功能;開源版本則只有文字、強制開啟思考模式(無法關閉)、預設 262K context。

旗艦 2.4T-A95B 規格深度解析

graph TD
    A[Qwen3.8-2.4T-A95B] --> B[總參數 2.4 兆<br/>每次激活 95B]
    A --> C[92 層混合注意力骨幹<br/>23 層全注意力 + 69 層線性注意力]
    A --> D[512 個 MoE 專家<br/>10 個路由 + 1 個共享]
    A --> E[Context 262K 原生<br/>可延伸至 1M]
    A --> F[Gated DeltaNet 線性注意力<br/>取代無限增長的 KV Cache]

核心規格重點:

  • 稀疏 MoE 架構:總參數 2.4 兆,但每個 token 只激活約 950 億參數(A95B = Active 95B),推理成本遠低於同規模稠密模型。
  • 512 個專家:每個 token 由 10 個路由專家 + 1 個共享專家處理,分工極細。
  • 混合注意力骨幹:92 層中 23 層是傳統全注意力(Gated Attention),69 層是 Gated DeltaNet 線性注意力——用常駐的循環狀態取代無限增長的 KV Cache,這是它能撐起超長 context 的關鍵。
  • 超長 context:原生 262,144 token(262K),可透過 RoPE 延伸至 1,010,000 token(1M)。
  • 思考控制:支援 reasoning_effortxhigh 預設 / medium / low)調整推理深度與成本;多輪對話可用 preserve_thinking 保留歷史推理,省 token。
  • 授權條款(qwen3.8-max 授權):年營收低於 5,000 萬美元或僅供內部使用免費;超過門檻或用於特定程式碼/生產力 Agent 服務需商業洽談——不是純 Apache 2.0,商用前務必讀條款。

硬體需求:從 4.9TB 到 397GB

2.4T 參數聽起來嚇人,但不同精度/量化等級的需求差很多:

精度模型大小最低部署配置適合誰
BF16(無失真)~4.9 TB3 個 8×B300 節點(24 張 GPU)資料中心
FP8~2.3–2.5 TB2 個 8×B300 節點,或 24× H200大型企業
FP4(NVFP4 / MXFP4)~1.32–1.45 TB單個 8×B300 節點(或 8×MI355X)中型企業
1-bit 極限壓縮(Unsloth UD-IQ1_XXXS)397 GB(縮減 91%)512GB 統一記憶體 Mac Studio、或 410GB+ RAM/VRAM 工作站高階個人玩家

如果你是個人開發者,真正的重點在 Qwen3.8-27B 稠密版

精度所需顯存建議顯卡
BF16~54 GBH100 / H200
FP8~27 GBRTX 5090(32GB)、L40S
4-bit 量化(Q4_K_M)~15–17 GBRTX 3090 / RTX 4090 或任何 24GB 顯存消費級顯卡

💡 也就是說:只要你有 RTX 3090/4090 等級的 24GB 顯存,8/14 權重釋出後,就能用 4-bit 量化在本地跑 Qwen 3.8 等級的程式碼生成與推理能力——這是目前「單卡能跑的最強開源中文模型」候選。

部署教學:四種主流框架

1. vLLM(Day-0 支援,生產環境首選)

pip install vllm
vllm serve "Qwen/Qwen3.8-2.4T-A95B"

# OpenAI 相容 API
curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{"model": "Qwen/Qwen3.8-2.4T-A95B", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'

vLLM 支援官方 BF16/FP8 權重,也支援 NVFP4(NVIDIA 優化)與 MXFP4(AMD 優化)格式,內建 Paged Attention 與多 token 預測(MTP),是 MoE 並發推理的首選。

2. SGLang(Blackwell 最佳化)

pip install sglang
python3 -m sglang.launch_server \
  --model-path "Qwen/Qwen3.8-2.4T-A95B" \
  --host 0.0.0.0 --port 30000

SGLang 針對 NVIDIA Blackwell(B300)與 AMD Instinct(MI350 系列)寫了高度優化的 Attention 與 MoE 融合算子,多節點部署效率極佳。

3. llama.cpp + GGUF(Mac / CPU 混合環境)

Unsloth 提供從 1-bit(UD-IQ1_S)到 8-bit 的完整 GGUF 量化系列,可在 Apple Silicon(Metal)與一般 CPU/GPU 混合硬體上流暢推理:

# 下載 1-bit 極限壓縮版(397GB,512GB Mac Studio 可跑)
ollama run hf.co/unsloth/Qwen3.8-2.4T-A95B-GGUF:BF16

4. Ollama(27B 最期待的一站式方案)

2.4T 目前以 GGUF 引導方式部署;等 27B 權重釋出後,預期會直接進 Ollama 官方庫:

ollama run qwen3.8:27b    # 27B 釋出後,一條指令搞定

評測成績:跟 Claude、GPT 平起平坐?

根據官方模型卡(以 Qwen3.8-Max 為基準),Qwen 3.8 在 Agent 與科研任務上表現驚人:

評測項目Qwen3.8-MaxClaude Fable 5GPT-5.6 Sol (max)Claude Opus 4.8說明
OSWorld-Verified86.1 🏆85.083.2桌面自主操作,三家中最強
PaperBench93.0 🏆88.890.580.3科研論文重現
Terminal-Bench 2.186.684.688.884.6終端機 Agent
SWE-bench Pro67.780.064.669.2GitHub 真實 issue 解題
GPQA Diamond92.692.694.192.0科學推理(與 Fable 5 並列)
AndroidBench75.184.574.069.8手機操作
HLE(人類最後考試)43.653.347.245.7困難知識題

亮點解讀:OSWorld-Verified 與 PaperBench 直接打敗 Claude Fable 5 與 GPT-5.6 Sol;SWE-bench Pro 落後 Fable 5(80.0)但領先 GPT-5.6 Sol(64.6)。跟上一代旗艦 Qwen3.7-Max(約 700B–1T 規模)相比,Qwen 3.8 把規模一舉推到 2.4 兆參數,知識儲備提升約 2.4–3.4 倍。

另一個賣點是多日長時自主任務:官方宣稱能連續 16 天自主開發(265 次 commit)、自主閱讀並重現學術論文(約 125 小時運行,最終程式碼性能擊敗原論文指標)。

怎麼選?個人 vs 企業

flowchart TD
    A[你想怎麼用 Qwen 3.8?] --> B{有 24GB 顯存<br/>想本地跑?}
    B -->|是| C[等 8/14 的 Qwen3.8-27B<br/>4-bit 量化 15-17GB]
    B -->|否| D{預算與需求?}
    D -->|個人小額| E[阿里雲 Token Plan<br/>Lite 方案 $6/月]
    D -->|企業正式部署| F{隱私要求?}
    F -->|可上雲| G[Qwen3.8-Max API<br/>多模態 + 1M context]
    F -->|必須私有化| H[2.4T-A95B<br/>FP4 單節點 或 1-bit 工作站]
  • 個人開發者:等 8/14 的 Qwen3.8-27B。RTX 3090/4090(24GB)用 4-bit 量化即可流暢跑,適合程式碼補全、本地知識庫(RAG)、注重隱私的高頻日常任務。沒有高階硬體?阿里雲 Token Plan Lite 只要 $6/月
  • 中小型企業:FP4 量化後可單節點部署(8×B300 或 8×MI355X),或直接簽商業授權用 API。
  • 大型企業 / 資料中心:2.4T-A95B 的 BF16/FP8 多節點部署,適合程式碼安全審查、跨部門流程模擬、多子 Agent 並發編排等場景。

⚠️ 注意:開源版 2.4T-A95B 是「純文字 + 強制思考模式」——沒有視覺能力、不能關閉思考 trace,且預設 context 是 262K(非 API 版的 1M)。需要多模態或 1M context 請直接走 Qwen3.8-Max API。

資料來源

延伸閱讀

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。