DeepSeek V4.1-Flash 發布:763B 參數只啟用 8B/16B,KV Cache 壓到 1/8,離峰快取輸入每百萬 token 僅 0.003 美元(2026)

DeepSeek 在 2026 年 9 月 10 日發布 V4.1-Flash,用全新的 causal encoder-decoder 架構把 763B 總參數模型的啟用量壓到 prefill 8B/decode 16B,KV Cache 只有 V4 Flash 的 1/4、SSD 佔用 1/8,並首度原生支援視覺。搭載 1M 上下文、MIT 授權,離峰時段快取輸入每百萬 token 只要 0.003 美元。本文整理官方規格、定價表、第三方基準與社群實測,以及台灣開發者該怎麼用它省成本。

  • Dennis
  • 7 分鐘閱讀
DeepSeek V4.1-Flash 發布:763B 參數只啟用 8B/16B,KV Cache 壓到 1/8,離峰快取輸入每百萬 token 僅 0.003 美元(2026)

DeepSeek 於 2026 年 9 月 10 日正式發布 V4.1-Flash:這是一個 763B 總參數的開源模型,卻用全新的「因果編碼解碼器(causal encoder-decoder)」架構,把讀取輸入的啟用參數壓到 8B、生成輸出的啟用參數壓到 16B,KV Cache 只剩前一代 V4 Flash 的 1/4(SSD 佔用 1/8)。它支援 1M 上下文與原生視覺輸入、採 MIT 授權,離峰時段快取輸入每百萬 token 只要 0.003 美元——但代價是模型話變多了,平均每題輸出 8.9 萬 token。

多數人看到「v4.1」與「Flash」這兩個字,會直覺認為這只是一次小改版。但社群的反應完全相反:AI 研究者 Sebastian Raschka 直接說「這應該叫 DeepSeek V5」。原因在於,這次改的不是參數量,而是整個模型讀取與生成資訊的方式

為什麼說這不是「0.1 版小更新」

DeepSeek 過去一年的節奏很有意思:從 v2、v3 到 v4,每次大版本之間都會穿插幾篇「只專注解決一個架構問題」的論文,命中率極高。在 R1 論文引爆全球關注後,DeepSeek 反而沉潛將近一年,把開源模型的領先位置讓給 GLM、Kimi 等對手。

這次回歸,它做了一件很反常的事:同時推出全新架構、直接下架舊旗艦 V4 Pro,卻只把版本號寫成 v4.1 Flash。用 Latent Space 的說法,這是「測試你有沒有能力讀懂標題以外的東西」。

規格速覽

項目DeepSeek V4.1-Flash(2026-09-10 發布)
架構全新 causal encoder-decoder(40 層拆成 20 層編碼器+20 層解碼器)
總參數主幹 552B;加上 Engram 條件記憶體模組約 748B(第三方報導多寫 763B)
每 token 啟用參數Prefill(讀輸入)8B/Decode(寫輸出)16B,稀疏度約 1~2%
上下文輸入 1M tokens,單次最大輸出 384K tokens
視覺原生支援(預訓練階段即圖文聯合訓練,不需外掛適配器)
授權MIT(可商用、可自建託管)
KV Cache890 bytes/token,約為 V4 Flash(3,456 bytes/token)的 1/4

定價:離峰時段才是真正的武器

DeepSeek 維持一貫的「尖峰/離峰」雙軌定價,離峰時段一律半價:

計費項目(每百萬 token)尖峰離峰(半價)
輸入(快取未命中)$0.30$0.15
輸入(快取命中)$0.006$0.003
輸出$1.20$0.60

尖峰時段定義為週一至週五 UTC 01:00–04:00 與 06:00–10:00,換算成台灣時間大約是上班日的上午 9 點到中午、下午 2 點到傍晚 6 點。也就是說,把批次任務排到台灣的深夜執行,成本直接砍半;再搭配 prompt caching 命中率,長文件問答類應用的帳單會低到很不真實。

架構拆解:為什麼 8B 就能讀懂 1M token

傳統 Transformer 的每一層解碼器都要自己保存一份 KV 狀態,上下文越長、記憶體越爆。V4.1-Flash 的作法是:解碼器的全域 KV Cache 直接由編碼器最後一層的隱藏狀態線性投影產生,並在所有解碼層之間共享,而不是每層各自重建。這帶來兩個直接結果:

  1. 讀取輸入階段只需要啟用 8B 參數,生成階段才拉高到 16B。
  2. 全域 KV Cache 縮到每 token 890 bytes,GPU 顯存佔用約只有前代 V4 Flash 的 1/4;若把冷資料丟到 SSD,佔用更只剩約 1/8。
flowchart LR
    A["輸入<br/>最長 1M tokens<br/>啟用 8B"] --> B["因果編碼器<br/>20 層"]
    B --> C["共享 KV Cache<br/>890 bytes/token"]
    C --> D["解碼器<br/>20 層<br/>啟用 16B"]
    D --> E["輸出<br/>最長 384K tokens"]
    D -.->|"滑動視窗僅重放最近 n_win 個 token"| C

另一個關鍵是 Sliding-Window Attention Bounded Replay:滑動視窗層不再持久保存舊 token 的 KV 狀態,而是在生成新 token 時,只針對最近幾千個 token 重新跑一次前向傳播即時重建,用完即丟。用「少量重算」換「大量記憶體」,把滑動視窗層的持久快取佔用壓到傳統做法的 1/8。

效能:官方自測數字與對手的差距

基準測試V4.1-Flash對照模型備註
AutomationBench54.8GPT-5.6 Sol 45.8/Claude Opus 5 50.3終端自動化任務勝出
DeepSWE v1.174.2GPT-5.6 Sol 73.0/Opus 5 74.0短跨度代理編碼微幅領先
Terminal-Bench 2.190.6GPT-5.6 Sol 88.8
GPQA Diamond90.9GPT-5.6 Sol 94.1高難度科學問答落後
Terminal-Bench 4.031.2Opus 5 51.8/GLM-5.3 41.8長跨度自主任務明顯落後
NL2Repo64.0Opus 5 75.3大型程式庫任務落後
SimpleQA-Verified42.3自家 V4 Pro 55.2純知識記憶退步

第三方評測機構的觀察則集中在「性價比」:Artificial Analysis 指出它每題 Intelligence Index 任務的推論成本約 0.27 美元,是 GLM-5.3(2.01 美元)與 Kimi K3(2.00 美元)的約 1/7,也約為自家 V4 Pro(0.67 美元)的 2.5 分之 1;Vals 則把它列為開源權重模型排行榜第一,單次測試成本 0.30 美元,是開源前十名中最便宜的。

⚠️ 一個必須說清楚的資料衝突:各來源對「Artificial Analysis Intelligence Index 分數」的數字並不一致(有報導寫 40 分、也有來源指出發布首週官方獨立評測尚未完成,前代 V4 Pro 0813 為 53 分、Claude Opus 5 為 63 分)。本文因此以官方 Model Card 自測數字為主,第三方分數僅作方向性參考,不當成定論。

代價:它很便宜,但話也很多

便宜不等於省錢,這點 V4.1-Flash 特別明顯:

  • 極度囉唆:Artificial Analysis 指出它平均每題輸出約 8.9 萬 token,比 GLM-5.3 多 25%、比自家 V4 Pro 多 62%。若沒有搭配快取與輸出上限,帳單會被「思考過程」吃掉。
  • 高推理強度成本暴增:reasoning effort 可調 1–100,開到最高時輸出 token 量約增加 2.5 倍。
  • 長跨度任務是弱項:Terminal-Bench 4.0、ProgramBench、NL2Repo 這類需要長時間自主規劃的任務,明顯落後 Claude Opus 5 與 GLM-5.3。
  • 視覺上限 672×672(採 3×3 降採樣),高密度 OCR 與複雜圖表分析仍不及頂級閉源模型。
  • 對 Agent 框架高度敏感:同一個模型在 mini-SWE 拿 74.2、換到 OpenCode 只有 65.5,差距 8.7 分——換 harness 可能比換模型影響更大。

社群實測:前沿模型居然可以「大部分跑在 SSD 上」

這次發布最有畫面感的一幕,是推論工程師們發現它意外地好跑。開發者 Fraser Price 回報,用 4 張 Max-Q 顯卡、僅 64GB 系統記憶體,把 200GB 的 Engram 查找表丟到 NVMe,就跑到 200 TPS;後來用 4 張 RTX Pro 更拉到 300+ TPS,峰值系統記憶體還低於 32GB。Redis 作者 antirez 則在 128GB 的 M5 Max 上以 SSD streaming 跑它,直言「快得超乎預期」,社群的反應是:「前沿模型居然可以主要靠 SSD 跑起來。」

V4 Pro 退役了嗎?官方政策在發布後轉彎

發布當天,官方宣布自 2026 年 9 月 14 日 04:00 UTC 起退役 deepseek-v4-pro,所有請求自動重定向到 V4.1-Flash 並改按 Flash 價格計費。但隨後 API 文件更新了註記:應使用者要求,9 月 14 日之後將繼續提供 V4 Pro 的 API 服務、計費方式不變。實務上,V4.1-Flash 已經取代 V4 Pro 的主力地位,但想留在舊模型上的既有系統不會被硬切。

對台灣開發者的實務建議

  1. 適合它:長上下文批次處理(合約、規格書、log 分析)、大量自動化腳本、對成本極度敏感的 agent 工作流,以及需要便宜視覺理解的場景。
  2. 不適合它:需要長時間自主規劃的大型 refactor、對事實準確度要求極高的知識問答(SimpleQA 退步是明確警訊)。
  3. 省錢三招:把批次任務排在台灣深夜(離峰半價)、善用 prompt caching 把重複的系統提示命中快取($0.003/1M)、並在應用層硬性限制 max output tokens,避免被 8.9 萬 token 的平均輸出拖垮。
  4. 自架評估:若已有 64GB 以上記憶體與 NVMe,配合 vLLM 的 SSD offload,這一代的「前沿模型自架」門檻比過去低了不少。

延伸閱讀

原始來源

註:本文數字以官方 Model Card 與技術報告為主,第三方評測(Artificial Analysis、Vals)數字僅作方向性參考;不同來源在 Intelligence Index 分數上仍有落差,已於文中標示。

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友