DeepSeek 於 2026 年 9 月 10 日正式發布 V4.1-Flash:這是一個 763B 總參數的開源模型,卻用全新的「因果編碼解碼器(causal encoder-decoder)」架構,把讀取輸入的啟用參數壓到 8B、生成輸出的啟用參數壓到 16B,KV Cache 只剩前一代 V4 Flash 的 1/4(SSD 佔用 1/8)。它支援 1M 上下文與原生視覺輸入、採 MIT 授權,離峰時段快取輸入每百萬 token 只要 0.003 美元——但代價是模型話變多了,平均每題輸出 8.9 萬 token。
多數人看到「v4.1」與「Flash」這兩個字,會直覺認為這只是一次小改版。但社群的反應完全相反:AI 研究者 Sebastian Raschka 直接說「這應該叫 DeepSeek V5」。原因在於,這次改的不是參數量,而是整個模型讀取與生成資訊的方式。
為什麼說這不是「0.1 版小更新」
DeepSeek 過去一年的節奏很有意思:從 v2、v3 到 v4,每次大版本之間都會穿插幾篇「只專注解決一個架構問題」的論文,命中率極高。在 R1 論文引爆全球關注後,DeepSeek 反而沉潛將近一年,把開源模型的領先位置讓給 GLM、Kimi 等對手。
這次回歸,它做了一件很反常的事:同時推出全新架構、直接下架舊旗艦 V4 Pro,卻只把版本號寫成 v4.1 Flash。用 Latent Space 的說法,這是「測試你有沒有能力讀懂標題以外的東西」。
規格速覽
| 項目 | DeepSeek V4.1-Flash(2026-09-10 發布) |
|---|---|
| 架構 | 全新 causal encoder-decoder(40 層拆成 20 層編碼器+20 層解碼器) |
| 總參數 | 主幹 552B;加上 Engram 條件記憶體模組約 748B(第三方報導多寫 763B) |
| 每 token 啟用參數 | Prefill(讀輸入)8B/Decode(寫輸出)16B,稀疏度約 1~2% |
| 上下文 | 輸入 1M tokens,單次最大輸出 384K tokens |
| 視覺 | 原生支援(預訓練階段即圖文聯合訓練,不需外掛適配器) |
| 授權 | MIT(可商用、可自建託管) |
| KV Cache | 890 bytes/token,約為 V4 Flash(3,456 bytes/token)的 1/4 |
定價:離峰時段才是真正的武器
DeepSeek 維持一貫的「尖峰/離峰」雙軌定價,離峰時段一律半價:
| 計費項目(每百萬 token) | 尖峰 | 離峰(半價) |
|---|---|---|
| 輸入(快取未命中) | $0.30 | $0.15 |
| 輸入(快取命中) | $0.006 | $0.003 |
| 輸出 | $1.20 | $0.60 |
尖峰時段定義為週一至週五 UTC 01:00–04:00 與 06:00–10:00,換算成台灣時間大約是上班日的上午 9 點到中午、下午 2 點到傍晚 6 點。也就是說,把批次任務排到台灣的深夜執行,成本直接砍半;再搭配 prompt caching 命中率,長文件問答類應用的帳單會低到很不真實。
架構拆解:為什麼 8B 就能讀懂 1M token
傳統 Transformer 的每一層解碼器都要自己保存一份 KV 狀態,上下文越長、記憶體越爆。V4.1-Flash 的作法是:解碼器的全域 KV Cache 直接由編碼器最後一層的隱藏狀態線性投影產生,並在所有解碼層之間共享,而不是每層各自重建。這帶來兩個直接結果:
- 讀取輸入階段只需要啟用 8B 參數,生成階段才拉高到 16B。
- 全域 KV Cache 縮到每 token 890 bytes,GPU 顯存佔用約只有前代 V4 Flash 的 1/4;若把冷資料丟到 SSD,佔用更只剩約 1/8。
flowchart LR
A["輸入<br/>最長 1M tokens<br/>啟用 8B"] --> B["因果編碼器<br/>20 層"]
B --> C["共享 KV Cache<br/>890 bytes/token"]
C --> D["解碼器<br/>20 層<br/>啟用 16B"]
D --> E["輸出<br/>最長 384K tokens"]
D -.->|"滑動視窗僅重放最近 n_win 個 token"| C另一個關鍵是 Sliding-Window Attention Bounded Replay:滑動視窗層不再持久保存舊 token 的 KV 狀態,而是在生成新 token 時,只針對最近幾千個 token 重新跑一次前向傳播即時重建,用完即丟。用「少量重算」換「大量記憶體」,把滑動視窗層的持久快取佔用壓到傳統做法的 1/8。
效能:官方自測數字與對手的差距
| 基準測試 | V4.1-Flash | 對照模型 | 備註 |
|---|---|---|---|
| AutomationBench | 54.8 | GPT-5.6 Sol 45.8/Claude Opus 5 50.3 | 終端自動化任務勝出 |
| DeepSWE v1.1 | 74.2 | GPT-5.6 Sol 73.0/Opus 5 74.0 | 短跨度代理編碼微幅領先 |
| Terminal-Bench 2.1 | 90.6 | GPT-5.6 Sol 88.8 | 勝 |
| GPQA Diamond | 90.9 | GPT-5.6 Sol 94.1 | 高難度科學問答落後 |
| Terminal-Bench 4.0 | 31.2 | Opus 5 51.8/GLM-5.3 41.8 | 長跨度自主任務明顯落後 |
| NL2Repo | 64.0 | Opus 5 75.3 | 大型程式庫任務落後 |
| SimpleQA-Verified | 42.3 | 自家 V4 Pro 55.2 | 純知識記憶退步 |
第三方評測機構的觀察則集中在「性價比」:Artificial Analysis 指出它每題 Intelligence Index 任務的推論成本約 0.27 美元,是 GLM-5.3(2.01 美元)與 Kimi K3(2.00 美元)的約 1/7,也約為自家 V4 Pro(0.67 美元)的 2.5 分之 1;Vals 則把它列為開源權重模型排行榜第一,單次測試成本 0.30 美元,是開源前十名中最便宜的。
⚠️ 一個必須說清楚的資料衝突:各來源對「Artificial Analysis Intelligence Index 分數」的數字並不一致(有報導寫 40 分、也有來源指出發布首週官方獨立評測尚未完成,前代 V4 Pro 0813 為 53 分、Claude Opus 5 為 63 分)。本文因此以官方 Model Card 自測數字為主,第三方分數僅作方向性參考,不當成定論。
代價:它很便宜,但話也很多
便宜不等於省錢,這點 V4.1-Flash 特別明顯:
- 極度囉唆:Artificial Analysis 指出它平均每題輸出約 8.9 萬 token,比 GLM-5.3 多 25%、比自家 V4 Pro 多 62%。若沒有搭配快取與輸出上限,帳單會被「思考過程」吃掉。
- 高推理強度成本暴增:reasoning effort 可調 1–100,開到最高時輸出 token 量約增加 2.5 倍。
- 長跨度任務是弱項:Terminal-Bench 4.0、ProgramBench、NL2Repo 這類需要長時間自主規劃的任務,明顯落後 Claude Opus 5 與 GLM-5.3。
- 視覺上限 672×672(採 3×3 降採樣),高密度 OCR 與複雜圖表分析仍不及頂級閉源模型。
- 對 Agent 框架高度敏感:同一個模型在 mini-SWE 拿 74.2、換到 OpenCode 只有 65.5,差距 8.7 分——換 harness 可能比換模型影響更大。
社群實測:前沿模型居然可以「大部分跑在 SSD 上」
這次發布最有畫面感的一幕,是推論工程師們發現它意外地好跑。開發者 Fraser Price 回報,用 4 張 Max-Q 顯卡、僅 64GB 系統記憶體,把 200GB 的 Engram 查找表丟到 NVMe,就跑到 200 TPS;後來用 4 張 RTX Pro 更拉到 300+ TPS,峰值系統記憶體還低於 32GB。Redis 作者 antirez 則在 128GB 的 M5 Max 上以 SSD streaming 跑它,直言「快得超乎預期」,社群的反應是:「前沿模型居然可以主要靠 SSD 跑起來。」
V4 Pro 退役了嗎?官方政策在發布後轉彎
發布當天,官方宣布自 2026 年 9 月 14 日 04:00 UTC 起退役 deepseek-v4-pro,所有請求自動重定向到 V4.1-Flash 並改按 Flash 價格計費。但隨後 API 文件更新了註記:應使用者要求,9 月 14 日之後將繼續提供 V4 Pro 的 API 服務、計費方式不變。實務上,V4.1-Flash 已經取代 V4 Pro 的主力地位,但想留在舊模型上的既有系統不會被硬切。
對台灣開發者的實務建議
- 適合它:長上下文批次處理(合約、規格書、log 分析)、大量自動化腳本、對成本極度敏感的 agent 工作流,以及需要便宜視覺理解的場景。
- 不適合它:需要長時間自主規劃的大型 refactor、對事實準確度要求極高的知識問答(SimpleQA 退步是明確警訊)。
- 省錢三招:把批次任務排在台灣深夜(離峰半價)、善用 prompt caching 把重複的系統提示命中快取($0.003/1M)、並在應用層硬性限制 max output tokens,避免被 8.9 萬 token 的平均輸出拖垮。
- 自架評估:若已有 64GB 以上記憶體與 NVMe,配合 vLLM 的 SSD offload,這一代的「前沿模型自架」門檻比過去低了不少。
延伸閱讀
- DeepSeek Vision API 完整教學:deepseek-v4-flash-vision-exp 讓你的 Agent 看懂圖片
- GPT-5.6 大降價 vs DeepSeek V4:OpenAI 降到 0.2 美元還是比 DeepSeek 貴 4 倍
- DeepSeek Harness 開源登場:「一切皆插件」的 Agent 框架,Model + Harness = Agent
- LLM 模型路由完整教學 2026:OpenRouter、LiteLLM、RouteLLM 比較與實作
- GGUF 量化完整教學 2026:把大模型塞進本地顯卡的關鍵技術
原始來源
- DeepSeek 官方公告:https://www.deepseek.com/news/deepseek-v4-1-flash/
- DeepSeek-V4.1-Flash 技術報告與 model card(Hugging Face):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- Latent Space AINews(2026-09-12):https://www.latent.space/p/ainews-deepseek-v41-flash-763b-p8b
- VentureBeat 定價與基準報導:https://venturebeat.com/technology/deepseek-v4-1-flash-debuts-with-0-003-1m-off-peak-cached-input-rate-and-benchmarks-eclipsing-gpt-5-6-sol-claude-opus-5
註:本文數字以官方 Model Card 與技術報告為主,第三方評測(Artificial Analysis、Vals)數字僅作方向性參考;不同來源在 Intelligence Index 分數上仍有落差,已於文中標示。
