AEO 速答:DeepSeek Harness(
dsh)是 DeepSeek 官方 2026 年 8 月 13 日發布在 npm 的開源 Agent 框架(GitHub 26.2k stars、MIT 授權),核心公式 Model + Harness = Agent——模型負責推理,Harness 負責工具調用、任務規劃、記憶、安全與執行調度。它採用**「一切皆插件(Everything is a Plugin)」架構:模型適配器、工具註冊表、會話日誌甚至 Agent 迴圈本身都是可動態載入/卸載的插件,由 Cordis 框架驅動(時間組合性=可逆效應完整回滾、空間組合性=反應性共效應管理依賴)。與自家 V4 Flash 搭配,官方評測 Terminal Bench 2.1 達 82.7 分、DeepSWE 達 54.4 分;Composio 實測證明「只換 harness 就讓 V4 Flash 成功率從 14→20/30」。團隊由量化背景的崔天翼**(6 次 ACM-ICPC 金牌、《背包問題九講》作者、Jane Street 9 年)領軍。目前是 developer preview——會話格式版本 0,無向下相容承諾。
為什麼 DeepSeek Harness 值得關注?
這是 DeepSeek 從「模型公司」轉型「全鏈路 AI 解決方案公司」的關鍵一步——2026 年 8 月 11 日「DeepSeek Harness 團隊」微信公眾號完成註冊,8 月 13 日(今天)npm 公開測試版正式上線(@deepseek-ai/dsh)。當參數軍備競賽結束,賣 Token 的商業模式開始內卷,DeepSeek 選擇了「從賣算力轉為交付結果」。
一、核心架構:Everything is a Plugin
🧩 一切皆插件
在 dsh 中,包括模型適配器、工具註冊表、會話日誌、Agent 迴圈本身都是插件——每一個都可從設定檔動態替換:
cordis.yml(設定檔)
├── 模型適配器插件(DeepSeek/OpenAI/本地…)
├── 工具註冊表插件
├── 會話日誌插件
├── Agent 迴圈插件
└── ...任何你想擴充的
這不是傳統的「核心 + 外掛」——沒有不可替換的核心,全部可組合。
⏱️ 時空組合性(Spatiotemporal Composability)
底層是 Cordis 框架(886 stars,TypeScript),其設計來自論文《A Programming Paradigm for Spatiotemporal Composability》:
| 維度 | 機制 | 效果 |
|---|---|---|
| 時間組合性 | 可逆效應(revertible effects)——每個 context 轉換都帶有 runtime 追蹤的逆操作 | 插件卸載時完整無副作用回滾所有狀態 |
| 空間組合性 | 反應性共效應(reactive coeffects)——context 變更時依規格通知組件 | 插件間依賴可宣告式管理 |
白話:裝/卸插件像 Docker 一樣乾淨——卸載不留殘留狀態,依賴衝突在載入時就解決。
二、與 DeepSeek V4 Flash 的完美搭配
V4 Flash(284B 總參數 / 13B 激活、1M 上下文、MIT)在 dsh 極簡模式評測中:
| 基準 | 成績 | 對比 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 分 | April 預覽版僅 61.8 |
| DeepSWE | 54.4 分 | April 預覽版僅 7.3 |
| 多個 agent 基準 | 超越 V4-Pro Preview | 激活參數少得多 |
⚠️ 注意:官方評測用的是 dsh 極簡模式(max reasoning、temp=1.0)——分數是「模型+harness」的組合結果,換 runtime 不一定複製得出來。
三、Composio 實測:換 Harness 就讓成功率 14→20
Composio 把 V4 Flash 裝進 8 套 harness,用同一批 30 個跨 SaaS 任務實測(Gmail/GitHub/Slack/Calendar/Notion):
| Harness | 成功率 | 中位時間 | 單次成功成本 |
|---|---|---|---|
| Pi Agent | 20/30 | 132.2s | $0.028 |
| Oh My Pi | 17/30 | 272.4s | $0.103 |
| Claude Code | 16/30 | 122.7s(最快) | $0.195(最貴) |
| Codex | 16/30 | 245.0s | $0.081 |
| DeepAgents | 16/30 | 187.1s | $0.045 |
| Hermes Agent | 15/30 | 175.5s | $0.056+ |
| Prime Agent | 15/24 | 242.1s | $0.131 |
| OpenCode | 14/30 | 129.7s | $0.073 |
關鍵洞察:
- 只換 harness,V4 Flash 成功率從 14 提升到 20/30——模型一樣,框架決定成敗
- Claude Code 最快(122.7s)但最貴($0.195,是 Pi 的 7 倍)——快取命中率僅 1.5% 導致大量重複預填 token
- ⚠️ 注意:Pi 測試配置不同(high 而非 max 推理強度、24/30 用官方 API)——差異不能全歸因 harness
四、9 子代理分工:打敗 Claude Code 的關鍵?
社群實測顯示 dsh 採用 9 個專業子代理分工,取代「一個巨型模型包辦一切」:
| 子代理 | 職責 |
|---|---|
| File Picker | 掃描程式庫、只挑相關檔案(防 context 稀釋) |
| Code Reviewer | 每次變更後審查 diff、標記風險 |
| Browser-use | 啟動真實 Chromium 做 QA(點擊/滾動/截圖/讀回) |
| Planner | 規劃任務範圍 |
| Editor | 外科手術式精準修改(只改需要的行,不重寫全檔) |
為什麼有效:特化減少 context 稀釋——九個窄子代理在多檔任務上,比一個巨型模型全部包辦犯更少錯。Editor 只動 3 行就不會像 Cursor 那樣重寫整個檔案(重寫 = 格式漂移 + 隱藏 bug 的來源)。
五、安裝與快速上手
# 需要 Node.js
npx @deepseek-ai/dsh web
# 或從原始碼
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness && pnpm install && pnpm run build
pnpm dsh web
啟動後 Web UI 在 http://127.0.0.1:3080。開發者預覽階段:會有破壞性變更!
六、插件生態:712 個專案註冊
8 月 1 日崔天翼在 X 發文徵求 beta 測試者,意外引爆開源社群——截至 8 月 4 日 712 個專案註冊:
| 賽道 | 專案數 | 代表性專案 |
|---|---|---|
| Agent 框架 | 135 | deer-flow(79k stars) |
| Coding Agent | 107 | CodeWhale(40k stars) |
| 記憶/上下文 | 56 | 共 194k stars |
三大賽道直擊 Agent 上生產的三大瓶頸:長任務、記憶、安全。插件加上 dsh-plugin topic 即可被發現。
七、團隊:量化交易員領軍
崔天翼(Tianyi Cui)——傳奇競賽程式設計師:
- 浙大計算機系、6 次 ACM-ICPC 亞洲區金牌
- 撰寫影響一代中國程式競賽圈的《背包問題九講》
- Jane Street 香港/紐約近 9 年(高頻交易系統)
- 2022 共同創辦量化公司 TSY Capital,2026 年 3 月加入 DeepSeek
為什麼是量化背景? 高頻交易系統的核心不是策略創新,而是「極複雜環境下的穩定執行、異常回退、全流程日誌追蹤、精準風險控制」——這與 Agent harness 需要的高可靠、低延遲、長路徑決策幾乎一一對應。
八、風險與注意事項
- Developer Preview:
SESSION_FORMAT_VERSION = 0、Schema 隨時破壞性變更——「foundation over blast radius」,官方明確說會打破相容性 - 隱私/安全:coding agent 有檔案讀取權限,可能把
.env、金鑰等敏感檔內容送進 API——必須在 harness 層部署權限閘口與沙箱 - 官方評測不可直接複製:評測用 dsh 極簡模式,換 runtime 分數會變
FAQ
Q:DeepSeek Harness 是什麼?
A:DeepSeek 官方的開源 Agent 框架(26.2k stars、MIT),核心公式 Model + Harness = Agent——模型負責推理,Harness 負責工具調用、規劃、記憶、安全與執行。2026 年 8 月 13 日 npm 公開測試版。
Q:「一切皆插件」是什麼意思?
A:模型適配器、工具註冊表、會話日誌、Agent 迴圈本身都是可動態載入/卸載的插件,由 Cordis 框架驅動——時間組合性(卸載完整回滾)+空間組合性(依賴宣告式管理)。
Q:DeepSeek Harness 跟 Claude Code 比誰強?
A:看場景。Composio 實測(V4 Flash 配 8 套 harness):Claude Code 最快(122.7s)但最貴($0.195/成功任務);Pi Agent 成功率最高(20/30)成本最低($0.028)。dsh 的 9 子代理分工設計在 multi-file 任務上被認為優於單一巨型模型。
Q:怎麼安裝?
A:npx @deepseek-ai/dsh web(需 Node.js),Web UI 在 127.0.0.1:3080。注意是 developer preview,會有破壞性變更。
Q:DeepSeek Harness 是免費的嗎?
A:是,MIT 授權完全開源。但要注意安全——agent 有檔案權限,需自行部署沙箱防止 .env 等敏感資料外洩。
參考來源:DeepSeek Harness GitHub(deepseek-ai)、DeepSeek Harness Architecture、Cordis GitHub(cordiverse)、Spatiotemporal Composability 論文、Composio:Finding the Best Harness for DeepSeek V4 Flash、BlockBeats 實測報導、36氪:Harness 登場、BigGo Finance:712 專案註冊分析 等 30 來源(NotebookLM Deep Research,2026-08-13)。
延伸閱讀:Prime Agent 開箱:自我改進 RLM 代理、OpenViking 開箱:Context Database for AI Agents、Grok Bot 測試版登場
