AI 程式碼模型的戰場又迎來一位重量級挑戰者。
由前 GitHub CTO Jason Warner 創辦的 Poolside AI,今天正式發布了 Laguna S 2.1——一款總參數 1180 億(118B)、採用 MoE(混合專家)架構的開放權重模型,每個 token 僅啟用 80 億(8B)參數,卻能在多項代理型程式碼基準測試中擊敗兆級參數的對手。
更令人驚豔的是它的價格:每百萬 token 輸入僅 0.10 美元、輸出 0.20 美元——比 DeepSeek V4 Flash 更便宜,但在代理型任務上還能勝過 DeepSeek V4 Pro Max。
Poolside 是誰?GitHub CTO 的第二曲線
Poolside AI 成立於 2023 年初,由 Jason Warner(前 GitHub CTO)和 Eiso Kant(資深軟體創業家)共同創立。公司總部位於舊金山,目前約 150 名員工。
這家公司的募資歷程相當傳奇:
| 輪次 | 金額 | 主要投資者 | 估值 |
|---|---|---|---|
| 種子輪 | 2600 萬美元 | — | — |
| 追加輪 | 1 億美元 | — | — |
| B 輪(2024/10) | 5 億美元 | Bain Capital、DST Global、eBay | 30 億美元 |
| Nvidia 投資(2025/10) | 10 億美元 | Nvidia | 120 億美元 |
Nvidia 的 10 億美元投資尤其引人注目——這不僅是資金支持,更代表著基礎設施層面的深度合作。Poolside 甚至在德州 Pecos County 啟動了 Project Horizon,建設一座 2GW 的 AI 資料中心園區。
Laguna S 2.1:規格深度解析
架構設計
graph TD
A[Laguna S 2.1] --> B[MoE 架構]
B --> C[48 層混合注意力]
B --> D[256 個路由專家]
B --> E[1 個共享專家]
C --> F[12 層全域注意力]
C --> G[36 層滑動視窗注意力<br/>視窗長度 512]
D --> H[每個 token 選擇 top-10]
H --> I[Token 選擇路由器<br/>Softplus 門控]
E --> J[Sigmoid 專家門控<br/>正規化專家權重]| 規格 | 數值 |
|---|---|
| 總參數 | 118B |
| 活躍參數 / token | 8B |
| 架構 | Mixture-of-Experts (MoE) |
| 專家數量 | 256 路由 + 1 共享 |
| 注意力層 | 48 層(12 全域 + 36 滑動視窗) |
| 上下文長度 | 256K token(支援延伸至 1M) |
| KV 頭 | 8 個分組查詢注意力 (GQA) |
| 授權 | OpenMDW-1.1(開放權重) |
| 訓練到發布 | 不到 9 週 |
百萬上下文:代理型任務的關鍵
Laguna S 2.1 擁有不論思考模式開啟與否都支援的 100 萬 token 上下文視窗。這在代理型任務中至關重要——長時間的除錯對話動輒累積數十萬個 token,沒有擴展的上下文視窗,模型就像金魚一樣只有七秒記憶。
透過 分組查詢注意力(GQA,8 個 KV 槽),模型在極長上下文中仍能維持很小的 KV 快取佔用,這是在單一 DGX Spark 上運行的關鍵。
基準測試:以小搏大的驚人表現
Poolside 發布的數據顯示,Laguna S 2.1 在代理型程式碼任務中展現了驚人的實力:
Terminal-Bench 2.1(代理型任務)
| 排名 | 模型 | 分數 |
|---|---|---|
| 6 | Claude Sonnet 5 | 80.4 |
| 7 | Muse Spark 1.1 | 80.0 |
| 8 | Qwen 3.7 Max | 74.5 |
| 9 | Tencent Hy3 (295B) | 71.7 |
| 10 | Laguna S 2.1 (118B) | 70.2 |
| 11 | DeepSeek V4 Pro Max (1.6T) | 64.0 |
| 12 | DeepSeek V4 Flash Max (284B) | 61.8 |
一個僅有 8B 活躍參數的模型,在 Terminal-Bench 2.1 上竟然擊敗了 1.6T 參數的 DeepSeek V4 Pro Max(70.2% vs 64.0%)!
DeepSWE:極限長程規劃測試
在需要長時間規劃的 DeepSWE 測試中,差距更加明顯:
| 模型 | DeepSWE 分數 |
|---|---|
| Claude Fable 5 | 70.0 |
| Kimi K3 (2.8T) | 69.0 |
| Claude Opus 4.8 | 59.0 |
| Laguna S 2.1 (118B) | 40.4 |
| DeepSeek V4 Pro Max (1.6T) | 9.0 😱 |
Laguna S 2.1 的 DeepSWE 分數(40.4%)比 DeepSeek V4 Pro Max(9.0%)高出 4.5 倍。這證明了參數數量不是一切——訓練策略和推理風格的設計至關重要。
價格對比
| 模型 | 輸入 / 百萬 token | 輸出 / 百萬 token |
|---|---|---|
| Laguna S 2.1 | $0.10 | $0.20 |
| DeepSeek V4 Flash Max | $0.14 | $0.28 |
| DeepSeek V4 Pro Max | 更高 | 更高 |
為什麼 Laguna S 2.1 這麼強?關鍵在「持久性」
Poolside 的共同研究主管 Pengming Wang 一語道破 Laguna S 2.1 的核心設計哲學:
「我們這一代模型並沒有增加更多『智慧』,而是改進了導致更強能力的行為:更多的驗證、不把任何事情視為理所當然、不提前宣布勝利、更加持久。」
這個「持久性」的設計在實際測試中非常明顯:
- 50 分鐘、181 步、零人為干預:Laguna S 2.1 從一個空白資料夾開始,自主建立了一個可運作的 HTML/CSS 渲染引擎
- 資源fulness:當無法直接驗證結果時,它會自行啟動 headless Chromium 來讀取畫布,並以數值比對截圖
- 深度除錯能力:有使用者回報,Qwen 和 Claude 都無法修復的複雜 bug,Laguna S 2.1 成功解決——因為它願意花費 20 萬 token 思考問題的全貌
硬體需求
Laguna S 2.1 的 q4_k_m 量化版本僅需 75GB 記憶體,可以在以下設備上運行:
- Apple Silicon(128GB 統一記憶體):實測每秒 13-18 token
- NVIDIA DGX Spark:流暢運行
- NVIDIA H200:資料中心級效能
對 AI 程式碼開發的意義
Laguna S 2.1 的發布代表了幾個重要趨勢:
- 開放權重模型追上了閉源前沿:半年前只有 Claude Fable 5 或 GPT-5.6 才能做到的代理型程式碼任務,現在 118B 的開放權重模型也能勝任
- MoE 架構的勝利:8B 活躍參數就能挑戰兆級參數模型,證明了訓練策略比參數數量更重要
- 程式碼 AI 的民主化:一台 DGX Spark(約 3 萬美元)就能運行 Laguna S 2.1,小型團隊也能擁有頂尖的 AI 程式碼助手
- Nvidia 的生態布局:池畔(Poolside)的德州 2GW 資料中心和 Nvidia 的 10 億美元投資,顯示了 AI 基礎設施的軍備競賽還在加速
小結
Laguna S 2.1 不僅是一個強大的程式碼模型,更是一個重要的信號:AI 程式碼開發的戰場正在從「誰的模型最大」轉向「誰的模型最會解決問題」。 在代理型任務中,持久性、資源fulness 和推理深度,比單純增加參數數量更為重要。
對於正在評估 AI 程式碼助手的開發團隊,Laguna S 2.1 提供了一個極具吸引力的選擇:開放權重、價格低廉、可在本地運行——而且真的很能解決問題。
原始來源:VentureBeat - Poolside drops Laguna S 2.1 | Poolside Blog
