開源程式碼模型震撼彈!Poolside 推出 Laguna S 2.1:118B 參數、百萬 Token 上下文、比 DeepSeek V4 Flash 更便宜

前 GitHub CTO 創辦的 Poolside AI 發布 Laguna S 2.1,一款 118B 參數的 MoE 開放權重程式碼模型。以每百萬 token 僅 0.10/0.20 美元的價格,在 Terminal-Bench 2.1 以 70.2% 擊敗 DeepSeek V4 Pro Max(64%),還可在一台 DGX Spark 上運行。

  • Dennis
  • 4 分鐘閱讀
開源程式碼模型震撼彈!Poolside 推出 Laguna S 2.1:118B 參數、百萬 Token 上下文、比 DeepSeek V4 Flash 更便宜

AI 程式碼模型的戰場又迎來一位重量級挑戰者。

由前 GitHub CTO Jason Warner 創辦的 Poolside AI,今天正式發布了 Laguna S 2.1——一款總參數 1180 億(118B)、採用 MoE(混合專家)架構的開放權重模型,每個 token 僅啟用 80 億(8B)參數,卻能在多項代理型程式碼基準測試中擊敗兆級參數的對手。

更令人驚豔的是它的價格:每百萬 token 輸入僅 0.10 美元、輸出 0.20 美元——比 DeepSeek V4 Flash 更便宜,但在代理型任務上還能勝過 DeepSeek V4 Pro Max。

Poolside 是誰?GitHub CTO 的第二曲線

Poolside AI 成立於 2023 年初,由 Jason Warner(前 GitHub CTO)和 Eiso Kant(資深軟體創業家)共同創立。公司總部位於舊金山,目前約 150 名員工。

這家公司的募資歷程相當傳奇:

輪次金額主要投資者估值
種子輪2600 萬美元
追加輪1 億美元
B 輪(2024/10)5 億美元Bain Capital、DST Global、eBay30 億美元
Nvidia 投資(2025/10)10 億美元Nvidia120 億美元

Nvidia 的 10 億美元投資尤其引人注目——這不僅是資金支持,更代表著基礎設施層面的深度合作。Poolside 甚至在德州 Pecos County 啟動了 Project Horizon,建設一座 2GW 的 AI 資料中心園區。

Laguna S 2.1:規格深度解析

架構設計

graph TD
    A[Laguna S 2.1] --> B[MoE 架構]
    B --> C[48 層混合注意力]
    B --> D[256 個路由專家]
    B --> E[1 個共享專家]
    C --> F[12 層全域注意力]
    C --> G[36 層滑動視窗注意力<br/>視窗長度 512]
    D --> H[每個 token 選擇 top-10]
    H --> I[Token 選擇路由器<br/>Softplus 門控]
    E --> J[Sigmoid 專家門控<br/>正規化專家權重]
規格數值
總參數118B
活躍參數 / token8B
架構Mixture-of-Experts (MoE)
專家數量256 路由 + 1 共享
注意力層48 層(12 全域 + 36 滑動視窗)
上下文長度256K token(支援延伸至 1M)
KV 頭8 個分組查詢注意力 (GQA)
授權OpenMDW-1.1(開放權重)
訓練到發布不到 9 週

百萬上下文:代理型任務的關鍵

Laguna S 2.1 擁有不論思考模式開啟與否都支援的 100 萬 token 上下文視窗。這在代理型任務中至關重要——長時間的除錯對話動輒累積數十萬個 token,沒有擴展的上下文視窗,模型就像金魚一樣只有七秒記憶。

透過 分組查詢注意力(GQA,8 個 KV 槽),模型在極長上下文中仍能維持很小的 KV 快取佔用,這是在單一 DGX Spark 上運行的關鍵。

基準測試:以小搏大的驚人表現

Poolside 發布的數據顯示,Laguna S 2.1 在代理型程式碼任務中展現了驚人的實力:

Terminal-Bench 2.1(代理型任務)

排名模型分數
6Claude Sonnet 580.4
7Muse Spark 1.180.0
8Qwen 3.7 Max74.5
9Tencent Hy3 (295B)71.7
10Laguna S 2.1 (118B)70.2
11DeepSeek V4 Pro Max (1.6T)64.0
12DeepSeek V4 Flash Max (284B)61.8

一個僅有 8B 活躍參數的模型,在 Terminal-Bench 2.1 上竟然擊敗了 1.6T 參數的 DeepSeek V4 Pro Max(70.2% vs 64.0%)!

DeepSWE:極限長程規劃測試

在需要長時間規劃的 DeepSWE 測試中,差距更加明顯:

模型DeepSWE 分數
Claude Fable 570.0
Kimi K3 (2.8T)69.0
Claude Opus 4.859.0
Laguna S 2.1 (118B)40.4
DeepSeek V4 Pro Max (1.6T)9.0 😱

Laguna S 2.1 的 DeepSWE 分數(40.4%)比 DeepSeek V4 Pro Max(9.0%)高出 4.5 倍。這證明了參數數量不是一切——訓練策略和推理風格的設計至關重要。

價格對比

模型輸入 / 百萬 token輸出 / 百萬 token
Laguna S 2.1$0.10$0.20
DeepSeek V4 Flash Max$0.14$0.28
DeepSeek V4 Pro Max更高更高

為什麼 Laguna S 2.1 這麼強?關鍵在「持久性」

Poolside 的共同研究主管 Pengming Wang 一語道破 Laguna S 2.1 的核心設計哲學:

「我們這一代模型並沒有增加更多『智慧』,而是改進了導致更強能力的行為:更多的驗證、不把任何事情視為理所當然、不提前宣布勝利、更加持久。

這個「持久性」的設計在實際測試中非常明顯:

  • 50 分鐘、181 步、零人為干預:Laguna S 2.1 從一個空白資料夾開始,自主建立了一個可運作的 HTML/CSS 渲染引擎
  • 資源fulness:當無法直接驗證結果時,它會自行啟動 headless Chromium 來讀取畫布,並以數值比對截圖
  • 深度除錯能力:有使用者回報,Qwen 和 Claude 都無法修復的複雜 bug,Laguna S 2.1 成功解決——因為它願意花費 20 萬 token 思考問題的全貌

硬體需求

Laguna S 2.1 的 q4_k_m 量化版本僅需 75GB 記憶體,可以在以下設備上運行:

  • Apple Silicon(128GB 統一記憶體):實測每秒 13-18 token
  • NVIDIA DGX Spark:流暢運行
  • NVIDIA H200:資料中心級效能

對 AI 程式碼開發的意義

Laguna S 2.1 的發布代表了幾個重要趨勢:

  1. 開放權重模型追上了閉源前沿:半年前只有 Claude Fable 5 或 GPT-5.6 才能做到的代理型程式碼任務,現在 118B 的開放權重模型也能勝任
  2. MoE 架構的勝利:8B 活躍參數就能挑戰兆級參數模型,證明了訓練策略比參數數量更重要
  3. 程式碼 AI 的民主化:一台 DGX Spark(約 3 萬美元)就能運行 Laguna S 2.1,小型團隊也能擁有頂尖的 AI 程式碼助手
  4. Nvidia 的生態布局:池畔(Poolside)的德州 2GW 資料中心和 Nvidia 的 10 億美元投資,顯示了 AI 基礎設施的軍備競賽還在加速

小結

Laguna S 2.1 不僅是一個強大的程式碼模型,更是一個重要的信號:AI 程式碼開發的戰場正在從「誰的模型最大」轉向「誰的模型最會解決問題」。 在代理型任務中,持久性、資源fulness 和推理深度,比單純增加參數數量更為重要。

對於正在評估 AI 程式碼助手的開發團隊,Laguna S 2.1 提供了一個極具吸引力的選擇:開放權重、價格低廉、可在本地運行——而且真的很能解決問題。

原始來源:VentureBeat - Poolside drops Laguna S 2.1Poolside Blog