Reflection AI Beam 發布:501B 開源權重模型,推論算力只要 GLM-5.2 的 1/3~1/4——西方開源旗艦的正面反擊(2026)

Reflection AI 於 2026 年 10 月 5 日發布首個開源權重模型 Beam:501B 總參數、23B 活躍參數的稀疏 MoE,官方稱在進階推理基準上與 GLM-5.2 同級,但推論算力少 3~4 倍,權重將以 Apache 2.0 於 10 月底釋出。本文整理架構、benchmark、成本、訓練規模與 Hacker News 的質疑。

  • Dennis
  • 6 分鐘閱讀
Reflection AI Beam 發布:501B 開源權重模型,推論算力只要 GLM-5.2 的 1/3~1/4——西方開源旗艦的正面反擊(2026)

一句話結論

Reflection AI 在 2026 年 10 月 5 日發布首個開源權重模型 Beam:501B 總參數、每次推論只激活 23B 的稀疏 MoE 模型,官方聲稱在進階推理與軟體工程基準上與 753B 的 GLM-5.2 同級,但推論算力只要對手的 1/3~1/4,權重預計 10 月底以 Apache 2.0 釋出,可無門檻商用。

這是繼 7 月與 Nebius 簽下 10 億美元算力協議之後(詳見文末延伸閱讀),這家由 DeepMind 前研究員創辦的公司端出來的第一張成績單。


Beam 是什麼?先把規格攤開

項目Beam說明
總參數501B稀疏混合專家(Sparse MoE)
活躍參數23B每次推論實際參與計算的參數
層數52 層交錯區域/全域注意力
上下文長度1M token(中訓後擴展)RL 訓練期間支援 256K
專家路由細粒度路由 + 無輔助損失負載平衡最高負載專家僅為均值的 1.04 倍
授權Apache 2.0(10 月底釋出權重)無營收門檻、可商用
取得方式Waitlist 早期體驗發布當日尚無 Hugging Face 權重

架構上最值得注意的是**「無輔助損失的負載平衡」加上專家偏誤更新的餘弦衰減**:官方數據顯示預訓練結束時,最忙的專家負載只有平均值的 1.04 倍,代表專家利用率幾乎完全平均——這是 MoE 訓練最難搞的部分之一,能壓到 1.04 倍是相當罕見的數字。

還有兩個「好用的控制旋鈕」:模型內建**可控制的長度懲罰(length penalty)**抑制廢話輸出,並提供使用者端的 reasoning-effort 參數——調低就短答省 token,調高才讓它在難題上跑長鏈推理。對自己付算力錢的自架使用者來說,這比單純刷榜更有感。


Benchmark:贏在 SWE-Bench Pro,輸在純數學

以下為 Reflection 官方公布的數字(廠商自報,非獨立評測):

基準測試Beam(501B / 23B active)GLM-5.2(753B MoE)誰贏
Terminal Bench v2.180.181.0GLM-5.2 略勝
SWE-Bench Verified80.9未公布—
SWE-Bench Pro v2-Hard77.262.1Beam 大勝 15 分
FrontierSWE未公布74.4—
AIME 2026(數學)97.899.2GLM-5.2 勝
GPQA Diamond90.591.2GLM-5.2 略勝
Humanity’s Last Exam(無工具)36.2未公布—

判讀重點有三個:

  1. 它不是全面最強,而是「特定維度最划算」。 純數學(AIME 2026)與研究所級科學(GPQA)都小輸 GLM-5.2,但在「硬派軟體工程」的 SWE-Bench Pro v2-Hard 上直接拉開 15 分差距。
  2. 官方定位很清楚:逼近 Qwen 3.8-Max 的 Agentic 能力,但純能力仍輸 2.8 兆參數的 Kimi K3。 也就是說 Beam 賣的不是「最大最強」,是「同樣分數、少燒很多算力」。
  3. 推論成本才是主戰場。 Reflection 以 Artificial Analysis/DataCurve 的估算方法(生成算力 ≈ 2 × 23B × 每次嘗試生成 token 數)主張:在高階推理基準上拿到與 GLM-5.2 相當的分數,推論算力少 3~4 倍;對比 2 兆參數等級的巨獸,差距更明顯。

訓練規模:4 週預訓練、4 週 RL,燒掉上萬張 GB300

階段規模與數據
預訓練23.8T token、6,144 張 NVIDIA GB300 NVL72、不到 4 週完成
Goodput92.3%(期間 9 次半自動 rewind,主因梯度爆走或資料損壞)
資料清洗原始網頁 token 剔除 95%;額外撈回約 1.8T 傳統方法漏掉的高品質 token(其中 87% 是精選程式碼),PDF 圖表用 VLM OCR 處理
大規模 RL10,500 張 GB300 跑 4 週、超過 1 億次 rollout
環境/沙盒近 100 萬個 coding / agentic / STEM 環境;13 億次沙盒呼叫,平均 11 萬個並行沙盒(峰值 17 萬)
系統指標權重更新推送到推論叢集中位數僅 12 秒
對齊另訓原則對齊模型,再用多導師 on-policy 蒸餾融合進 RL 導師

一個有趣的「湧現行為」:在沒有顯式訓練瀏覽功能的情況下,模型自己學會上網查其他 LLM、並使用 OCR API 讀文件來完成任務。這種「自己找工具」的行為,正是 Reflection CEO Misha Laskin 一再強調的「深度(depth)」——連續思考、長步數執行、高可靠度,而不是把廣度鋪滿。

Laskin 接受 Sequoia 專訪時的說法也很直白:大實驗室多半在解廣度問題,總得有人解深度問題;而 Agent 任務沒有圍棋那種明確的勝負 ground truth,用獎勵模型很容易被 policy 找到漏洞(例如「直接拒答反而拿高分」的 reward hacking),最後整個模型塌陷。他也預測 prompt 的「軌道」終將消失——用 prompt 把 Agent 綁在軌道上只是暫時的妥協。


Hacker News 的冷水:先發布、後開源

發表當天在 Hacker News 上,掌聲之外質疑也不少,值得台灣讀者一起看:

質疑內容
當天沒有權重只有 Waitlist 登記頁,Hugging Face 倉庫與實體權重都還沒出現,「先發布後開源」被批缺乏誠意
「全新題目」被打臉Reflection 展示一個「陸地/海洋 180×90 網格辨識」測試,宣稱是幾天前才在 X 上出現的新題、不在訓練集內;網友馬上指出該測試早於 2025 年 8 月就發表在 LessWrong
圖表選擇性呈現被指刻意略過 GLM-5.3、DeepSeek V4.1 Flash 等最新 SOTA,讓 Beam 看起來更好
成本效益存疑501B 體積龐大、跑起來不便宜,但在多項指標上並未超越體積更小的中國開源模型
資料透明度宣稱的專有資料管道,被質疑是不願公開資料來源的藉口

這些質疑不代表 Beam 沒料,而是提醒:在權重真正上架、第三方跑出獨立評測之前,所有分數都該打上「廠商自報」的標籤。


為什麼這件事對台灣開發者重要?

Beam 的價值不只在模型本身,而在它踩到的三個結構性缺口:

  1. 打破中國開源生態的獨大。 2025~2026 年 DeepSeek、Qwen、GLM、Kimi、MiniMax 幾乎壟斷了 Hugging Face 的開源下載與衍生模型,Beam 是少見的「西方開源權重旗艦」嘗試。
  2. 合規與主權 AI 的替代方案。 醫療、金融、政府單位直接調用中國託管的 API,會踩到資料跨境與認證(BAA/SOC 2)問題;一個可私有化部署、Apache 2.0 的高階 Agentic 模型,正好補上這塊。
  3. 填補 Meta 轉向封閉後的真空。 隨著 Meta 下一代旗艦傳出改走閉源 API,西方在開源權重這條線上確實少了一面旗。

對自架派來說,最實際的問題是:501B 的 MoE 要多少 VRAM 才跑得動? 23B 活躍參數聽起來親民,但 501B 的權重就算量化到 4-bit 也仍需要相當規模的記憶體與多卡配置,這點與「本地跑得動」的小模型是兩件事。10 月底權重上架後,社群實測才是真正的驗證時刻。


重點回顧

  • Beam = 501B 總參 / 23B 活躍的稀疏 MoE,52 層、1M 上下文,Apache 2.0(10 月底釋出權重)。
  • 官方主打「同等分數、少 3~4 倍推論算力」,SWE-Bench Pro v2-Hard 77.2 大勝 GLM-5.2 的 62.1,但純數學與科學問答小輸。
  • 訓練規模誇張:23.8T token、6,144 張 GB300 預訓練,10,500 張 GB300 跑 RL、1 億次 rollout。
  • 發表當日無權重、圖表選擇性呈現是 HN 社群主要質疑點。

延伸閱讀

原始來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

訂閱即表示同意收到 most.tw 電子報,隨時可一鍵退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友