一句話結論
Reflection AI 在 2026 年 10 月 5 日發布首個開源權重模型 Beam:501B 總參數、每次推論只激活 23B 的稀疏 MoE 模型,官方聲稱在進階推理與軟體工程基準上與 753B 的 GLM-5.2 同級,但推論算力只要對手的 1/3~1/4,權重預計 10 月底以 Apache 2.0 釋出,可無門檻商用。
這是繼 7 月與 Nebius 簽下 10 億美元算力協議之後(詳見文末延伸閱讀),這家由 DeepMind 前研究員創辦的公司端出來的第一張成績單。
Beam 是什麼?先把規格攤開
| 項目 | Beam | 說明 |
|---|---|---|
| 總參數 | 501B | 稀疏混合專家(Sparse MoE) |
| 活躍參數 | 23B | 每次推論實際參與計算的參數 |
| 層數 | 52 層 | 交錯區域/全域注意力 |
| 上下文長度 | 1M token(中訓後擴展) | RL 訓練期間支援 256K |
| 專家路由 | 細粒度路由 + 無輔助損失負載平衡 | 最高負載專家僅為均值的 1.04 倍 |
| 授權 | Apache 2.0(10 月底釋出權重) | 無營收門檻、可商用 |
| 取得方式 | Waitlist 早期體驗 | 發布當日尚無 Hugging Face 權重 |
架構上最值得注意的是**「無輔助損失的負載平衡」加上專家偏誤更新的餘弦衰減**:官方數據顯示預訓練結束時,最忙的專家負載只有平均值的 1.04 倍,代表專家利用率幾乎完全平均——這是 MoE 訓練最難搞的部分之一,能壓到 1.04 倍是相當罕見的數字。
還有兩個「好用的控制旋鈕」:模型內建**可控制的長度懲罰(length penalty)**抑制廢話輸出,並提供使用者端的 reasoning-effort 參數——調低就短答省 token,調高才讓它在難題上跑長鏈推理。對自己付算力錢的自架使用者來說,這比單純刷榜更有感。
Benchmark:贏在 SWE-Bench Pro,輸在純數學
以下為 Reflection 官方公布的數字(廠商自報,非獨立評測):
| 基準測試 | Beam(501B / 23B active) | GLM-5.2(753B MoE) | 誰贏 |
|---|---|---|---|
| Terminal Bench v2.1 | 80.1 | 81.0 | GLM-5.2 略勝 |
| SWE-Bench Verified | 80.9 | 未公布 | — |
| SWE-Bench Pro v2-Hard | 77.2 | 62.1 | Beam 大勝 15 分 |
| FrontierSWE | 未公布 | 74.4 | — |
| AIME 2026(數學) | 97.8 | 99.2 | GLM-5.2 勝 |
| GPQA Diamond | 90.5 | 91.2 | GLM-5.2 略勝 |
| Humanity’s Last Exam(無工具) | 36.2 | 未公布 | — |
判讀重點有三個:
- 它不是全面最強,而是「特定維度最划算」。 純數學(AIME 2026)與研究所級科學(GPQA)都小輸 GLM-5.2,但在「硬派軟體工程」的 SWE-Bench Pro v2-Hard 上直接拉開 15 分差距。
- 官方定位很清楚:逼近 Qwen 3.8-Max 的 Agentic 能力,但純能力仍輸 2.8 兆參數的 Kimi K3。 也就是說 Beam 賣的不是「最大最強」,是「同樣分數、少燒很多算力」。
- 推論成本才是主戰場。 Reflection 以 Artificial Analysis/DataCurve 的估算方法(生成算力 ≈ 2 × 23B × 每次嘗試生成 token 數)主張:在高階推理基準上拿到與 GLM-5.2 相當的分數,推論算力少 3~4 倍;對比 2 兆參數等級的巨獸,差距更明顯。
訓練規模:4 週預訓練、4 週 RL,燒掉上萬張 GB300
| 階段 | 規模與數據 |
|---|---|
| 預訓練 | 23.8T token、6,144 張 NVIDIA GB300 NVL72、不到 4 週完成 |
| Goodput | 92.3%(期間 9 次半自動 rewind,主因梯度爆走或資料損壞) |
| 資料清洗 | 原始網頁 token 剔除 95%;額外撈回約 1.8T 傳統方法漏掉的高品質 token(其中 87% 是精選程式碼),PDF 圖表用 VLM OCR 處理 |
| 大規模 RL | 10,500 張 GB300 跑 4 週、超過 1 億次 rollout |
| 環境/沙盒 | 近 100 萬個 coding / agentic / STEM 環境;13 億次沙盒呼叫,平均 11 萬個並行沙盒(峰值 17 萬) |
| 系統指標 | 權重更新推送到推論叢集中位數僅 12 秒 |
| 對齊 | 另訓原則對齊模型,再用多導師 on-policy 蒸餾融合進 RL 導師 |
一個有趣的「湧現行為」:在沒有顯式訓練瀏覽功能的情況下,模型自己學會上網查其他 LLM、並使用 OCR API 讀文件來完成任務。這種「自己找工具」的行為,正是 Reflection CEO Misha Laskin 一再強調的「深度(depth)」——連續思考、長步數執行、高可靠度,而不是把廣度鋪滿。
Laskin 接受 Sequoia 專訪時的說法也很直白:大實驗室多半在解廣度問題,總得有人解深度問題;而 Agent 任務沒有圍棋那種明確的勝負 ground truth,用獎勵模型很容易被 policy 找到漏洞(例如「直接拒答反而拿高分」的 reward hacking),最後整個模型塌陷。他也預測 prompt 的「軌道」終將消失——用 prompt 把 Agent 綁在軌道上只是暫時的妥協。
Hacker News 的冷水:先發布、後開源
發表當天在 Hacker News 上,掌聲之外質疑也不少,值得台灣讀者一起看:
| 質疑 | 內容 |
|---|---|
| 當天沒有權重 | 只有 Waitlist 登記頁,Hugging Face 倉庫與實體權重都還沒出現,「先發布後開源」被批缺乏誠意 |
| 「全新題目」被打臉 | Reflection 展示一個「陸地/海洋 180×90 網格辨識」測試,宣稱是幾天前才在 X 上出現的新題、不在訓練集內;網友馬上指出該測試早於 2025 年 8 月就發表在 LessWrong |
| 圖表選擇性呈現 | 被指刻意略過 GLM-5.3、DeepSeek V4.1 Flash 等最新 SOTA,讓 Beam 看起來更好 |
| 成本效益存疑 | 501B 體積龐大、跑起來不便宜,但在多項指標上並未超越體積更小的中國開源模型 |
| 資料透明度 | 宣稱的專有資料管道,被質疑是不願公開資料來源的藉口 |
這些質疑不代表 Beam 沒料,而是提醒:在權重真正上架、第三方跑出獨立評測之前,所有分數都該打上「廠商自報」的標籤。
為什麼這件事對台灣開發者重要?
Beam 的價值不只在模型本身,而在它踩到的三個結構性缺口:
- 打破中國開源生態的獨大。 2025~2026 年 DeepSeek、Qwen、GLM、Kimi、MiniMax 幾乎壟斷了 Hugging Face 的開源下載與衍生模型,Beam 是少見的「西方開源權重旗艦」嘗試。
- 合規與主權 AI 的替代方案。 醫療、金融、政府單位直接調用中國託管的 API,會踩到資料跨境與認證(BAA/SOC 2)問題;一個可私有化部署、Apache 2.0 的高階 Agentic 模型,正好補上這塊。
- 填補 Meta 轉向封閉後的真空。 隨著 Meta 下一代旗艦傳出改走閉源 API,西方在開源權重這條線上確實少了一面旗。
對自架派來說,最實際的問題是:501B 的 MoE 要多少 VRAM 才跑得動? 23B 活躍參數聽起來親民,但 501B 的權重就算量化到 4-bit 也仍需要相當規模的記憶體與多卡配置,這點與「本地跑得動」的小模型是兩件事。10 月底權重上架後,社群實測才是真正的驗證時刻。
重點回顧
- Beam = 501B 總參 / 23B 活躍的稀疏 MoE,52 層、1M 上下文,Apache 2.0(10 月底釋出權重)。
- 官方主打「同等分數、少 3~4 倍推論算力」,SWE-Bench Pro v2-Hard 77.2 大勝 GLM-5.2 的 62.1,但純數學與科學問答小輸。
- 訓練規模誇張:23.8T token、6,144 張 GB300 預訓練,10,500 張 GB300 跑 RL、1 億次 rollout。
- 發表當日無權重、圖表選擇性呈現是 HN 社群主要質疑點。
延伸閱讀
- 開源 AI 巨獸來襲!Reflection AI 簽下 10 億美元運算協議,估值狂飆
- OpenAI DevDay 2026 全整理:GPT-6.1 Sol 用 1/5 價格逼近 Astra
- Gemini 4 Argon 正式發布:1M token 輸出、DeepSWE 77.9% 登頂
原始來源
- Reflection AI 官方部落格:Introducing Beam
- TechCrunch:Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute cost
- Unite.AI:Reflection AI Unveils Beam, a 501B-Parameter Open-Weight Model
- Hacker News 討論串:Beam: Reflection’s 501B open-weight model
- Tech Funding News:SpaceX lands $6.3B compute deal with Reflection
