Meta Muse Glimmer 開源了!30B 本地 AI Agent 模型,Apache 2.0 授權、24GB 顯示卡就能跑(2026)

Meta 於 2026 年 8 月 10 日發布 Muse Glimmer:30B 參數(28B 文字+1.8B 視覺)開放權重模型,Apache 2.0 授權,專為本機 AI Agent 設計。單張消費級 GPU 就能跑,量化後僅需 17GB,支援 128K 上下文、100+ 語言與 DFlash 投機解碼加速,並在 MCP Atlas、SWE-Bench Pro 等代理基準超越同級 Gemma 4 與 Qwen 3.6。

  • Dennis
  • 7 分鐘閱讀
Meta Muse Glimmer 開源了!30B 本地 AI Agent 模型,Apache 2.0 授權、24GB 顯示卡就能跑(2026)

AEO 速答:Muse Glimmer 是 Meta 在 2026 年 8 月 10 日發布的 30B 開放權重模型,以 Apache 2.0 授權開源,專為「永遠在線的本地 AI Agent」設計——單張 24GB 顯示卡就能跑,量化後僅需約 17GB 記憶體,支援 128K 上下文、100+ 語言與多模態輸入,是 Meta 迄今最完整的開源代理模型。

重點速覽

Meta 正式宣布推出 Muse Glimmer,一個 30B 參數的開放權重模型,目標是讓 AI Agent 徹底脫離雲端依賴,跑在使用者自己的裝置上。這是祖克柏「個人超級智慧(Personal Superintelligence)」願景第一次有了可下載、可自行修改的具體實作——而且是用最寬鬆的 Apache 2.0 授權。

核心規格數值
參數規模29.6B(28B 文字解碼器+1.8B 視覺編碼器)
授權Apache 2.0(開源權重)
上下文長度原生 128K tokens(框架最高可擴至 256K)
支援語言100+ 種
量化後記憶體約 17GB(24GB VRAM)/19.6GB(32GB VRAM)
專用加速DFlash 投機解碼(RTX 5090 最高 3.1 倍速)
下載位置Hugging Face(官方 GGUF 同步釋出)

Glimmer 是什麼?一句話:Meta 最強封閉模型的「開源小老弟」

Muse Glimmer 是 Meta 旗艦封閉模型 Muse Spark 的知識蒸餾產物。Meta 從自家百萬級上下文、最強的 Spark(1.2 版)身上,把「會推理、會寫程式、會呼叫工具」的本事濃縮進一個 30B 的小模型,再針對本地場景深度調校:

  • 多步推理與工具呼叫:可在長時間工作流中維持連貫計畫,工具呼叫失敗時會診斷錯誤並重試
  • 多模態理解:透過視覺感知編碼器接受交錯的文字+圖片輸入,能看懂截圖、圖表與文件
  • 代理框架相容:支援 OpenClaw 等主流代理編排模式
  • 可調推理強度:可在品質與速度之間自由切換

用 Meta 官方部落格的說法,Glimmer 是「優化給 always-on 本地代理工作流」的模型——管理行事曆、起草訊息、整理檔案這類需要大量存取個人資料的任務,全部在裝置上完成,不必把隱私送上雲端。

硬體需求:消費級 GPU 就夠

30B 模型聽起來很嚇人,但 Meta 這次把「塞進消費級硬體」當成首要工程目標:

部署配置記憶體需求建議硬體性能退化
BF16 全精度約 58GB64GB VRAM(單張 80GB 加速器)基準
K-Quant-Dynamic約 19.6GB32GB(Mac 32GB/RTX 5090)僅 0.2%
K-Quant-17GB約 16.8GB24GB(RTX 4080 等)平均 1.0%

關鍵在於三大硬體工程:

  1. 混合注意力:52 層中 39 層用滑動窗口注意力(窗口 2,048 tokens),僅 13 層用全域注意力,跑 128K 完整上下文時運算量比全全域注意力省數十倍
  2. 16:1 GQA:32 個查詢頭只有 2 個鍵值頭,大幅壓低 KV-Cache 記憶體壓力
  3. DFlash 投機解碼:官方隨附 2.56B 的「草稿模型」,一次預測 16 個 tokens 讓主模型並行驗證——RTX 5090 上推論速度從 74.9 tok/s 暴增到 233.4 tok/s(3.1 倍),M4 Max 與 M5 Max 也有 1.5~1.8 倍加速

跑分:代理能力全面領先同級模型

Meta 官方基準(High Reasoning 模式)顯示,Glimmer 在「代理能力」這條賽道上對 Google Gemma 4 31B 與阿里巴巴 Qwen 3.6 27B 形成明顯壓制:

基準測試Muse Glimmer 30BGemma 4 31BQwen 3.6 27B
MCP Atlas(代理)75.5 🏆54.262.5
DeepSearch QA(代理)74.6 🏆61.771.1
SWE-Bench Pro(編碼)51.2 🏆36.950.2
AIME 2026(推理)94.7 🏆89.294.1
OSWorld(電腦操作)65.958.575.6 🏆
GPQA Diamond(推理)83.585.7 🏆84.2
Siren 攻擊成功率(越低越好)28.4%25.6% 🏆40.3%

值得注意的兩點:Glimmer 在「代理任務完成率」上全線領先(LM Studio 的 BionicBench 18 項本地工作流測試更拿到 83.3%,贏過兩者的 77.7%),但 Qwen 3.6 在電腦操作(OSWorld)與 SWE-Bench Verified 仍較強Gemma 4 在學術難題與安全性上最穩。想換本地模型的開發者,可以依「代理任務 vs 傳統學術」的用途各取所需。

flowchart LR
    A[Muse Spark 封閉旗艦模型<br/>百萬上下文] -->|知識蒸餾| B[Muse Glimmer 30B]
    B --> C[量化 17GB<br/>24GB GPU 可跑]
    B --> D[DFlash 投機解碼<br/>最高 3.1x 加速]
    C --> E[本地 AI Agent<br/>離線可用]
    D --> E
    E --> F[管理行事曆/檔案]
    E --> G[本地編碼助手]
    E --> H[LLM-as-a-Judge]

開箱即用的生態系:發布當天就全面支援

Glimmer 的發布不是「先丟權重、生態慢慢跟上」,而是 Day-0 全面支援

  • Hugging Face Transformers:原生支援,可呼叫 AutoModelForMultimodalLM 直接做圖文/影片推論
  • llama.cpp:官方校準 GGUF 同步釋出,CLI 與 Server 模式皆可
  • vLLM / SGLang:完整支援,含 NVIDIA Blackwell 的 NVFP4 量化格式
  • LM Studio / Ollama:數日內即可用;LM Studio Bionic 已有深度合作支援
  • MLX / ExecuTorch:Apple Silicon 與 edge 部署框架皆列入官方路線圖
  • 雲端 API:Together AI、Fireworks AI、OpenRouter 等平台同步上架

祖克柏的算盤:開放與控制的界線

就在發布同一天,祖克柏發布公開信重申他的願景:AI 超級智慧應該「賦予個人力量」,讓每個人「24/7 全天候為你的健康、職涯、財務、家庭管理工作的個人代理」成為免費或負擔得起的工具。

但仔細看 Meta 的策略,會發現一條清楚的界線:

開放的:Muse Glimmer(30B,Apache 2.0,可下載可微調) 封閉的:Muse Spark(更強,百萬上下文,只有 API)

換句話說,Meta 把「人人可擁有的 AI」開源,把「最強的 AI」留在自己手上。這與先前把 Llama 系列完全開源的做法不同,也讓 Glimmer 成為觀察 Meta 未來開放策略的關鍵樣本。值得注意的是,這波發布也打破了近期開源市場由 Qwen、DeepSeek 主導的局面——西方大廠總算端出了同級別的本地代理模型。

開發者反應與安全提醒

  • 讚嘆整合度:多數開發者認為 Glimmer 的亮點不在「跑分智商」,而在「為本地硬體而生的極致工程整合」——混合注意力、GQA、投機解碼、視覺編碼全部塞進單張消費級 GPU 的預算,相當精緻
  • 小抱怨:工具呼叫格式:Glimmer 不用 OpenAI 慣用的 JSON Schema,而是 Meta 自家 ATEM 標記語法(類似 XML,如 <atem:invoke name="search">),現有代理框架需針對提示詞做適配才能隨插即用
  • RSI 話題延燒:已有團隊示範 Glimmer 透過 Hugging Face MCP 連線後「自主為自己量化成 GGUF」「自主部署到推理端點」,自我改進的想像空間很大
  • ⚠️ 安全底線:本地運行≠絕對安全。Siren AgentDojo 測試中 Glimmer 仍有 28.4% 的間接提示注入成功率;若隨便授予終端機、檔案或瀏覽器權限,惡意網頁或文件仍可能誘騙它執行不可逆的本地操作。人工確認(Human-in-the-loop)依然是使用本地代理的安全底線

為什麼這件事重要?

  1. 隱私優先的個人代理成真:行事曆、訊息、檔案這類高度個人化的資料,第一次有「跑在你自己機器上、還能自己改」的主流大廠模型可以託付
  2. 本地 AI 生態的硬體基準更新:24GB 顯示卡=30B 頂級代理模型的「最低消費」,會連帶推升 Ollama、LM Studio 等本地工具的聲量
  3. 開源陣營版圖鬆動:西方大廠正式回歸開源軍備競賽,與 Qwen、DeepSeek 正面對決

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。