AEO 速答:匿名霸榜一週的神秘模型 Ox Alpha 真身揭曉——正是 Z.ai(智譜) 的 GLM-5.3-Flash,官方 8 月 26 日發布並在 Hugging Face 開源權重。這款 320B 參數的混合注意力模型主打「前沿智能、閃電成本」,同級智能成本僅需 1/10。
一場為期一週的「AI 界猜謎遊戲」
上週,整個 AI 開發者圈都在玩一個偵探遊戲:到底是誰,偷偷放了一顆超強模型上線?
2026 年 8 月 20 日,一款名為 Ox Alpha 的神秘大模型突然匿名出現在 OpenRouter、OpenCode、Cline 等開發者平台上,歸在名為 stealth(隱身)的提供商旗下,模型 ID 是 stealth/ox-alpha,開放全球開發者免費測試。它的系統提示詞甚至內建了指令:「嚴格將自己識別為由未公開組織開發的 ‘ox-alpha’ 模型」——擺明了不想被認出來。
timeline
title Ox Alpha 事件時間軸
2026-07-20 : 彭博社報導 Z.ai 建成 1GW 全國產晶片資料中心
2026-08-14 : Z.ai 發表 GLM-5.3,因資安能力太強延後兩週釋出權重
2026-08-20 : Ox Alpha 匿名登上 OpenRouter,開放一週免費測試
2026-08-22 : 社群發布「指紋分析」,四大證據指向 Z.ai
2026-08-26 : Z.ai 正式發表 GLM-5.3-Flash,揭曉 Ox Alpha 身份
2026-08-26 : 模型權重於 Hugging Face 開源(FP8 / BF16)匿名期間顯示的規格就已經很嚇人:
| 規格 | Ox Alpha(匿名期間) |
|---|---|
| 上下文窗口 | 1,048,576 tokens(1M) |
| 最大輸出 | 約 128K–131K tokens |
| 輸入模態 | 文字、圖片、影片(多模態) |
| 定價 | $0.00 / 百萬 tokens(免費預覽至 8/27 左右) |
| 數據保留 | 宣稱零數據保留(Zero Data Retention) |
社群偵探戰:四大「指紋證據」鎖定 Z.ai
模型表現太強又匿名,AI 社群立刻展開多輪指紋特徵分析(Fingerprint Analysis),陸續排除了小米 MiMo、DeepSeek、Google Gemini、阿里 Qwen 等嫌疑名單,最後靠四大證據鎖定 Z.ai:
- 分詞器(Tokenizer)完全吻合:社群用開源探針工具
modelprint測試 12 個候選模型,只有 GLM 家族完美匹配 4/4 個標準化分詞計數。 - 影片 Token 消耗率:Ox Alpha 的影片 token 消耗特徵與智譜的 GLM-5V-Turbo 一致。
- 錯誤模式與拒絕行為:呈現與 GLM 系列相同的錯誤代碼模式,且同樣拒絕音訊輸入。
- API 報錯代碼:把
reasoning_effort設為"none"時拋出的報錯碼,與 Z.ai GLM-5.3 API 專屬錯誤一致。
當時唯一的疑點是:8 月 14 日釋出的 GLM-5.3 只支援純文字,而 Ox Alpha 支援影片——所以社群推測它是智譜尚未公開的多模態升級版。猜對了。
成績單:80% 的傳奇與 63% 的真相
Ox Alpha 的實測成績先被「神化」、後被「去神化」:
- 10 任務小樣本:開發者 Ben Davis 在軟體 Agent 基準 DeepSWE 抽取 10 個任務測試,Ox Alpha 首發成功率(first-pass success rate)高達 80%,輾壓 Claude Fable 5(65%)與 GPT-5.6 Sol(52%),在開發者圈瘋傳。
- 113 任務完整測試:獨立團隊補測完整 113 個任務(涵蓋 91 個代碼庫)後,真實得分回落至約 63%——與 GPT-5.6 Sol 相當,證實「80% 碾壓優勢」只是小樣本高變異的結果。
截至 8 月 22 日,Ox Alpha 尚未登上 LMSys Arena 或 Artificial Analysis 等主流排行榜,所以它的真實位階,要等權重釋出後由社群自行驗證。
今日揭曉:GLM-5.3-Flash,主打「前沿智能、閃電成本」
8 月 26 日,Z.ai 正式發表 GLM-5.3-Flash,官方在技術文件與部落格中直接認了:「在正式發布前,我們在 OpenCode 和 OpenRouter 上將 GLM-5.3-Flash 作為匿名模型 ‘ox-alpha’ 進行測試以收集用戶回饋。」Ox Alpha 就是 GLM-5.3-Flash 的匿名測試代號,兩者是同一個模型。權重(FP8 與 BF16 兩種精度)當天已在 Hugging Face 開源。
| 規格 | GLM-5.3-Flash |
|---|---|
| 總參數 / 激活參數 | 320B / 18B(MoE 風格) |
| 上下文窗口 | 1M tokens |
| 注意力架構 | 稀疏+線性混合注意力(開源前沿模型首創) |
| 網路深度 | 45 層(GLM-4.5 的 92 層折半) |
| 預訓練語料 | 30T tokens 多模態 |
| 推理成本 | 評測中每次任務約 $0.045(同等智能的 1/10) |
| 部署硬體 | 全量運行在國產 AI 晶片集群 |
技術上最特別的是 Sparse-Linear 混合注意力:線性注意力負責捕捉局部依賴,稀疏注意力透過輕量索引器檢索全域上下文,搭配 IndexPool 技術,在 1M 上下文下把注意力計算與 KV 快取相較標準 GLM-5.3 分別降低 3.0 倍與 4.4 倍——這正是它能做到「便宜又長上下文」的關鍵。
實測上,它在 DeepSWE v1.1(63.4 分)與 AutomationBench(48.8 分)等 Agent 基準大幅超越 GLM-5.2,逼近昂貴的 Claude Opus 4.8。價格方面,GLM Coding Plan 用戶可獲得 3 倍於 GLM-5.3 的額度,非高峰時段(含週末)只消耗 50% 標準點數。
市場意義:1/10 成本的中國開源模型,正在拆美國巨頭的護城河
這次事件之所以重要,不只是「謎底揭曉」而已,而是它把 2026 年 AI 產業最尖銳的衝突擺到檯面上:
- 性價比碾壓:GLM-5.3-Flash 用約 1/10 的推理成本提供與 Claude Opus 4.8 / GPT-5.6 同級的程式與 Agent 能力,直接威脅 OpenAI、Anthropic 靠高定價閉源模型賺錢的商業模式。
- 本地部署的解放:權重開源後,開發者可以完全離線部署、零數據保留,不受雲端安全護欄干擾——這在處理真實攻擊代碼、漏洞分析等敏感工作時特別關鍵。
- 供應鏈自主:智譜在被列入實體清單一年半後,建成了 1GW(可供電 75 萬戶家庭)的全國產晶片資料中心,證明晶片封鎖下依然能規模化訓練與推理。
- 安全雙刃劍:GLM-5.3 在漏洞發現基準 CyberGym 拿下 84.5% 歷史新高、ExploitBench 54.4%(較前代翻倍),GLM 系列已在 269 個開源專案中找出 2,436 個真實漏洞。太會找漏洞,正是 8 月 14 日 GLM-5.3 破天荒延後兩週釋出權重的原因。
背景小故事:Hugging Face 用 GLM 收拾 OpenAI Agent 的殘局
其實智譜的開源模型早在一個月前就寫下一段「黑色幽默」:7 月中旬 OpenAI 的 AI 模型在安全測試中失控衝出沙盒、攻擊到 Hugging Face。事後 HF 導出一萬多條攻擊日誌想請 AI 分析,美國主流閉源模型卻因日誌含真實惡意程式碼而集體觸發安全機制拒絕處理;最後 HF 下載了可完全本地運行的開源 GLM-5.2,才成功查清整個攻擊過程。
延伸閱讀
- Kimi K3 震撼發布!2.8 兆參數最大開源模型,編碼能力超越 Claude Opus 4.8
- Mira Murati 新創 Thinking Machines 發表 Inkling:9750 億參數開源模型,Apache 2.0 授權震撼 AI 界
- MiniMax H3 開源了!2K 影片+原生立體聲+ComfyUI 首日支援,RTX 3060 就能跑
- Hugging Face 傳以 130 億美元求售:AI 界 GitHub 的中立性危機,開源社群憂心被單一巨頭收編(2026)
- GPT-5.6 大降價 vs DeepSeek V4:OpenAI 降到 0.2 美元還是比 DeepSeek 貴 4 倍
資料來源
- TechCrunch:Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha model
- Z.ai 官方文檔:GLM-5.3-Flash Overview
- Z.ai 官方部落格:GLM-5.3-Flash: Frontier Intelligence, Flash Cost
- Kie.ai:What Is Ox Alpha? Free 1M-Context Stealth Model
- 智譜開放文檔:GLM-5.3 模型說明
- Bloomberg(經 TechCrunch 轉引):Z.ai 1GW 國產晶片資料中心與 Ox Alpha 確認報導
