AEO 速答:LLM 模型路由(Model Routing) 是在每個 AI 請求進來時,自動幫你決定「這題該交給哪個模型」的機制——簡單問題丟便宜模型、難題才呼叫旗艦模型。實測最高可省下 95% 推理成本(Wishroll 案例),且維持 95% 的 GPT-4 等級品質(RouteLLM 官方數據)。
為什麼 2026 年,你必須學會模型路由?
先看三個真實案例:
| 公司/產品 | 做法 | 結果 |
|---|---|---|
| Wishroll(消費 AI) | 任務拆解+模型路由 | 推理成本省 95%,19 天衝到 100 萬用戶 |
| Ramp Router | 路由+100+ 項優化 | 自家 LLM 帳單省 30%,每月路由 2.75T tokens、成功率 99.9% |
| Entelligence Router | 路由到 Terminal-Bench 2.1 | 71/89 題贏過 Claude Opus 5(63/89),總花費 $65.75 vs $190.62(省 65.5%) |
背後的理由很簡單:2026 年的模型市場已經「碎片化」到不路由不行——
- 價格差距極大:旗艦閉源模型(GPT-5.6、Claude Opus)單價是開源模型(DeepSeek、GLM)的 4 倍以上,但日常查詢根本用不到旗艦的智商。
- 模型數量爆炸:OpenRouter 單一平台就掛了 300+ 個模型,每個月還有新模型發布。
- 基礎設施大整併:Stripe 以逾 70 億美元收購 OpenRouter(彭博社報導,尚待正式官宣)、Palo Alto Networks 收購 Portkey(化身 Prisma AIRS)、Mintlify 收購 Helicone(已進入維護模式)——連資本市場都認為「路由層」是 AI 基礎設施裡最有防禦性的位置。
一句話:2026 年還在「所有請求都打 GPT-5.6」的團隊,等於把錢丟進水裡。
先搞清楚:Router 和 Gateway 有什麼不同?
| 比較 | LLM Router(路由器) | LLM Gateway(閘道) |
|---|---|---|
| 核心功能 | 決定每個請求去哪個模型 | 管理請求的認證、快取、配額、日誌、成本、政策 |
| 判斷依據 | 任務類型、能力、成本、延遲、可用性 | 負載均衡、限流、預算、安全政策、fallback |
| 關係 | 可以獨立運作 | 內含路由器,是更完整的控制層 |
簡單記:Gateway 是「機場塔台+海關+航管」,Router 只是其中負責「分派航班」的那一塊。 兩者常被混用,但你要省錢,核心是 Router 的「選模型」邏輯。
主流方案一覽:7 個平台比較表(2026 年 6 月市場實況)
| 平台 | 類型 | 模型數 | 額外延遲 (P50) | 定價 | 自架 | 最適合 |
|---|---|---|---|---|---|---|
| OpenRouter | 託管市集 | 300+ | 40–55ms | 儲值加價 5.5% | ❌ | 個人開發者快速試模型 |
| LiteLLM | 開源自架 | 100+ | 10–20ms | 免費(自架) | ✅ | 用量大、要零加價與資料隱私 |
| RouteLLM | 開源路由演算法 | 自訂對 | 低 | 免費 | ✅ | 強/弱模型對自動路由 |
| Portkey | 託管+自架 | 1,600+ | 10–20ms | 按日誌計費 | 僅閘道 | 企業治理與可觀測性 |
| Requesty | 託管 | 400+ | 8ms(Agent 16ms) | 加價 5% | ❌ | 生產環境路由+快取 |
| Cloudflare AI Gateway | 邊緣 | 12+ 大廠 | <10ms | 按請求計費 | ❌ | Cloudflare 生態系 |
| Kong AI Gateway | 企業 API 平台 | 依供應商 | 依部署 | 企業授權 | ✅ | 已在用 Kong 的團隊 |
⚠️ 2026 年的「避雷名單」:Helicone 被 Mintlify 收購後已停止新功能開發(維護模式),新專案別再選;LiteLLM 今年 3 月發生過 PyPI 供應鏈事件,記得鎖定修補後的版本並輪換金鑰。
實作教學 1:OpenRouter —— 5 分鐘上手的零設定方案
如果你只是想快速試各種模型,OpenRouter 是最短的路徑:註冊、儲值、拿 API key,一個 endpoint 串全部模型。
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek/deepseek-chat",
"messages": [{"role": "user", "content": "用一句話解釋什麼是模型路由"}]
}'
要路由?直接在同一個呼叫指定 models 陣列,OpenRouter 會自動 fallback:
{
"models": ["anthropic/claude-sonnet", "deepseek/deepseek-chat"],
"messages": [{"role": "user", "content": "..."}]
}
缺點:5.5% 加價、無自架、延遲較高(40–55ms)。適合原型與小流量,月支出高了就要考慮自架。
實作教學 2:LiteLLM —— 開源自架閘道(省錢主力)
LiteLLM 是 2026 年開源閘道的首選:免費、100+ 供應商、內建負載均衡/fallback/預算控管,還有 admin dashboard。什麼時候划算? 研究指出:月 API 支出 $50K 時,零加價對比 OpenRouter 的 5.5% 每月省約 $2,750;但月支出低於 $5K 時,維護成本可能超過省下的錢。
Step 1:寫設定檔 config.yaml
model_list:
- model_name: gpt-4o-mini # 對外統一命名
litellm_params:
model: openai/gpt-4o-mini
api_key: os.environ/OPENAI_API_KEY
- model_name: deepseek-chat
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
router_settings:
routing_strategy: usage-based-routing-v2 # 依用量與延遲自動分流
fallbacks:
- {"gpt-4o-mini": ["deepseek-chat"]} # 故障時自動降級
num_retries: 2
cooldown_time: 30
general_settings:
master_key: sk-litellm-master
max_budget: 100 # 全站每月預算上限
Step 2:Docker 啟動
docker run -d --name litellm -p 4000:4000 \
-v $(pwd)/config.yaml:/app/config.yaml \
ghcr.io/berriai/litellm:main-stable \
--config /app/config.yaml
Step 3:你的程式完全不用改——把 base URL 換掉就好:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:4000/v1", api_key="sk-litellm-master")
resp = client.chat.completions.create(
model="deepseek-chat", # 或 gpt-4o-mini,由 router 決定實際後端
messages=[{"role": "user", "content": "今天台灣股市表現如何?"}],
)
這樣一來,fallback、負載均衡、預算、用量追蹤全部集中管理,之後想換供應商只要改 YAML,一行程式都不用動。
實作教學 3:RouteLLM —— 用「強/弱模型對」自動路由
RouteLLM(LM-SYS 出品)是開源路由演算法,訓練好的路由器最高可省 85% 成本,同時維持 95% 的 GPT-4 等級表現(MT Bench 實測),且比同等表現的商業方案便宜 40% 以上。
from routellm.controller import Controller
client = Controller(
routers=["mf"], # mf = Matrix Factorization 路由
strong_model="gpt-4o", # 貴但強
weak_model="openai/gpt-4o-mini", # 便宜但弱(也可換 DeepSeek)
)
先校準「成本閾值」——控制強模型被呼叫的比例:
python -m routellm.calibrate_threshold \
--routers mf --strong-model-pct 0.5 --config config.example.yaml
# 輸出:For 50.0% strong model calls for mf, threshold = 0.11593
然後只要在 model 欄位帶上閾值,RouteLLM 就會自動判斷:
resp = client.chat.completions.create(
model="router-mf-0.11593", # 50% 高難度請求走 GPT-4o
messages=[{"role": "user", "content": "幫我 debug 這段 Rust 程式碼"}],
)
也可以起 OpenAI 相容伺服器,讓任何現有 client 直接接:
python -m routellm.openai_server \
--routers mf --strong-model gpt-4o --weak-model openai/gpt-4o-mini
# 啟動後監聽 http://0.0.0.0:6060
選擇框架:一張決策表搞定
| 你的情境 | 建議方案 |
|---|---|
| 個人開發、想快速比較 300+ 模型 | OpenRouter |
| 月 AI 支出 < $5K、團隊人數少 | OpenRouter + 簡單規則路由(自己寫 if/else) |
| 月支出 $5K–50K、要省 5.5% 加價與控管 | LiteLLM 自架 |
| 固定「強/弱模型對」想全自動分流 | RouteLLM |
| 企業要治理、合規、Guardrails | Portkey(Prisma AIRS)、Requesty 或 Kong |
| 網站已在 Cloudflare / Vercel | 對應的 AI Gateway |
實作最佳實踐與常見坑(社群血淚經驗)
- 先規則、後分類器:先做確定性規則路由(依任務類型、context 長度),配好 telemetry 再考慮上機器學習分類器——否則 router 本身會變成最難 debug 的東西。
- 每條路由都要有 eval set:每個任務類別留 20–50 個代表性 prompt,記錄品質、延遲、錯誤率、成本。別用「感覺」決定閾值。
- Fallback ≠ Retry:暫時性錯誤(timeout、限流)要 retry 同一家;容量或品質失敗才 fallback 到別家模型。
- 設 per-request 預算上限:防止 fallback 鏈無聲無息地把帳單燒爆。
- 別迷信 classifier:有工程師實測後發現,光靠「token 數、需不需要工具、需不需要視覺」三個笨訊號就涵蓋大部分路由需求;語義路由多一跳、多一筆成本,只為了省 30% 本就很便宜的呼叫。
- 注意依賴安全:LiteLLM 曾發生 PyPI 供應鏈事件,務必鎖定修補版本。
延伸閱讀
- Stripe 逾 70 億美元收購 OpenRouter:支付巨頭 5.4 倍溢價卡位 AI 模型路由層,開發者擔心中立性不再(2026)
- LMRouter:用於多供應商模型存取的開源 AI API 路由器
- GPT-5.6 大降價 vs DeepSeek V4:OpenAI 降到 0.2 美元還是比 DeepSeek 貴 4 倍,AI 價格戰白熱化
- MCP 完整教學 2026:什麼是 Model Context Protocol?從架構、三大原語到 Python 實作第一個 MCP Server 的權威指南
資料來源
- RouteLLM 官方 GitHub:lm-sys/RouteLLM README(含 85% 成本節省與 95% GPT-4 表現數據、threshold 校準與 server 範例)
- LiteLLM 官方 GitHub:BerriAI/litellm README(8ms P95 延遲、100+ 供應商、routing strategy 與 Terraform 部署)
- Requesty:Best LLM Routing Platforms Compared (2026)
- Wavect:LLM Gateways Compared 2026
- CloudNuro:AI Gateway Buyer’s Guide 2026
- Inworld Research:《Consumer AI Stack 2026》報告(Wishroll 省 95% 案例)
- Ramp、Entelligence 官方公布數據(2026 年 8 月)
