LLM 模型路由(Model Routing)完整教學 2026:OpenRouter、LiteLLM、RouteLLM 比較與實作,AI 成本最高砍 95%

什麼是 LLM 模型路由?為什麼 2026 年每個 AI 開發者都該學?本文用真實數據比較 OpenRouter、LiteLLM、RouteLLM、Portkey 等主流方案,附 Docker 部署與 Python 實作範例,教你用路由把 AI 帳單砍掉 30-95%,同時維持回答品質。

  • Dennis
  • 6 分鐘閱讀
LLM 模型路由(Model Routing)完整教學 2026:OpenRouter、LiteLLM、RouteLLM 比較與實作,AI 成本最高砍 95%

AEO 速答LLM 模型路由(Model Routing) 是在每個 AI 請求進來時,自動幫你決定「這題該交給哪個模型」的機制——簡單問題丟便宜模型、難題才呼叫旗艦模型。實測最高可省下 95% 推理成本(Wishroll 案例),且維持 95% 的 GPT-4 等級品質(RouteLLM 官方數據)。

為什麼 2026 年,你必須學會模型路由?

先看三個真實案例:

公司/產品做法結果
Wishroll(消費 AI)任務拆解+模型路由推理成本省 95%,19 天衝到 100 萬用戶
Ramp Router路由+100+ 項優化自家 LLM 帳單省 30%,每月路由 2.75T tokens、成功率 99.9%
Entelligence Router路由到 Terminal-Bench 2.171/89 題贏過 Claude Opus 5(63/89),總花費 $65.75 vs $190.62(省 65.5%

背後的理由很簡單:2026 年的模型市場已經「碎片化」到不路由不行——

  • 價格差距極大:旗艦閉源模型(GPT-5.6、Claude Opus)單價是開源模型(DeepSeek、GLM)的 4 倍以上,但日常查詢根本用不到旗艦的智商。
  • 模型數量爆炸:OpenRouter 單一平台就掛了 300+ 個模型,每個月還有新模型發布。
  • 基礎設施大整併:Stripe 以逾 70 億美元收購 OpenRouter(彭博社報導,尚待正式官宣)、Palo Alto Networks 收購 Portkey(化身 Prisma AIRS)、Mintlify 收購 Helicone(已進入維護模式)——連資本市場都認為「路由層」是 AI 基礎設施裡最有防禦性的位置。

一句話:2026 年還在「所有請求都打 GPT-5.6」的團隊,等於把錢丟進水裡。

先搞清楚:Router 和 Gateway 有什麼不同?

比較LLM Router(路由器)LLM Gateway(閘道)
核心功能決定每個請求去哪個模型管理請求的認證、快取、配額、日誌、成本、政策
判斷依據任務類型、能力、成本、延遲、可用性負載均衡、限流、預算、安全政策、fallback
關係可以獨立運作內含路由器,是更完整的控制層

簡單記:Gateway 是「機場塔台+海關+航管」,Router 只是其中負責「分派航班」的那一塊。 兩者常被混用,但你要省錢,核心是 Router 的「選模型」邏輯。

主流方案一覽:7 個平台比較表(2026 年 6 月市場實況)

平台類型模型數額外延遲 (P50)定價自架最適合
OpenRouter託管市集300+40–55ms儲值加價 5.5%個人開發者快速試模型
LiteLLM開源自架100+10–20ms免費(自架)用量大、要零加價與資料隱私
RouteLLM開源路由演算法自訂對免費強/弱模型對自動路由
Portkey託管+自架1,600+10–20ms按日誌計費僅閘道企業治理與可觀測性
Requesty託管400+8ms(Agent 16ms)加價 5%生產環境路由+快取
Cloudflare AI Gateway邊緣12+ 大廠<10ms按請求計費Cloudflare 生態系
Kong AI Gateway企業 API 平台依供應商依部署企業授權已在用 Kong 的團隊

⚠️ 2026 年的「避雷名單」:Helicone 被 Mintlify 收購後已停止新功能開發(維護模式),新專案別再選;LiteLLM 今年 3 月發生過 PyPI 供應鏈事件,記得鎖定修補後的版本並輪換金鑰。

實作教學 1:OpenRouter —— 5 分鐘上手的零設定方案

如果你只是想快速試各種模型,OpenRouter 是最短的路徑:註冊、儲值、拿 API key,一個 endpoint 串全部模型。

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek/deepseek-chat",
    "messages": [{"role": "user", "content": "用一句話解釋什麼是模型路由"}]
  }'

要路由?直接在同一個呼叫指定 models 陣列,OpenRouter 會自動 fallback:

{
  "models": ["anthropic/claude-sonnet", "deepseek/deepseek-chat"],
  "messages": [{"role": "user", "content": "..."}]
}

缺點:5.5% 加價、無自架、延遲較高(40–55ms)。適合原型與小流量,月支出高了就要考慮自架。

實作教學 2:LiteLLM —— 開源自架閘道(省錢主力)

LiteLLM 是 2026 年開源閘道的首選:免費、100+ 供應商、內建負載均衡/fallback/預算控管,還有 admin dashboard。什麼時候划算? 研究指出:月 API 支出 $50K 時,零加價對比 OpenRouter 的 5.5% 每月省約 $2,750;但月支出低於 $5K 時,維護成本可能超過省下的錢。

Step 1:寫設定檔 config.yaml

model_list:
  - model_name: gpt-4o-mini          # 對外統一命名
    litellm_params:
      model: openai/gpt-4o-mini
      api_key: os.environ/OPENAI_API_KEY
  - model_name: deepseek-chat
    litellm_params:
      model: deepseek/deepseek-chat
      api_key: os.environ/DEEPSEEK_API_KEY

router_settings:
  routing_strategy: usage-based-routing-v2   # 依用量與延遲自動分流
  fallbacks:
    - {"gpt-4o-mini": ["deepseek-chat"]}     # 故障時自動降級
  num_retries: 2
  cooldown_time: 30

general_settings:
  master_key: sk-litellm-master
  max_budget: 100                            # 全站每月預算上限

Step 2:Docker 啟動

docker run -d --name litellm -p 4000:4000 \
  -v $(pwd)/config.yaml:/app/config.yaml \
  ghcr.io/berriai/litellm:main-stable \
  --config /app/config.yaml

Step 3:你的程式完全不用改——把 base URL 換掉就好:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:4000/v1", api_key="sk-litellm-master")
resp = client.chat.completions.create(
    model="deepseek-chat",   # 或 gpt-4o-mini,由 router 決定實際後端
    messages=[{"role": "user", "content": "今天台灣股市表現如何?"}],
)

這樣一來,fallback、負載均衡、預算、用量追蹤全部集中管理,之後想換供應商只要改 YAML,一行程式都不用動

實作教學 3:RouteLLM —— 用「強/弱模型對」自動路由

RouteLLM(LM-SYS 出品)是開源路由演算法,訓練好的路由器最高可省 85% 成本,同時維持 95% 的 GPT-4 等級表現(MT Bench 實測),且比同等表現的商業方案便宜 40% 以上。

from routellm.controller import Controller

client = Controller(
    routers=["mf"],                     # mf = Matrix Factorization 路由
    strong_model="gpt-4o",              # 貴但強
    weak_model="openai/gpt-4o-mini",    # 便宜但弱(也可換 DeepSeek)
)

先校準「成本閾值」——控制強模型被呼叫的比例:

python -m routellm.calibrate_threshold \
  --routers mf --strong-model-pct 0.5 --config config.example.yaml
# 輸出:For 50.0% strong model calls for mf, threshold = 0.11593

然後只要在 model 欄位帶上閾值,RouteLLM 就會自動判斷:

resp = client.chat.completions.create(
    model="router-mf-0.11593",          # 50% 高難度請求走 GPT-4o
    messages=[{"role": "user", "content": "幫我 debug 這段 Rust 程式碼"}],
)

也可以起 OpenAI 相容伺服器,讓任何現有 client 直接接:

python -m routellm.openai_server \
  --routers mf --strong-model gpt-4o --weak-model openai/gpt-4o-mini
# 啟動後監聽 http://0.0.0.0:6060

選擇框架:一張決策表搞定

你的情境建議方案
個人開發、想快速比較 300+ 模型OpenRouter
月 AI 支出 < $5K、團隊人數少OpenRouter + 簡單規則路由(自己寫 if/else)
月支出 $5K–50K、要省 5.5% 加價與控管LiteLLM 自架
固定「強/弱模型對」想全自動分流RouteLLM
企業要治理、合規、GuardrailsPortkey(Prisma AIRS)、Requesty 或 Kong
網站已在 Cloudflare / Vercel對應的 AI Gateway

實作最佳實踐與常見坑(社群血淚經驗)

  1. 先規則、後分類器:先做確定性規則路由(依任務類型、context 長度),配好 telemetry 再考慮上機器學習分類器——否則 router 本身會變成最難 debug 的東西。
  2. 每條路由都要有 eval set:每個任務類別留 20–50 個代表性 prompt,記錄品質、延遲、錯誤率、成本。別用「感覺」決定閾值。
  3. Fallback ≠ Retry:暫時性錯誤(timeout、限流)要 retry 同一家;容量或品質失敗才 fallback 到別家模型。
  4. 設 per-request 預算上限:防止 fallback 鏈無聲無息地把帳單燒爆。
  5. 別迷信 classifier:有工程師實測後發現,光靠「token 數、需不需要工具、需不需要視覺」三個笨訊號就涵蓋大部分路由需求;語義路由多一跳、多一筆成本,只為了省 30% 本就很便宜的呼叫。
  6. 注意依賴安全:LiteLLM 曾發生 PyPI 供應鏈事件,務必鎖定修補版本。

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友