Mistral OCR 4.1 完整教學:每千頁 4 美元的雲端 OCR,與 MinerU、Marker、Docling 開源工具怎麼選?(2026)

Mistral OCR 4.1 是 Mistral AI 2026 年 8 月推出的文件解析模型,主打無漂移邊界框、13 種區塊分類與信心分數,每 1,000 頁只要 4 美元(Batch API 2 美元)。本文完整教學 API 串接方式,並與 MinerU、Marker、Docling、MarkItDown、Tesseract 等開源工具比較準確率、中文支援、成本與適用場景,教你依需求選對工具。

  • Dennis
  • 6 分鐘閱讀
Mistral OCR 4.1 完整教學:每千頁 4 美元的雲端 OCR,與 MinerU、Marker、Docling 開源工具怎麼選?(2026)

Mistral OCR 4.1 是 Mistral AI 2026 年 8 月推出的頂級文件解析模型:每 1,000 頁僅 4 美元(Batch API 2 美元),支援 170 種語言、13 種區塊分類與無漂移邊界框,OlmOCRBench 達 85.2 分,是目前性價比最高的雲端 OCR API;但若你的需求是「大量繁體中文文件轉 Markdown 進 RAG」,開源的 MinerU 仍是中文場景的首選。

把掃描 PDF 變成乾淨的 Markdown,是 2026 年做 RAG(檢索增強生成)的第一道關卡。過去我們介紹過微軟的 MarkItDownMinerUMarker,今天的主角是雲端派的強者——Mistral OCR 4.1,以及它和開源工具之間的選擇題。

Mistral OCR 4.1 是什麼?

Mistral OCR 4.1 是 Mistral AI 的專業文件智能模型,2026 年 8 月發布,是同年 6 月 OCR 4 的定向升級版。它跟一般 OCR 最大的不同是:不只認字,還懂版面結構

它的三個核心能力:

  1. 精確邊界框(Bounding Box):每個文字區塊、圖片、表格都有像素級座標。4.1 版特別修正了「邊界框漂移」問題——在滿是螢光筆、印章、邊欄註記的複雜頁面上,邊界框不再偏移幾像素或把相鄰段落混在一起
  2. 13 種區塊分類標籤:自動辨識 titletextlisttableimageequationcaptioncodereferencesaside_textheaderfootersignature,並按閱讀順序輸出
  3. 信心分數(Confidence Scores):支援 page / block / word 三種粒度,低品質掃描件可以在進入 RAG 索引前就被自動攔截

4.1 改進了什麼?

改進項目OCR 4(舊版)OCR 4.1(新版)
邊界框定位密集頁面會漂移數像素零漂移,精準貼合單一元素
嵌套圖片圖中圖會輸出重複嵌套框一個元素只回一個框
參考文獻頁整個列表壓成單一區塊每條引用獨立一個框
複雜頁面漏辨識偶爾漏區塊漏辨識率明顯下降
引號符號雙引號被誤轉成單引號原樣保留
複選框 / RTL 表格樣式支援有限更多樣式、RTL 定位更準

定價:按頁計費,不是按 Token

Mistral OCR 系列採按頁計費,成本好預測:

模式價格(USD)價格(EUR)包含內容
標準 OCR$4 / 1,000 頁€3.50文字、邊界框、區塊分類、信心分數
Batch API$2 / 1,000 頁約 €1.75同上,非同步處理享 5 折
Document AI$5 / 1,000 頁€4.38OCR + 依 JSON Schema 輸出結構化資料

實例:每月處理 100,000 頁,標準 API 花費 $400,用 Batch API 只要 $200。Google Document AI 同級功能約 $5/千頁,Mistral 標準層更便宜。

💡 「已標註頁面」(Annotated Pages)是什麼? 當你在 API 請求中帶了 document_annotation_formatbbox_annotation_format 自訂 JSON Schema,要求模型邊 OCR 邊把欄位對齊成結構化 JSON(例如直接把發票變成資料庫欄位),計費就會切換到 Document AI 的 $5/千頁費率。

API 串接教學(Python)

import os
from mistralai.client import Mistral

# 金鑰設在環境變數 MISTRAL_API_KEY
client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

# mistral-ocr-latest 別名自動指向最新版(目前就是 4.1)
ocr_response = client.ocr.process(
    model="mistral-ocr-latest",
    document={
        "type": "document_url",
        "document_url": "https://arxiv.org/pdf/2201.04234"
    },
    table_format="html",          # 表格輸出:null / markdown / html
    include_image_base64=True,    # 是否回傳提取圖片的 base64
)

print(ocr_response.pages[0].markdown)

其他實用參數:

  • include_blocks=True:每頁回傳 blocks 陣列(段落級邊界框 + 區塊標籤)
  • confidence_scores_granularity="word":字詞級信心分數
  • pages="0,2-4":只處理指定頁碼
  • 單檔上限 50 MB、最多 1,000 頁

與開源 OCR 工具全面比較

這是多數人最關心的部分。我把 Mistral OCR 4.1 和四個主流開源方案攤開來比:

項目Mistral OCR 4.1MinerUMarkerDocling
OlmOCRBench85.272.776.0-
OmniDocBench(中文)表現優異最佳之一中上差(中文誤差率高)
中文支援優異(170 語言)極佳(繁簡混排特化)良好差(閱讀順序易亂)
表格解析強(HTML/Markdown)強(TEDS 78.6 EN)強(TableFormer)
公式轉 LaTeX最強(UniMERNet)
邊界框 + 區塊分類✅ 13 種標籤 + 信心分數部分部分✅(JSON 完整溯源)
成本$4 / 1,000 頁免費(自架)免費(自架)免費(自架)
部署方式雲端 API / 企業容器本地 GPU/CPU本地 GPU/CPU本地(MIT 授權)
授權商業 APIMinerU 授權(大公司需商用授權)Apache 2.0 + OpenRAIL-MMIT(最寬鬆)
速度最高 2,000 頁/分鐘0.54 頁/秒(B200)2.9 頁/秒中等

另外兩個常被提起的工具順帶說明:

  • MarkItDown(微軟):多格式轉換的「膠水工具」,簡單易裝,但 PDF 轉換僅做文字流提取,完全丟失標題層級與表格結構(OpenDataLoader 評測倒數第二),適合處理乾淨的 Office 文件,不適合複雜 PDF
  • Tesseract:經典開源 OCR,僅輸出無排版純文字,手寫與雙欄版面幾乎無法應付,適合最簡單的純文字需求

怎麼選?四種情境直接對號入座

graph TD
    A[需要解析 PDF 文件] --> B{文件類型}
    B -->|掃描件/圖片/多語言| C{要品質還是要省錢?}
    C -->|雲端頂級品質| D[Mistral OCR 4.1<br>$4/千頁]
    C -->|免費自架| E[MinerU 或 Marker]
    B -->|大量繁體中文| F[MinerU<br>中文特化最強]
    B -->|發票/表單要結構化欄位| D
    B -->|企業內網/隱私合規| G[Docling<br>MIT 授權可離線]
    B -->|Office 文件快速轉換| H[MarkItDown]
  1. RAG 視覺引用 + 發票結構化Mistral OCR 4.1:無漂移邊界框讓引用精準到句子,自訂 JSON Schema 直接把發票變成資料庫欄位,是雲端派的首選
  2. 大量繁體中文文件進 RAGMinerU:OmniDocBench 中文評測最佳,自動過濾頁首頁尾、表格轉 HTML、重建閱讀順序,為 RAG 提供最乾淨的繁中語料;追求更高精度可試試 1.7B 的 dots.ocr
  3. 企業內部、隱私與合規優先Docling:MIT 授權、可完全離線(air-gapped),表格重建一流;缺點是中文支援差
  4. 不想花錢、文件以英文為主Marker:Apache 2.0,公式轉 LaTeX 漂亮,中英混排表現良好

台灣開發者的實務建議

如果你的場景是「繁體中文 PDF 轉 Markdown 進 RAG」,我的建議順序是:

  1. 預算允許、要最高品質:Mistral OCR 4.1 直接串 API,$4/千頁的成本對商業專案來說很低
  2. 長期自架、中文量大:MinerU 是繁中場景最強開源選項,但要注意授權(年營收 > $20M 需商用授權)與 PyMuPDF 相依的 AGPL 限制
  3. 資料不能出內網:Docling(英文)或 MinerU(中文)二選一,用 Docker 部署在內網

一句話總結:要省事選 Mistral OCR 4.1,要中文選 MinerU,要合規選 Docling。

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。