Mistral OCR 4.1 是 Mistral AI 2026 年 8 月推出的頂級文件解析模型:每 1,000 頁僅 4 美元(Batch API 2 美元),支援 170 種語言、13 種區塊分類與無漂移邊界框,OlmOCRBench 達 85.2 分,是目前性價比最高的雲端 OCR API;但若你的需求是「大量繁體中文文件轉 Markdown 進 RAG」,開源的 MinerU 仍是中文場景的首選。
把掃描 PDF 變成乾淨的 Markdown,是 2026 年做 RAG(檢索增強生成)的第一道關卡。過去我們介紹過微軟的 MarkItDown、MinerU 與 Marker,今天的主角是雲端派的強者——Mistral OCR 4.1,以及它和開源工具之間的選擇題。
Mistral OCR 4.1 是什麼?
Mistral OCR 4.1 是 Mistral AI 的專業文件智能模型,2026 年 8 月發布,是同年 6 月 OCR 4 的定向升級版。它跟一般 OCR 最大的不同是:不只認字,還懂版面結構。
它的三個核心能力:
- 精確邊界框(Bounding Box):每個文字區塊、圖片、表格都有像素級座標。4.1 版特別修正了「邊界框漂移」問題——在滿是螢光筆、印章、邊欄註記的複雜頁面上,邊界框不再偏移幾像素或把相鄰段落混在一起
- 13 種區塊分類標籤:自動辨識
title、text、list、table、image、equation、caption、code、references、aside_text、header、footer、signature,並按閱讀順序輸出 - 信心分數(Confidence Scores):支援 page / block / word 三種粒度,低品質掃描件可以在進入 RAG 索引前就被自動攔截
4.1 改進了什麼?
| 改進項目 | OCR 4(舊版) | OCR 4.1(新版) |
|---|---|---|
| 邊界框定位 | 密集頁面會漂移數像素 | 零漂移,精準貼合單一元素 |
| 嵌套圖片 | 圖中圖會輸出重複嵌套框 | 一個元素只回一個框 |
| 參考文獻頁 | 整個列表壓成單一區塊 | 每條引用獨立一個框 |
| 複雜頁面漏辨識 | 偶爾漏區塊 | 漏辨識率明顯下降 |
| 引號符號 | 雙引號被誤轉成單引號 | 原樣保留 |
| 複選框 / RTL 表格 | 樣式支援有限 | 更多樣式、RTL 定位更準 |
定價:按頁計費,不是按 Token
Mistral OCR 系列採按頁計費,成本好預測:
| 模式 | 價格(USD) | 價格(EUR) | 包含內容 |
|---|---|---|---|
| 標準 OCR | $4 / 1,000 頁 | €3.50 | 文字、邊界框、區塊分類、信心分數 |
| Batch API | $2 / 1,000 頁 | 約 €1.75 | 同上,非同步處理享 5 折 |
| Document AI | $5 / 1,000 頁 | €4.38 | OCR + 依 JSON Schema 輸出結構化資料 |
實例:每月處理 100,000 頁,標準 API 花費 $400,用 Batch API 只要 $200。Google Document AI 同級功能約 $5/千頁,Mistral 標準層更便宜。
💡 「已標註頁面」(Annotated Pages)是什麼? 當你在 API 請求中帶了
document_annotation_format或bbox_annotation_format自訂 JSON Schema,要求模型邊 OCR 邊把欄位對齊成結構化 JSON(例如直接把發票變成資料庫欄位),計費就會切換到 Document AI 的 $5/千頁費率。
API 串接教學(Python)
import os
from mistralai.client import Mistral
# 金鑰設在環境變數 MISTRAL_API_KEY
client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])
# mistral-ocr-latest 別名自動指向最新版(目前就是 4.1)
ocr_response = client.ocr.process(
model="mistral-ocr-latest",
document={
"type": "document_url",
"document_url": "https://arxiv.org/pdf/2201.04234"
},
table_format="html", # 表格輸出:null / markdown / html
include_image_base64=True, # 是否回傳提取圖片的 base64
)
print(ocr_response.pages[0].markdown)
其他實用參數:
include_blocks=True:每頁回傳blocks陣列(段落級邊界框 + 區塊標籤)confidence_scores_granularity="word":字詞級信心分數pages="0,2-4":只處理指定頁碼- 單檔上限 50 MB、最多 1,000 頁
與開源 OCR 工具全面比較
這是多數人最關心的部分。我把 Mistral OCR 4.1 和四個主流開源方案攤開來比:
| 項目 | Mistral OCR 4.1 | MinerU | Marker | Docling |
|---|---|---|---|---|
| OlmOCRBench | 85.2 | 72.7 | 76.0 | - |
| OmniDocBench(中文) | 表現優異 | 最佳之一 | 中上 | 差(中文誤差率高) |
| 中文支援 | 優異(170 語言) | 極佳(繁簡混排特化) | 良好 | 差(閱讀順序易亂) |
| 表格解析 | 強(HTML/Markdown) | 強(TEDS 78.6 EN) | 中 | 強(TableFormer) |
| 公式轉 LaTeX | 佳 | 最強(UniMERNet) | 佳 | 弱 |
| 邊界框 + 區塊分類 | ✅ 13 種標籤 + 信心分數 | 部分 | 部分 | ✅(JSON 完整溯源) |
| 成本 | $4 / 1,000 頁 | 免費(自架) | 免費(自架) | 免費(自架) |
| 部署方式 | 雲端 API / 企業容器 | 本地 GPU/CPU | 本地 GPU/CPU | 本地(MIT 授權) |
| 授權 | 商業 API | MinerU 授權(大公司需商用授權) | Apache 2.0 + OpenRAIL-M | MIT(最寬鬆) |
| 速度 | 最高 2,000 頁/分鐘 | 0.54 頁/秒(B200) | 2.9 頁/秒 | 中等 |
另外兩個常被提起的工具順帶說明:
- MarkItDown(微軟):多格式轉換的「膠水工具」,簡單易裝,但 PDF 轉換僅做文字流提取,完全丟失標題層級與表格結構(OpenDataLoader 評測倒數第二),適合處理乾淨的 Office 文件,不適合複雜 PDF
- Tesseract:經典開源 OCR,僅輸出無排版純文字,手寫與雙欄版面幾乎無法應付,適合最簡單的純文字需求
怎麼選?四種情境直接對號入座
graph TD
A[需要解析 PDF 文件] --> B{文件類型}
B -->|掃描件/圖片/多語言| C{要品質還是要省錢?}
C -->|雲端頂級品質| D[Mistral OCR 4.1<br>$4/千頁]
C -->|免費自架| E[MinerU 或 Marker]
B -->|大量繁體中文| F[MinerU<br>中文特化最強]
B -->|發票/表單要結構化欄位| D
B -->|企業內網/隱私合規| G[Docling<br>MIT 授權可離線]
B -->|Office 文件快速轉換| H[MarkItDown]- RAG 視覺引用 + 發票結構化 → Mistral OCR 4.1:無漂移邊界框讓引用精準到句子,自訂 JSON Schema 直接把發票變成資料庫欄位,是雲端派的首選
- 大量繁體中文文件進 RAG → MinerU:OmniDocBench 中文評測最佳,自動過濾頁首頁尾、表格轉 HTML、重建閱讀順序,為 RAG 提供最乾淨的繁中語料;追求更高精度可試試 1.7B 的 dots.ocr
- 企業內部、隱私與合規優先 → Docling:MIT 授權、可完全離線(air-gapped),表格重建一流;缺點是中文支援差
- 不想花錢、文件以英文為主 → Marker:Apache 2.0,公式轉 LaTeX 漂亮,中英混排表現良好
台灣開發者的實務建議
如果你的場景是「繁體中文 PDF 轉 Markdown 進 RAG」,我的建議順序是:
- 預算允許、要最高品質:Mistral OCR 4.1 直接串 API,$4/千頁的成本對商業專案來說很低
- 長期自架、中文量大:MinerU 是繁中場景最強開源選項,但要注意授權(年營收 > $20M 需商用授權)與 PyMuPDF 相依的 AGPL 限制
- 資料不能出內網:Docling(英文)或 MinerU(中文)二選一,用 Docker 部署在內網
一句話總結:要省事選 Mistral OCR 4.1,要中文選 MinerU,要合規選 Docling。
延伸閱讀
- MarkItDown 教學:Microsoft 官方 PDF、Office 轉 LLM 友善 Markdown 完全指南 (2026)
- MinerU 教學:PDF 與電子書轉 Markdown 的開源工具
- Marker-pdf 教學:用 Python 將 PDF 轉成 Markdown
- 2026 精選 350+ AI 開源專案完整地圖:Agent、LLM、RAG 工具實戰推薦
資料來源
- Mistral 官方文件:OCR 4.1、OCR Processor
- Mistral AI(X):OCR 4.1 發布公告
- Mistral OCR 4.1: Precise Bounding Boxes on Busy, Marked-Up Pages
- Docling vs Marker vs MinerU: The Ultimate Open-Source PDF Parser Benchmark (2026)
- Best Open Source PDF to Markdown Tools (2026)
- Self-Host Document Intelligence on GPU Cloud (2026)
