84,377· 10,928 forks· Python· Apache-2.0开源替代

PaddleOCR:全球領先的多語言OCR工具包與文件AI引擎

PaddlePaddle/PaddleOCR

百度開源的工業級OCR工具,支援100+語言識別與PDF轉Markdown,為RAG應用提供結構化資料,8.4萬星標被Dify等頂級專案整合

成熟度維護活躍,5天前最新提交,296貢獻者,v3.7.0剛釋出(2026年6月),open issues 210個

GitHub 仓库 → HN 讨论 · 19 点 · 3 评论对标:Adobe Acrobat、ABBYY FineReader

项目体检

技术 · Python + PaddlePaddle深度学习框架 + OpenCV图像处理 + Cython性能优化

许可 · Apache-2.0,允许商业使用,需保留版权声明,可自由修改分发

活跃 · 高度活跃:5天前最新提交,296贡献者,2026年6月刚发布v3.7.0版本,月均更新频繁

解決什麼

PaddleOCR 解決的是將非結構化視覺內容(PDF文件、圖片、掃描件)轉化為機器可理解的結構化資料的核心難題。在大語言模型(LLM)時代,RAG(檢索增強生成)應用需要從海量文件中提取文本、表格、公式等元素,傳統OCR工具要麼準確率不足,要麼依賴閉源API成本高昂。PaddleOCR 提供了從場景文字識別(街景、證件、書籍)到複雜文件解析(多欄排版、數學公式、古籍印章)的全鏈路解決方案,輸出 Markdown 或 JSON 格式可直接餵給 LLM,打通了"視覺輸入→結構化資料→智慧應用"的最後一公里。

為何火

三大核心優勢讓 PaddleOCR 成為全球最受歡迎的開源OCR專案之一(8.4萬星標):

  1. 工業級精度與效率平衡:PP-OCRv6 在檢測準確率上比 v5 提升 4.6%,識別提升 5.1%,僅用 34.5M 引數就超越 Qwen3-VL-235B 等巨型視覺語言模型,CPU 推理速度提升 5.2 倍,真正做到"小而美"適合生產環境。

  2. LLM 生態深度繫結:被 Dify(4萬星AI應用開發平臺)、RAGFlow(知識庫問答系統)、Cherry Studio 等頭部開源專案選為預設 OCR 引擎,形成了"文件解析→向量化→智慧問答"的標準工作流,開發者無需重複造輪。

  3. 真正的多語言能力:單模型覆蓋中英日+46種拉丁語系,無需切換模型即可處理混合語言文件,這在跨國企業文件處理場景中是剛需(據公開資料,許多商業OCR工具需為不同語言購買獨立授權)。

核心功能

智慧文件解析(面向LLM)

  • PaddleOCR-VL-1.6 模型(0.9B 引數)在 OmniDocBench 基準測試達 96.3% 準確率,擅長古籍、生僻字、印章、圖表識別,直接輸出 Markdown/JSON 結構化格式
  • PP-StructureV3 提供細粒度座標資訊(表格單元格、文本框位置),適合需要精確定位的場景如發票稽核、合同比對

通用場景文字識別

  • PP-OCRv6 支援 100+ 語言,涵蓋自然場景(街景招牌)、證件(身份證護照)、工業零件標識等複雜環境
  • 提供輕量(mobile)、標準(server)、超輕量(slim)三檔模型,開發者可根據裝置效能靈活選擇

開發者工具鏈

  • 一鍵安裝:pip install paddleocr,三行程式碼即可呼叫
  • 支援 NVIDIA GPU、Intel CPU、崑崙芯 XPU 等多種硬體後端
  • 提供資料標註工具 PPOCRLabel,可構建自定義訓練集持續最佳化模型

安裝

基礎安裝(需 Python 3.8-3.12):

pip install paddleocr

快速驗證:

from paddleocr import PaddleOCR
ocr = PaddleOCR(use_angle_cls=True, lang='ch')  # 中文+方向分類
result = ocr.ocr('test.jpg', cls=True)

進階配置:

  • 使用 GPU 加速需預裝 PaddlePaddle GPU 版:pip install paddlepaddle-gpu
  • 離線部署需下載預訓練模型(約 10MB-50MB 不等),官方提供模型庫連結
  • 文件解析功能需額外安裝:pip install "paddleocr[doc]"

注意:首次執行會自動下載模型檔案,國內使用者通常無需梯子(百度雲映象),但建議配置 MODEL_HOME 環境變數指定模型快取路徑。

適合誰

  1. RAG 應用開發者:需要將 PDF 知識庫轉為向量資料庫可檢索格式,PaddleOCR 的 Markdown 輸出可無縫對接 LangChain、LlamaIndex 等框架
  2. 企業數字化團隊:處理歷史檔案掃描件、合同發票批次識別,本地部署避免資料上傳第三方 API 的合規風險
  3. 多語言內容平臺:電商網站商品圖文提取、國際新聞媒體多語種字幕生成,單模型搞定省去多套系統維護成本
  4. AI 應用整合商:已有成熟案例如 Dify 用其構建智慧客服、RAGFlow 實現文件問答,可直接參考整合方案

不太適合:純英文場景且對延遲極度敏感的即時應用(Tesseract 可能更輕量),或需要手寫體識別為主的場景(PaddleOCR 側重印刷體)。

社群評價

基於 Hacker News 討論(19 點贊,3 條評論):

熱度與認可:作為亞洲團隊主導的專案,在英文技術社群獲得關注,網友承認其"支援 100 種語言"的技術實力,依賴清單清晰(requirements.txt 可查)。

爭議點 — 文件語言障礙:有開發者指出"安裝頁面只有幾行 pip 命令,深層文件跳轉到中文網站後迷失",反映出英文文件深度不足的問題。雖然 GitHub README 提供多語言版本,但核心技術細節(如模型架構、訓練資料集說明)更多以中文呈現,非中文使用者需藉助翻譯工具或社群問答。

正面觀點:程式碼示例簡潔,requirements.txt 依賴透明(主要是 OpenCV、Pillow、NumPy 等常見庫),對熟悉 Python 生態的開發者友好。專案活躍度高(5 天前仍有提交),版本迭代快速(v6 剛釋出),顯示出持續投入。

負面觀點:文件組織偏向"快速上手"而非"系統學習",缺少架構設計文件和效能調優指南的英文版,增加了非中文使用者的學習曲線。

選型對比

vs Adobe Acrobat / ABBYY FineReader(商業工具)

  • 成本:PaddleOCR 開源免費且可商用(Apache 2.0),商業工具年費數千至數萬元
  • 準確率:在中文、日文等亞洲語言上 PaddleOCR 具備優勢,拉丁語系場景 ABBYY 歷史積累更深
  • 部署:PaddleOCR 支援私有化部署保護資料隱私,商業工具多為 SaaS 或桌面端
  • 易用性:商業工具 GUI 更友好,PaddleOCR 需程式設計整合但靈活性更高

vs Tesseract(經典開源 OCR)

  • 多語言:Tesseract 需為每種語言下載獨立訓練資料,PaddleOCR 單模型覆蓋 50 語言更便捷
  • 準確率:PaddleOCR 在複雜場景(傾斜、模糊、多欄)表現更優,Tesseract 適合高質量掃描件
  • 效能:PaddleOCR 針對深度學習最佳化,GPU 加速明顯,Tesseract 主要依賴 CPU 傳統演算法

vs 雲服務 API(阿里雲、騰訊雲 OCR)

  • 隱私:PaddleOCR 本地執行無資料洩露風險,雲 API 需上傳檔案
  • 成本:雲 API 按呼叫量計費,高頻場景下 PaddleOCR 一次性部署成本更低
  • 定製:PaddleOCR 可用自有資料微調模型,雲 API 為通用模型難以適配特殊行業

已知坑

  1. 首次執行模型下載慢:預設從 PaddlePaddle 官方源下載,海外使用者可能遇到網路問題,建議提前手動下載模型檔案並配置本地路徑。

  2. 記憶體佔用:載入完整模型(檢測+識別+方向分類)約需 500MB-1GB 記憶體,樹莓派等低配裝置建議使用 mobile 輕量版或關閉方向分類(use_angle_cls=False)。

  3. PDF 解析依賴:文件解析功能需安裝額外的 pdf2imagepoppler 等系統庫,Windows 使用者需手動配置 Poppler 路徑,Linux 通過 apt install poppler-utils 解決。

  4. 英文文件滯後:如社群所反饋,高階特性(如自定義訓練、模型剪枝)的英文教程不完整,非中文使用者需結合 GitHub Issues 和中文文件機翻學習。

  5. 表格識別侷限:雖然支援表格結構化輸出,但對無邊框表格、巢狀表格的識別準確率仍有提升空間,複雜財務報表建議人工校驗。

  6. License 相容性:Apache 2.0 允許商用,但若整合到專有軟體需保留原專案版權宣告,且不可使用 "PaddlePaddle" 商標做推廣(據協議條款)。

來源: GitHub 倉庫 + Hacker News 社群討論

安装方式:pip