模型 / 資料集
opendatalab/MinerU avatar
opendatalab/MinerU

MinerU:把複雜文件整理成可檢索的結構

將 PDF、Office 文件與圖片轉換為可供 LLM 使用的 Markdown 或 JSON,採 VLM+OCR 雙引擎,涵蓋 109 種語言、公式與複雜版面。

79,979 個 Star6,680 個 ForkPython授權條款依專案而異

秒懂

它是什麼?
聚焦 PDF、Office、OCR、VLM 與多種部署後端,說明文件解析輸出和硬體取捨。
適合誰用?
MinerU:把複雜文件整理成可檢索的結構 適合需要 README 所列能力並能自行管理依賴與權限的團隊;不適合把文件中的宣稱直接當成生產保證的使用者。先依該專案的安裝命令與設定檔完成一次最小流程,檢查專案專屬輸出、錯誤記錄和授權條件,再決定是否擴大部署。
可以商用嗎?
請先確認。這個儲存庫使用的授權不在我們自動分類的範圍內,商用前請閱讀儲存庫中的 LICENSE 檔案。
還在維護嗎?
有在維護。儲存庫最近一次提交在 1 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

從 InternLM 預訓練到獨立解析器

MinerU 是一個文件解析工具,可將 PDF、圖片、DOCX、PPTX 和 XLSX 檔案轉換為機器可讀的 Markdown 和 JSON,供下游檢索、抽取和處理使用。根據 README,它誕生於 InternLM 的預訓練過程中,當時團隊需要解決科學文獻中的符號轉換問題。該專案由 OpenDataLab 託管在 GitHub 上,截至編寫時已獲得超過 76,000 個 Star 和 6,400 個 Fork。README 稱其為面向 LLM、RAG 和 Agent 工作流的高精度解析引擎,但也指出與商業產品相比它仍然年輕,並鼓勵使用者在結果不如預期時提交附帶樣本檔案的 issue。專案的文件站點和一個零安裝網頁版在 README 中有連結,同時還有 Discord 和微信社群頻道。

在 opendatalab-mineru-deep-analysis 的實際閱讀中,應把 README 的名詞和可執行入口對上。先確認套件或原始碼的安裝方式,再找出設定值從哪個檔案或環境變數讀取;執行後記錄終端輸出、產物名稱、錯誤訊息與程序是否正常結束。若專案處理文件,就比較原始檔和輸出中的段落、表格、圖片或座標;若專案處理代理,就觀察工具呼叫、工作流節點、權限提示與事件記錄。這些觀察能把 README 的功能清單落到 opendatalab-mineru-deep-analysis 自己的輸入和輸出,未被來源說明的性能數字不作推論。

MinerU 提取和保留的內容

解析器支援 PDF、圖片、DOCX、PPTX 和 XLSX 輸入。它會移除頁首、頁尾、腳註和頁碼以保持語義連貫,並按照人類閱讀順序輸出文字,適用於單欄、多欄和複雜版面。它保留文件結構(如標題、段落、清單),並提取圖像、圖像描述、表格、表格標題和腳註。公式會自動轉換為 LaTeX,表格轉換為 HTML。OCR 引擎能自動偵測掃描版和亂碼 PDF,並支援 109 種語言的辨識。輸出格式包括多模態和 NLP Markdown、按閱讀順序排序的 JSON,以及豐富的中間格式。README 還提到版面視覺化和跨度視覺化等選項,用於確認輸出品質。

後端、硬體與準確率權衡

MinerU 提供三種推理後端:pipeline、vlm-engine 和 hybrid-engine。pipeline 後端被描述為快速穩定、無幻覺,可在 CPU 或 GPU 上執行,最低 4GB 顯存。vlm 和 hybrid 引擎至少需要 8GB 顯存,面向更高準確率,其中 hybrid 提供 medium 解析強度,以較小的準確率差異換取速度。README 報告了 OmniDocBench v1.6 的整體分數:pipeline 為 86.47,hybrid 和 vlm 引擎為 95.39(high)或 95.26(medium)。純 CPU 支援僅適用於 pipeline 和 http-client 變體,後者用於連接相容 OpenAI 的伺服器。支援 Linux、Windows 和 macOS,並附有具體版本說明:Linux 從 2019 年起,Windows 因 ray 依賴僅支援 Python 3.10-3.12,macOS 需要 14.0 或更高。大多數後端的最低記憶體為 16GB。http-client 後端僅需 2GB 顯存,且支援純 CPU。

安裝與執行 MinerU

README 建議在本地部署前先嘗試線上示範。官方網頁版和基於 Gradio 的示範可在 Modelscope 和 Hugging Face 上獲得。本地安裝的文件路徑使用 pip 和 uv:升級 pip,安裝 uv,然後執行 `uv pip install -U "mineru[all]"`。從原始碼安裝則執行 `git clone` 後執行 `uv pip install -e .[all]`。Docker 部署也有文件說明,支援 Linux 和帶 WSL2 的 Windows。安裝後,命令列用法為 `mineru -p <input_path> -o <output_path>`,純 CPU 場景需新增 `-b pipeline`。README 列出了 CLI、API、WebUI 和 `mineru-router` 作為支援介面,詳細用法見文件站點。它還提到 `mineru` 命令作為基於 `mineru-api` 的編排用戶端,在未提供 API URL 時會自動啟動本地臨時服務。

從 3.0 到 3.4 的發布要點

README 中的變更日誌涵蓋四個近期版本。2026 年 6 月的 3.4 版本將 pipeline 後端的 OCR 模型升級為 PP-OCRv6,在 OmniDocBench v1.6 上準確率提升約 11%,OCR 處理速度約翻倍。它還增加了自動模型來源選擇和本地快取複用。3.3 版本為 hybrid 後端引入 effort 參數(medium 和 high),並將 VLM 模型升級為 MinerU2.5-Pro-2605-1.2B。3.1.0 版本增加了對 PPTX 和 XLSX 的原生解析,並將授權切換為目前的自訂版本。3.0.0 版本增加了原生 DOCX 解析、新的非同步 API 端點,以及用於多 GPU 任務分配的路由器。該版本還引入了滑動視窗機制以降低長文件的峰值記憶體,並支援批次推理時串流寫入磁碟。README 還提到移除了兩個 AGPLv3 模型和一個 CC-BY-NC-SA 4.0 模型。

MinerU 開源授權

該倉庫採用基於 Apache 2.0 的自訂授權,並附有附加條件。授權摘錄指出,商業使用無需單獨的商業授權,但如果您及您的關聯方合併計算後,月活躍使用者超過 1 億或月收入超過 2000 萬美元,則必須取得商業授權。如果您基於 MinerU 向第三方提供線上服務,必須在產品介面或公開文件中顯著標明使用了 MinerU。未遵守任一條件將導致授權自動終止。授權未提及保固、安全或支援;README 也未提供這些保證。完整文字見倉庫中的 LICENSE.md 檔案。

針對 opendatalab-mineru-deep-analysis,可先依 README 的安裝入口建立隔離環境,執行文中列出的命令並保存版本、設定檔與輸出。核對時要看專案名稱、具體路徑或命令產生的結果,不能把文件未說明的效能、相容性或安全保證當成既定事實。

編輯結論

MinerU:把複雜文件整理成可檢索的結構 適合需要 README 所列能力並能自行管理依賴與權限的團隊;不適合把文件中的宣稱直接當成生產保證的使用者。先依該專案的安裝命令與設定檔完成一次最小流程,檢查專案專屬輸出、錯誤記錄和授權條件,再決定是否擴大部署。

官方來源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
社群筆記

社群筆記