オープンソースプロジェクト
PaddlePaddle/PaddleOCR avatar
PaddlePaddle/PaddleOCR

PaddleOCR:画像とPDFを構造化データに変換するOCRツールキット

あらゆる PDF または画像ドキュメントを AI の構造化データに変換します。画像/PDF と LLM の間のギャップを埋める、強力で軽量な OCR ツールキット。 100 以上の言語をサポートします。

スター 89,583フォーク 11,336PythonApache-2.0

ひと目でわかる

これは何?
PaddleOCRはPDFと画像をJSONまたはMarkdownに変換し、100以上の言語をサポートし、PP-OCR、PaddleOCR-VL、PP-StructureV3などのモデルファミリーを提供します。
誰に向いている?
PaddleOCRはApache 2.0ライセンスで公開されており、リポジトリのメタデータによると、現在87,004のスターと226の未解決Issueがあります。READMEは、このライセンスがセキュリティ、サポート、保証について何を規定しているかについては説明していません。
商用利用できる?
できます。Apache-2.0 は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 55 日前です。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月15日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

リポジトリが説明する機能

PaddleOCRのREADMEは、このプロジェクトをPDFドキュメントと画像をJSONまたはMarkdown形式の構造化されたLLM対応データに変換するツールとして位置づけています。リポジトリのメタデータは、これを100以上の言語をサポートする軽量なOCRツールキットと説明しています。READMEはまた、Dify、RAGFlow、Cherry Studioなどのプロジェクトを利用者として挙げていますが、それらのプロジェクトがどのようにPaddleOCRを統合しているか、またはどの特定の機能に依存しているかについては説明していません。

モデルファミリーと解析パス

READMEは3つの主要なモデルファミリーを説明しています。PP-OCRシリーズは一般的なテキスト認識に焦点を当てており、PP-OCRv6は中国語、英語、日本語、および46のラテン文字言語を含む50言語を単一の統一モデルでサポートしています。PaddleOCR-VLはドキュメント解析用の視覚言語モデルであり、READMEはPaddleOCR-VL-1.6(0.9B)とPaddleOCR-VL-1.5のバージョンに言及しており、言語サポートはバージョンに応じて109から111の範囲です。PP-StructureV3は、テーブルセル座標などの詳細な座標情報を含むMarkdownまたはJSONへの構造認識変換を提供します。各ファミリーにはREADMEに個別のドキュメントリンクがあります。

更新ログのパフォーマンス主張

READMEの変更ログには、いくつかの具体的なパフォーマンス主張が含まれています。PaddleOCR-VL-1.6はOmniDocBench v1.6で96.3%の精度に達するとされています。PP-OCRv6はPP-OCRv5に対して検出精度4.6%、認識精度5.1%の向上を達成し、CPU推論速度が5.2倍になると主張されています。HPD-Parsingは毎秒4,752トークンのピークスループットを達成すると説明されています。これらの数値はREADMEから直接引用されていますが、READMEはベンチマークの方法論や検証の詳細を提供していないため、プロジェクト自身の主張として扱うべきです。

デプロイと統合の経路

READMEはクイックスタートを概説しています:公式ウェブサイトをオンラインで試し、ニーズに応じてローカルデプロイのドキュメントパスを選択します。ローカルデプロイは、PP-OCRシリーズ、PaddleOCR-VLシリーズ、PP-StructureV3シリーズに分かれています。さらに、READMEはモデルをONNX形式に変換すること、OpenVINOやTensorRTなどのエンジンでの推論高速化、マルチGPU並列推論、およびサービスを介してC++、C#、Javaで書かれたアプリケーションにPaddleOCRを統合することを言及しています。ただし、READMEは具体的なインストールコマンドやコード例を提供していません。

最近のアップデートと機能拡張

バージョン3.7.0はPP-OCRv6を導入し、tiny、small、mediumの3つのモデル階層を提供します。バージョン3.6.0はPaddleOCR-VL-1.6をもたらしました。バージョン3.5.0はWord、Excel、PowerPointドキュメントのMarkdown変換、解析結果のDOCXエクスポート、PaddleOCR.jsと呼ばれるブラウザ推論SDKを追加しました。バージョン3.4.0はPaddleOCR-VL-1.5を導入し、シール認識、テキストスポッティング、111言語のサポートを追加しました。これらの機能はREADMEに記録されていますが、各バージョンの具体的な動作は対応するドキュメントで確認する必要があります。

コミュニティと外部プロジェクト

READMEはPaddleOCRを使用する外部プロジェクトのリストを示しています。Dify、RAGFlow、Pathway、MinerU、Umi-OCR、Cherry Studio、Haystack、OmniParser、QAnythingなどです。このリストはREADMEの「Awesome Projects」セクションにありますが、各プロジェクトがPaddleOCRをどのように使用しているかは指定されていません。リポジトリはまた、コントリビューターグラフとスター履歴チャートを表示し、PaddlePaddleのWeChat公式アカウントと技術ディスカッショングループに参加するためのQRコードを提供しています。これらのグループに参加する正確な手順はREADMEに記載されていません。

ライセンスと引用ソース

このプロジェクトはApache 2.0ライセンスで公開されています。ライセンステキストは、複製、派生作品、公開表示、サブライセンス、配布の権限を付与していますが、セキュリティ体制、サポート、保証については何も述べていません。READMEは、PaddleOCR 3.0テクニカルレポートやPaddleOCR-VLに関する論文など、いくつかの技術論文をarXivリンク付きで引用しています。これらの引用はREADMEで名前が挙げられている唯一の具体的なソースです。

PaddleOCR の用途に合わせた確認

PaddleOCR を試す際は、まず README の PP-OCRv6、PaddleOCR-VL-1.6、PP-StructureV3 の入口を分け、同じ画像やPDFを入力して出力形式を比較します。JSON の座標、Markdown の表、日英混在文字の欠落を個別に記録すれば、96.3%や5.2倍というREADMEの自社ベンチマーク主張と、自分のCPUまたはGPUで得た結果を混同せずに済みます。

入力が帳票なら表セル座標を保存し、本文だけを抽出した場合との差を確認します。PP-StructureV3のJSONとMarkdownを同一入力から出し、後段の検索やLLM処理がどちらを必要とするかを決めます。

PP-OCRv6のtiny、small、mediumは、端末のメモリと速度の制約を測って選びます。READMEのモデル規模や速度の数字は自分の画像、CPU、GPUで再現するとは限らないため、測定条件を残します。

PaddleOCR の用途に合わせた確認 1回目の照合では、READMEに書かれた対象と未記載の領域を表に分けます。入力、設定、出力、失敗条件を記録し、同じ結果になった理由を説明できる形にします。PaddleOCR:画像とPDFを構造化データに変換するOCRツールキットを採用する判断は、名称やスター数ではなく、現在の作業で必要な機能が資料の範囲に収まり、担当者がその挙動を再確認できるかで決めます。

PaddleOCR の用途に合わせた確認 2回目の照合では、READMEに書かれた対象と未記載の領域を表に分けます。入力、設定、出力、失敗条件を記録し、同じ結果になった理由を説明できる形にします。PaddleOCR:画像とPDFを構造化データに変換するOCRツールキットを採用する判断は、名称やスター数ではなく、現在の作業で必要な機能が資料の範囲に収まり、担当者がその挙動を再確認できるかで決めます。

PaddleOCR の用途に合わせた確認 3回目の照合では、READMEに書かれた対象と未記載の領域を表に分けます。入力、設定、出力、失敗条件を記録し、同じ結果になった理由を説明できる形にします。PaddleOCR:画像とPDFを構造化データに変換するOCRツールキットを採用する判断は、名称やスター数ではなく、現在の作業で必要な機能が資料の範囲に収まり、担当者がその挙動を再確認できるかで決めます。

資料にない性能や保証は断定せず、確認できた事実と利用者側の判断を分けて記述します。

編集部の結論

PaddleOCRはApache 2.0ライセンスで公開されており、リポジトリのメタデータによると、現在87,004のスターと226の未解決Issueがあります。READMEは、このライセンスがセキュリティ、サポート、保証について何を規定しているかについては説明していません。 PaddleOCR を試す際は、まず README の PP-OCRv6、PaddleOCR-VL-1.6、PP-StructureV3 の入口を分け、同じ画像やPDFを入力して出力形式を比較します。JSON の座標、Markdown の表、日英混在文字の欠落を個別に記録すれば、96.3%や5.2倍というREADMEの自社ベンチマーク主張と、自分のCPUまたはGPUで得た結果を混同せずに済みます。

公式情報源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
コミュニティノート

コミュニティノート