オープンソースプロジェクト
baidu/Unlimited-OCR avatar
baidu/Unlimited-OCR

Unlimited-OCRの長文解析をTransformers、vLLM、SGLangで切り分ける

無制限の OCR は、長いドキュメントと画像を 1 パスで解析し、ドキュメントと AI ワークフロー用の構造化テキストを生成します。

スター 25,684フォーク 2,651PythonMIT
GitHub

ひと目でわかる

これは何?
baidu/Unlimited-OCR READMEにある長時間の文書解析、NVIDIA GPU要件、推論サーバー、評価手順を実行単位で読む記事です。
誰に向いている?
GPU上で画像やPDFを長い文脈のまま解析したい開発者に向きます。最初にREADME記載のPython 3.12.3とCUDA 12.9、NVIDIA GPUを確認し、Transformersの単発推論を通してから `docker pull vllm/vllm-openai:unlimited-ocr` のAPIを試してください。
商用利用できる?
できます。MIT は寛容なライセンスで、著作権表示とライセンス表示を残せば、使用・改変・販売が可能です。
今もメンテナンスされている?
されています。最後のコミットは 49 日前です。
何の言語で書かれている?
主に Python です(GitHub の言語統計による)。

回答はプロジェクトの GitHub データ(最終同期:2026年9月15日)と当サイトの分析に基づくもので、法的助言ではありません。

オープンソース詳細解説

baidu-unlimited-ocrのUnlimited-OCRが掲げるone-shot長文解析

baidu/Unlimited-OCR の README はプロジェクトを「Unlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.」と説明しています。ここではリポジトリで確認できる事実だけを整理します。star 数やバッジは注目度の手掛かりであり、品質の証明ではありません。「Transformers」には次の説明があります。Inference using Huggingface transformers on NVIDIA GPUs. Requirements tested on python 3.12.3 + CUDA12.9:。これは範囲の説明であり、本番検証の結果ではありません。

baidu-unlimited-ocrのPython 3.12.3とCUDA 12.9の前提

README の「Release」にある内容から、用途が合うかを先に判断できます。[2026/07/03] Thanks to the Baidu Cloud team for their support. Our model is now available on Baidu Cloud.。目的が違うなら、人気だけで採用する理由にはなりません。プロジェクト名やコマンドは原文のまま残し、一次資料へ戻って用語を確認できるようにしています。 README には次の確認可能な項目もあります。[2026/07/21] Thanks to the ms-swift community.。初回テストの材料にはなりますが、実際の環境での確認を省略する理由にはなりません。

baidu-unlimited-ocrのTransformersでNVIDIA GPU推論を始める

動作の説明は「vLLM」など複数の箇所に分かれています。確認できる情報は次の通りです。##### Docker Images Use the following Docker images depending on your GPU platform:。書かれていない構成、性能、セキュリティを推測で補いません。導入時はディレクトリ、設定ファイル、release 履歴を確認してください。

baidu-unlimited-ocrのvLLM DockerとOpenAI互換APIの境界

初回導入は README の入口から始めます。確認できるコマンドは次の通りです。

docker pull vllm/vllm-openai:unlimited-ocr

実行可能なコマンドがない場合は手順を作らず、「Inference」で依存関係、待受ポート、初回設定を確認します。

baidu-unlimited-ocrのSGLang、kernels、PyMuPDFの組み合わせ

日常運用は公式文書の範囲に限ります。「SGLang」にはSet up the environment (uv-managed virtualenv). Install the local SGLang wheel first, then pin kernels==0.9.0 and install PyMuPDF for PDF-to-image conversion:とあります。設定、環境変数、権限、データ保存先は明記されたものだけを扱います。未記載の既定値は隔離環境で確認し、戻せる設定を保存してください。 同じ資料には[2026/06/28] Thanks to the vLLM community for their support, our model now supports vLLM inference.ともあります。

baidu-unlimited-ocrの画像ディレクトリとPDFのバッチ経路

制約も確認が必要です。現在の資料からは、baidu/Unlimited-OCR の互換表、性能基準、サービス保証、長期サポートを確認できません。README の記載は「Send streaming requests to the OpenAI-compatible API:」です。不明点は採用記録の検証項目として残し、断定に変えないでください。

baidu-unlimited-ocrのOmniDocBench後処理と評価値の読み方

ライセンスはメタデータと LICENSE に基づき、SPDX は MIT です。再配布や改変の条件を確認する情報であり、安全審査の代わりではありません。認証情報、公開範囲、ログ、依存ライブラリの扱いは別途確認が必要です。

baidu-unlimited-ocrのモデル公開、謝辞、MITライセンスを分離する

保守判断の材料は、既定ブランチ main、21989 stars、2216 forks、73 件の open issue です。「SGLang」にはFor batch inference, infer.py starts the SGLang server automatically and sends concurrent requests for an image directory or PDF:とあります。更新計画の参考にはなりますが、実際の upgrade テストは省略できません。 保守時は README の「SGLang」も確認します。For OmniDocBench evaluation, you need to perform the following post-processing.。

評価時は、画像をそのまま渡す経路とPDFをPyMuPDFで画像化する経路を分離します。vLLMではREADME指定のDockerイメージ、SGLangではuv管理の仮想環境と `kernels==0.9.0` を固定し、OpenAI互換APIへのストリーミング要求が返すJSONを保存します。READMEのモデル公開日やコミュニティへの謝辞は運用保証を意味しません。OmniDocBenchの後処理は評価スコアと入力ファイルの対応を確認してから採用します。

長文OCRの評価では、入力のページ数、画像解像度、文字方向、表や図の有無を固定しないと、推論方式の差と入力差を区別できません。Transformersの単発処理で得た認識結果を基準ファイルにし、vLLMのOpenAI互換エンドポイントでは同じ画像を送ってレスポンス構造とストリーミング順序を比較します。SGLangのバッチ処理は画像ディレクトリとPDFの経路が分かれるため、並列数、サーバーの起動ログ、失敗したページを別に残します。READMEはCUDA 12.9でのテスト環境を示しますが、別のGPUやドライバーで同じ速度になるとは説明していません。モデルの出力を業務文書へ使うなら、ページ単位の欠落、読み順、表のセル境界を人手の正解と照合します。評価用の後処理を行った場合も、元のJSONと変換後のファイルを両方保管します。

OCR結果を別システムへ渡す場合は、文字列だけでなくページ番号、画像名、エラー状態を保持します。vLLMとSGLangで同じ入力を比較するとき、サーバーが自動起動したか、要求がストリームで返ったか、タイムアウトしたページがあるかを区別します。READMEにないGPUメモリ容量を推測せず、実行時のログから不足を判定します。

画像から文字列を得た後の保存形式や利用者権限は、OCR READMEの説明だけでは決まりません。出力を扱うアプリ側でページ対応と失敗時の再処理を設計し、モデル推論と業務データ管理を分離します。

GPUメモリ不足や形式エラーが出た場合は、入力ページを減らすだけでなく、どの段階のログが最後に残ったかを見ます。モデル、推論サーバー、後処理の版を別々に保存し、同じページを再処理できる状態を作ります。

推論結果の採否は、認識文字、ページ境界、表の構造を分けて確認します。

推論結果の採否は、認識文字、ページ境界、表の構造を分けて確認します。

編集部の結論

GPU上で画像やPDFを長い文脈のまま解析したい開発者に向きます。最初にREADME記載のPython 3.12.3とCUDA 12.9、NVIDIA GPUを確認し、Transformersの単発推論を通してから `docker pull vllm/vllm-openai:unlimited-ocr` のAPIを試してください。PDFではPyMuPDFの画像化、ストリーミング応答、OmniDocBenchの後処理を別々に記録します。

公式情報源

  1. Official README
  2. Project repository
コミュニティノート

コミュニティノート