PaddleOCR: PDFs und Bilder als JSON oder Markdown ausgeben
Verwandeln Sie jedes PDF- oder Bilddokument in strukturierte Daten für Ihre KI. Ein leistungsstarkes, leichtes OCR-Toolkit, das die Lücke zwischen Bildern/PDFs und LLMs schließt. Unterstützt über 100 Sprachen.
Auf einen Blick
- Was ist das?
- PaddleOCR verbindet Texterkennung und Dokumentanalyse mit Modellfamilien wie PP-OCRv6, PaddleOCR-VL und PP-StructureV3 für über 100 Sprachen.
- Für wen ist es gedacht?
- Geeignet ist PaddleOCR für Teams, deren konkreter Bedarf zu den im README beschriebenen Funktionen passt. Weniger geeignet ist es als Ersatz für nicht dokumentierte Betriebszusagen.
- Darf ich es kommerziell nutzen?
- Ja. Apache-2.0 ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
- Wird es noch gepflegt?
- Ja. Die letzten Commits kamen vor 56 Tagen.
- In welcher Sprache ist es geschrieben?
- Hauptsächlich Python, laut der Sprachstatistik von GitHub.
Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.
TIEFGEHENDE OPEN-SOURCE-ANALYSE
Was das Repository nach eigenen Angaben tut · PaddleOCR
Die PaddleOCR-README positioniert das Projekt als Werkzeug, das PDF-Dokumente und Bilder in strukturierte, LLM-bereite Daten im JSON- oder Markdown-Format umwandelt. Die Repository-Metadaten beschreiben es als leichtgewichtiges OCR-Toolkit, das über 100 Sprachen unterstützt. Die README nennt auch Projekte wie Dify, RAGFlow und Cherry Studio als Nutzer, erklärt aber nicht, wie diese Projekte PaddleOCR integrieren oder auf welche spezifischen Fähigkeiten sie sich stützen.
PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Prüfpunkt 1: Die Ausgabe des genannten Projektpfads ist mit Version und Eingabe festzuhalten.
Modellfamilien und Parsing-Pfade · PaddleOCR
Die README beschreibt drei Hauptmodellfamilien. Die PP-OCR-Serie konzentriert sich auf allgemeine Texterkennung, wobei PP-OCRv6 50 Sprachen in einem einzigen einheitlichen Modell unterstützt, darunter Chinesisch, Englisch, Japanisch und 46 lateinische Schriftsysteme. PaddleOCR-VL ist ein visuell-sprachliches Modell für die Dokumentenanalyse; die README erwähnt die Versionen PaddleOCR-VL-1.6 (0.9B) und PaddleOCR-VL-1.5 mit einer Sprachunterstützung von 109 bis 111, je nach Version. PP-StructureV3 bietet strukturbewusste Konvertierung in Markdown oder JSON, einschließlich feiner Koordinateninformationen wie Tabellenzellenkoordinaten. Jede Familie hat einen eigenen Dokumentationslink in der README.
PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Prüfpunkt 2: Die Ausgabe des genannten Projektpfads ist mit Version und Eingabe festzuhalten.
Leistungsbehauptungen im Änderungsprotokoll · PaddleOCR
Das Änderungsprotokoll der README enthält mehrere spezifische Leistungsbehauptungen. PaddleOCR-VL-1.6 soll auf OmniDocBench v1.6 eine Genauigkeit von 96,3 % erreichen. PP-OCRv6 wird eine Verbesserung der Erkennung um 4,6 % und der Texterkennung um 5,1 % gegenüber PP-OCRv5 sowie eine 5,2-fache CPU-Inferenzbeschleunigung zugeschrieben. HPD-Parsing wird mit einem Spitzendurchsatz von 4.752 Token pro Sekunde beschrieben. Diese Zahlen werden direkt aus der README zitiert, die jedoch keine Benchmark-Methodik oder Verifikationsdetails liefert, daher sollten sie als eigene Behauptungen des Projekts behandelt werden.
PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Prüfpunkt 3: Die Ausgabe des genannten Projektpfads ist mit Version und Eingabe festzuhalten.
Bereitstellungs- und Integrationspfade · PaddleOCR
Die README skizziert einen Schnellstart: Online die offizielle Website ausprobieren, dann je nach Bedarf einen Pfad in der lokalen Bereitstellungsdokumentation wählen. Die lokale Bereitstellung ist in PP-OCR-Serie, PaddleOCR-VL-Serie und PP-StructureV3-Serie unterteilt. Darüber hinaus erwähnt die README die Konvertierung von Modellen in das ONNX-Format, die Beschleunigung der Inferenz mit Engines wie OpenVINO und TensorRT, parallele Inferenz mit mehreren GPUs und die Integration von PaddleOCR in Anwendungen, die in C++, C# oder Java geschrieben sind, über Serving. Die README enthält jedoch keine spezifischen Installationsbefehle oder Codebeispiele.
PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Prüfpunkt 4: Die Ausgabe des genannten Projektpfads ist mit Version und Eingabe festzuhalten.
Aktuelle Updates und erweiterte Funktionen · PaddleOCR
Version 3.7.0 führte PP-OCRv6 mit den Modellstufen tiny, small und medium ein. Version 3.6.0 brachte PaddleOCR-VL-1.6. Version 3.5.0 fügte die Konvertierung von Word-, Excel- und PowerPoint-Dokumenten in Markdown, den DOCX-Export für analysierte Ergebnisse und ein Browser-Inferenz-SDK namens PaddleOCR.js hinzu. Version 3.4.0 führte PaddleOCR-VL-1.5 ein und fügte Siegel-Erkennung, Text-Spotting und Unterstützung für 111 Sprachen hinzu. Diese Funktionen sind in der README dokumentiert, aber das Verhalten jeder Version müsste anhand der entsprechenden Dokumentation überprüft werden.
PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Prüfpunkt 5: Die Ausgabe des genannten Projektpfads ist mit Version und Eingabe festzuhalten.
Community und externe Projekte · PaddleOCR
Die README listet eine Reihe externer Projekte auf, die PaddleOCR verwenden, darunter Dify, RAGFlow, Pathway, MinerU, Umi-OCR, Cherry Studio, Haystack, OmniParser und QAnything. Die Liste erscheint im Abschnitt "Awesome Projects" der README, aber die README spezifiziert nicht, wie jedes Projekt PaddleOCR verwendet. Das Repository zeigt außerdem ein Beitragenden-Diagramm und ein Sternverlaufsdiagramm und bietet QR-Codes für den Beitritt zum PaddlePaddle-WeChat-Konto und einer technischen Diskussionsgruppe. Die genauen Schritte zum Beitritt zu diesen Gruppen werden in der README nicht beschrieben.
PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Prüfpunkt 6: Die Ausgabe des genannten Projektpfads ist mit Version und Eingabe festzuhalten.
Redaktionelles Fazit
Geeignet ist PaddleOCR für Teams, deren konkreter Bedarf zu den im README beschriebenen Funktionen passt. Weniger geeignet ist es als Ersatz für nicht dokumentierte Betriebszusagen. Zuerst sollten PaddleOCR sollte mit einem kleinen PDF und einem Bild getrennt geprüft werden: PP-StructureV3 muss die erwarteten Markdown- oder JSON-Felder liefern, während PP-OCRv6 die gewählte Sprache erkennen soll. Die README nennt dafür Modellfamilien, aber die Benchmarkwerte sind Eigenangaben. Danach lässt sich die Ausgabe gegen den eigenen Anwendungsfall und die Lizenz Apache-2.0 einordnen.
Community-Notizen