tika
Das Apache Tika-Toolkit erkennt und extrahiert Metadaten und Text aus über tausend verschiedenen Dateitypen (wie PPT, XLS und PDF).
Welches Problem es löst
Das Apache Tika-Toolkit erkennt und extrahiert Metadaten und Text aus über tausend verschiedenen Dateitypen (wie PPT, XLS und PDF).
Der Projektkontext auf dieser Seite ist kostenlos lesbar. Das ursprüngliche GitHub-Repository bleibt maßgeblich; nur zum Speichern oder Diskutieren ist eine Anmeldung nötig.
Community-Notizen