Modell / Datensatz
VectifyAI/PageIndex avatar
VectifyAI/PageIndex

PageIndex: vektorloses RAG durch LLM-Baumsuche

PageIndex: Dokumentenindex für vektorlose, auf Argumentation basierende RAG. Inspiriert von AlphaGo schlagen wir **PageIndex** vor, ein **vektorloses**, **begründungsbasiertes RAG-System**, das aus langen Dokumenten einen **hierarchischen Baumindex** erstellt und LLMs verwendet, um *über diesen Index* zu **begründen**, um **agentischen, kontextbewussten Abruf** zu ermöglichen.

35.654 Sterne3.143 ForksPythonMIT

Auf einen Blick

Was ist das?
Ein Open-Source-Python-Projekt, das Vektorähnlichkeit durch hierarchische Baumindizierung und LLM-Argumentation für die Suche in langen Dokumenten ersetzt.
Für wen ist es gedacht?
PageIndex ist eine selbst hostbare, MIT-lizenzierte Implementierung eines reasoning-basierten RAG-Ansatzes. Es verzichtet auf Vektordatenbanken und Chunking, baut einen Baumindex aus PDFs auf und nutzt LLMs, um diesen Baum zu durchsuchen.
Darf ich es kommerziell nutzen?
Ja. MIT ist eine freizügige Lizenz: Sie dürfen darauf aufbauende Software nutzen, verändern und verkaufen, solange Sie die Urheberrechts- und Lizenzhinweise beibehalten.
Wird es noch gepflegt?
Ja. Die letzten Commits kamen vor 1 Tag.
In welcher Sprache ist es geschrieben?
Hauptsächlich Python, laut der Sprachstatistik von GitHub.

Die Antworten beruhen auf den GitHub-Daten des Projekts (zuletzt abgeglichen am 15. September 2026) und auf unserer Analyse. Sie sind keine Rechtsberatung.

TIEFGEHENDE OPEN-SOURCE-ANALYSE

Vektorlose, reasoning-basierte Suche

PageIndex ist ein Python-Repository für Dokumentindizierung in der Retrieval-Augmented Generation. Das Design verzichtet vollständig auf Vektor-Einbettungen und Chunking. Stattdessen baut es einen hierarchischen Baumindex aus langen PDFs auf, ähnlich einem Inhaltsverzeichnis, und bittet ein LLM, über diesen Index zu argumentieren, um relevante Abschnitte zu finden. Die README sagt, der Ansatz sei von AlphaGo inspiriert und versuche zu simulieren, wie menschliche Experten komplexe Dokumente durchsuchen.

Zweistufiger Prozess: Baumkonstruktion und Baumsuche

Die README beschreibt die Suche in zwei Schritten. Zuerst erzeugt PageIndex eine baumartige Struktur im Inhaltsverzeichnis-Stil für ein Dokument, mit Knoten, die Titel, IDs, Seitenbereiche, Zusammenfassungen und Unterknoten enthalten. Zweitens führt es agentische, reasoning-basierte Suche durch Baumsuche aus. Die Ausgabe basiert auf expliziten Seiten- und Abschnittsverweisen, die das Projekt als nachvollziehbar und erklärbar bezeichnet. Die Baumstruktur ist für lange professionelle Dokumente wie Finanzberichte, rechtliche Unterlagen und technische Handbücher gedacht.

Abgrenzung zu Vektor-RAG

PageIndex listet fünf Kernfunktionen auf, die es von traditionellem vektorbasiertem RAG unterscheiden: keine Vektordatenbank, kein Chunking, bessere Nachvollziehbarkeit und Erklärbarkeit, kontextbewusste Suche und menschenähnliche Suche. Die README argumentiert, dass Vektorsuche eher auf semantischer Ähnlichkeit als auf Relevanz beruht und dass Ähnlichkeit nicht dasselbe ist wie Relevanz. PageIndex nutzt Dokumentstruktur und LLM-Argumentation, um Ergebnisse zu finden, die vom vollständigen Abfragekontext abhängen, einschließlich Gesprächsverlauf und Domänenwissen.

Bereitstellungsoptionen und gehostete Dienste

Das Repository bietet drei Bereitstellungspfade. Beim Selbsthosting wird der Open-Source-Code lokal mit Standard-PDF-Parsing ausgeführt. Ein Cloud-Dienst bietet nach Angaben der README eine produktionsreife Pipeline mit verbesserter OCR, Baumerstellung und Suche und ist über eine Chat-Plattform, MCP oder API zugänglich. Enterprise-Bereitstellung ist für dedizierte oder private Umgebungen verfügbar, einschließlich VPC und On-Premises. Die README merkt an, dass komplexe PDFs vom Cloud-Dienst profitieren können, gibt aber keinen Leistungsvergleich zwischen Self-Hosting und Cloud-Pipelines an.

Paketnutzung und Kommandozeilenablauf

Zur Nutzung des Pakets heißt es in der README, zunächst Abhängigkeiten mit pip3 install --upgrade -r requirements.txt zu installieren, dann eine .env-Datei im Stammverzeichnis mit einem LLM-API-Schlüssel wie OPENAI_API_KEY anzulegen; Multi-LLM wird über LiteLLM unterstützt. Der Hauptbefehl lautet python3 run_pageindex.py --pdf_path /path/to/your/document.pdf. Optionale Argumente umfassen --model, --toc-check-pages, --max-pages-per-node, --max-tokens-per-node sowie Flags zum Hinzufügen von Knoten-IDs, Zusammenfassungen und Dokumentbeschreibungen. Markdown-Dateien werden mit --md_path unterstützt; die README warnt davor, PDFs mit Tools zu konvertieren, die die ursprüngliche Hierarchie verlieren. Ein PageIndex-Flash-Vorschaumodus erzeugt Baumstrukturen heuristisch ohne LLM, wobei das LLM nur für Knotenzusammenfassungen verwendet wird; er wird mit --flash aufgerufen und mit --optimize verfeinert.

Agentisches Beispiel und Schnellstart-Notebooks

Ein vollständiges agentisches vektorloses RAG-Beispiel liegt in examples/agentic_vectorless_rag_demo.py und verwendet das OpenAI Agents SDK. Die README nennt zwei Befehle: pip3 install openai-agents und python3 examples/agentic_vectorless_rag_demo.py. Es gibt auch Notebooks für eine minimale vektorlose RAG-Pipeline und eine visionbasierte Version ohne OCR, die direkt mit Seitenbildern arbeitet. Diese Beispiele sollen den Self-Hosting-Pfad zeigen, aber die README macht keine Angaben zu Laufzeitanforderungen oder erwarteter Ausgabequalität.

Fallstudie, Ökosystem und Lizenz

Die README berichtet, dass Mafin 2.5, ein reasoning-basiertes RAG-System mit PageIndex, auf FinanceBench, einem QA-Benchmark für Finanzdokumente, eine Genauigkeit von 98,7 Prozent erreicht und vektorbasierte RAG-Systeme übertroffen hat. Es wird auf ein Benchmark-Repository und einen Blogbeitrag verlinkt. PageIndex wird außerdem als Anker eines Open-Source-Ökosystems präsentiert, zu dem OpenKB, ChatIndex, ConDB und PageIndex MCP gehören. Das Repository ist unter der MIT-Lizenz lizenziert, Copyright 2025 Vectify AI. Die Lizenz gewährt Rechte zur Nutzung, Vervielfältigung, Änderung, Zusammenführung, Veröffentlichung, Verbreitung, Unterlizenzierung und zum Verkauf von Kopien und besagt, dass die Software ohne Gewährleistung bereitgestellt wird. Die README selbst beschreibt keine Supportleistungen, Sicherheitsgarantien oder Produktionsergebnisse über den genannten Benchmark hinaus.

Projektbezogener Prüfpunkt · vectifyai pageindex

Bei vectifyai/pageindex hängt der Nutzen an der Dokumentaufnahme und der erzeugten Indexstruktur. Zu prüfen ist, ob die eigenen Dokumente in der vorgesehenen Eingabeform verarbeitet werden, ob die Hierarchie stabil bleibt und ob Antworten auf konkrete Seiten oder Knoten verweisen. Allgemeine Retrieval-Aussagen ersetzen diesen projektbezogenen Lauf nicht.

Redaktionelles Fazit

PageIndex ist eine selbst hostbare, MIT-lizenzierte Implementierung eines reasoning-basierten RAG-Ansatzes. Es verzichtet auf Vektordatenbanken und Chunking, baut einen Baumindex aus PDFs auf und nutzt LLMs, um diesen Baum zu durchsuchen. Die README berichtet über eine Genauigkeit von 98,7 Prozent auf FinanceBench über Mafin 2.5 und verweist auf ein breiteres Ökosystem verwandter Projekte.

Offizielle Quellen

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
Community-Notizen

Community-Notizen