Werkzeuge

RAG-Text-Chunker

Teilen Sie ein Dokument in überlappende Chunks, genau wie der RecursiveCharacterTextSplitter von LangChain – mit Verständnis für chinesische Satzzeichen.

Läuft im BrowserKI-Entwicklertools146.394
Kostenlos

Eingabe

0 B

Ergebnis

Das Ergebnis erscheint hier.

Wie ein Dokument zerlegt wird, entscheidet darüber, was ein RAG-System finden kann: Chunks, die mitten im Satz enden oder zwei Themen vermischen, ergeben schlechte Suchtreffer, ganz gleich wie gut das Embedding-Modell ist. Mit diesem Tool sehen Sie die Chunks, bevor Sie etwas indexieren. Es ist eine zeilengenaue Portierung des RecursiveCharacterTextSplitter von LangChain (langchain-ai/langchain, MIT), des Splitters, mit dem die meisten RAG-Tutorials und -Pipelines beginnen, und unsere Tests prüfen, dass er auf englischem, chinesischem und gemischtem Text genau dieselben Chunks liefert wie die Python-Bibliothek – gemessen in Zeichen oder in Tokens.

So arbeitet es

  • Der Text wird am ersten Trennzeichen geteilt, das darin vorkommt – Leerzeile, Zeilenumbruch, dann Satzenden, Teilsatzzeichen und Leerzeichen –, und jedes noch zu lange Stück wird mit dem nächsten Trennzeichen erneut geteilt.
  • Chinesische Satz- und Teilsatzzeichen (。!?;,) stehen auf der Trennzeichenliste, und jedes Trennzeichen bleibt am Ende des Stücks, das es abschließt – ein Chunk endet also mit seinem Punkt, statt dass der nächste damit beginnt.
  • Anschließend werden die Stücke bis zur Chunk-Größe zusammengefügt, und jeder neue Chunk beginnt mit so viel vom Ende des vorigen, wie in die Überlappung passt – wie bei LangChain.
  • Die Länge wird in Unicode-Codepoints gezählt wie bei Pythons len() oder in cl100k_base-Tokens; die Ausgabe ist JSON mit Index, Startposition, Länge und Text jedes Chunks.

Wohin Ihre Daten gehen

Nirgendwohin. Dieses Werkzeug läuft vollständig in Ihrem Browser: Der eingefügte Text wird von der Seite verarbeitet und weder an einen Server übertragen noch protokolliert.

Dieses Tool ist kostenlos und braucht kein Konto. Die Ergebnisse existieren nur in Ihrer geöffneten Seite und werden nirgends gespeichert.

Was es kostet

Dieses Werkzeug ist kostenlos, ohne Anmeldung und ohne Punkte.

Häufige Fragen

Erhalte ich in meiner Python-Pipeline dieselben Chunks?
Ja, mit denselben Einstellungen: RecursiveCharacterTextSplitter(chunk_size=…, chunk_overlap=…, separators=["\n\n", "\n", "。", "!", "?", ". ", "! ", "? ", ";", "; ", ",", ", ", " ", ""], keep_separator="end"). Für den Token-Modus ergänzen Sie eine length_function, die mit cl100k_base von tiktoken zählt. Die Standard-Trennzeichen von LangChain ignorieren chinesische Satzzeichen, weshalb chinesischer Text damit schlecht geteilt wird.
Welche Chunk-Größe und Überlappung sollte ich verwenden?
Ein üblicher Ausgangspunkt sind 500–1.000 Zeichen oder 200–400 Tokens bei 10–20 % Überlappung. Kleinere Chunks liefern präzisere Treffer, aber weniger Kontext pro Treffer; größere umgekehrt. Probieren Sie hier Ihre echten Dokumente aus und lesen Sie die Chunks: Jeder sollte für sich allein verständlich sein.
Warum ist die Überlappung manchmal kürzer als eingestellt?
Die Überlappung ist ein Höchstwert, keine Garantie. Der Splitter übernimmt nur ganze Stücke und verwirft vorne so lange Stücke, bis das nächste in die Chunk-Größe passt; ein langer Satz kann deshalb gar keinen Platz für Überlappung lassen. LangChain verhält sich genauso.
Unterstützt es Markdown-Überschriften oder semantisches Chunking?
Nein. Es führt die rekursive Zeichenteilung aus, die die meisten Pipelines standardmäßig nutzen. Überschriftenbasierte und embeddingbasierte semantische Splitter brauchen eine andere Logik, im semantischen Fall zusätzlich ein Embedding-Modell; Leerzeilen und Überschriften wirken hier bereits als stärkste Grenzen.

Das Open Source dahinter

Dieses Werkzeug ist eine eigenständige Implementierung ohne fremde Bibliothek. langchain-ai/langchain (MIT) erledigt dieselbe Aufgabe als Bibliothek — wer sie im eigenen Programm braucht, fängt dort an, statt eine Webseite aufzurufen.

langchain-ai/langchain

Auch bekannt als

  • Text Chunker
  • RAG Chunking
  • Text in Chunks aufteilen
  • RecursiveCharacterTextSplitter
  • LangChain Text Splitter online
  • Chunk Size Overlap