Chunking
Das Zerlegen langer Dokumente in kleinere, thematisch zusammenhängende Abschnitte (Chunks). Chunking ist ein zentraler Vorverarbeitungsschritt in RAG-Systemen, weil ein Modell nur passend zugeschnittene Textstücke zuverlässig durchsuchen und verarbeiten kann.
Chunking bezeichnet das Aufteilen langer Texte in kleinere Abschnitte, sogenannte Chunks. Es ist ein grundlegender Vorverarbeitungsschritt beim Aufbau einer RAG-basierten Wissensbasis: Bevor Dokumente durchsuchbar werden, müssen sie in handhabbare Stücke zerlegt werden. Der Grund ist praktischer Natur — ein vollständiges Handbuch oder ein hundertseitiger Vertrag lässt sich weder sinnvoll als Ganzes in ein Embedding überführen noch komplett in das Context Window eines Modells laden. Erst die Zerlegung in Chunks macht gezieltes Auffinden relevanter Passagen möglich.
Wie Chunking in RAG-Systemen wirkt
In einer typischen Pipeline wird jeder Chunk in ein Embedding umgewandelt und in einer Vektordatenbank abgelegt. Stellt ein Nutzer später eine Frage, sucht das System nicht das ganze Dokument, sondern die inhaltlich am besten passenden Chunks heraus und übergibt nur diese dem Sprachmodell als Kontext. Die Qualität dieser Zerlegung entscheidet damit maßgeblich über die Antwortqualität: Sind die Chunks gut geschnitten, findet das System präzise Belege; sind sie schlecht geschnitten, gehen Zusammenhänge verloren oder es werden irrelevante Passagen mitgeliefert.
Die Kunst der richtigen Chunk-Größe
Beim Zuschnitt gilt es, einen Kompromiss zu finden. Zu kleine Chunks reißen zusammengehörige Gedanken auseinander, sodass der entscheidende Kontext fehlt. Zu große Chunks verwässern die Suche, weil ein Abschnitt mehrere Themen vermischt und das Embedding unscharf wird. In der Praxis haben sich einige Prinzipien bewährt:
| Ansatz | Prinzip | Geeignet für |
|---|---|---|
| Feste Größe | Zerlegung nach fester Token-Zahl | einheitliche Fließtexte |
| Überlappung (Overlap) | Chunks teilen sich Randbereiche | erhält Kontext über Grenzen hinweg |
| Semantisch / strukturbasiert | Schnitt an Absätzen, Überschriften, Kapiteln | strukturierte Dokumente, Verträge |
Eine leichte Überlappung benachbarter Chunks ist verbreitet, damit ein Gedanke, der genau an einer Schnittstelle steht, nicht verloren geht. Die optimale Strategie hängt stark von der Art der Dokumente ab und wird in der Praxis meist experimentell ermittelt.
Relevanz für KMUs
Für den Mittelstand ist Chunking selten ein Thema, das man direkt konfiguriert — aber es ist häufig der stille Grund, warum eine KI-Wissensbasis gute oder schlechte Antworten liefert. Wenn ein RAG-System relevante Informationen „übersieht", obwohl sie im Dokument stehen, liegt die Ursache oft in einer ungünstigen Chunking-Strategie und nicht am Sprachmodell selbst. Beim Aufbau einer durchsuchbaren Wissensbasis aus Handbüchern, Richtlinien oder Vertragsbeständen achten wir in unserer KI-Wissensdatenbank genau auf einen dokumentgerechten Zuschnitt — die Grundlage für belastbare, mit Quellen belegte Antworten.