Zum Inhalt springen

Chunking-Strategien 2026

Wissen

Chunking bestimmt, was dein RAG-System findet. Egal wie gut dein Embedding-Modell ist, egal wie schnell deine Vector Database -- wenn die Chunks schlecht geschnitten sind, liefert das System schlechte Ergebnisse. Chunking ist der stille Qualitätshebel jeder RAG-Pipeline.

Die drei zentralen Strategien 2026:

  • Fixed-Size Chunking: Dokumente in Abschnitte fester Tokenlänge schneiden
  • Semantic Chunking: An inhaltlichen Bruchstellen schneiden, basierend auf Embedding-Ähnlichkeit
  • Parent-Child Chunking: Hierarchische Struktur mit groben Eltern-Chunks und feinen Kind-Chunks

Verstehen

Fixed-Size Chunking -- Der Klassiker (und seine Grenzen)

Fixed-Size Chunking teilt Dokumente in Abschnitte gleicher Länge -- zum Beispiel 512 Tokens pro Chunk. Einfach zu implementieren, deterministisch, gut verständlich.

Das Problem: Text kümmert sich nicht um Tokenzahlen. Ein Chunk kann mitten im Absatz enden, einen Gedanken zerschneiden oder Kontext vom vorherigen Absatz abschneiden.

Overlap als Pflaster: Um zerschnittene Zusammenhänge zu retten, fügt man Überlappungen ein -- typisch 10--20% der Chunk-Größe. Bei 512 Tokens also 50--100 Tokens Overlap.

Chunk-GrößeOverlapVorteilNachteil
256 Tokens25Hohe Granularität, präzise TrefferViel Kontext geht verloren
512 Tokens50Guter KompromissStandard-Setting, nicht optimiert
1024 Tokens100Mehr Kontext pro ChunkVerwässert Relevanz bei kurzen Fragen

iFixed-Size ist nicht tot

Für homogene Dokumente mit gleichmäßiger Informationsdichte (z.B. Log-Dateien, tabellarische Daten) funktioniert Fixed-Size Chunking nach wie vor gut. Es ist veraltet als Universallösung, nicht als Werkzeug.

Semantic Chunking -- Schneiden, wo der Inhalt es verlangt

Semantic Chunking analysiert den Text und identifiziert inhaltliche Bruchstellen. Der Algorithmus:

  1. Teile den Text in Sätze auf
  2. Berechne das Embedding für jeden Satz
  3. Vergleiche aufeinanderfolgende Satz-Embeddings (Cosine Similarity)
  4. Wenn die Ähnlichkeit unter einen Schwellenwert fällt, setze einen Chunk-Break
  5. Fasse die Sätze zwischen den Breaks zu Chunks zusammen

Das Ergebnis: Chunks, die thematische Einheiten bilden. Ein Absatz über Rückgabebedingungen bleibt zusammen, statt nach 512 Tokens mitten im Satz abgeschnitten zu werden.

Trade-offs:

  • Nicht-deterministische Chunk-Größen (manche Chunks sind 200 Tokens, andere 800)
  • Abhängig von der Qualität des Embedding-Modells
  • Schwellenwert muss pro Dokumenttyp getuned werden
  • Höherer Rechenaufwand bei der Indexierung

Ein Unternehmen indexiert Verträge mit klar strukturierten Abschnitten (Paragraphen, Klauseln, Unterpunkte). Welche Chunking-Strategie maximiert die Retrieval-Qualität?

Parent-Child Chunking -- Das Beste aus zwei Welten

Parent-Child Chunking löst ein fundamentales Dilemma: Kleine Chunks sind präzise für die Suche, aber liefern zu wenig Kontext für die Generierung. Große Chunks liefern Kontext, aber verwässern die Relevanz bei der Suche.

Die Lösung: Zwei Ebenen

  • Kind-Chunks (klein, 100--300 Tokens): Werden für die Vektorsuche verwendet. Hohe Präzision beim Matching.
  • Eltern-Chunks (groß, 500--1500 Tokens): Werden dem LLM als Kontext übergeben. Enthalten den vollständigen Zusammenhang.

Der Ablauf:

  1. Query-Embedding wird gegen die Kind-Chunks gesucht
  2. Die relevantesten Kind-Chunks werden identifiziert
  3. Statt der Kind-Chunks werden die zugehörigen Eltern-Chunks an das LLM übergeben
  4. Das LLM hat genug Kontext, um eine fundierte Antwort zu generieren

Beispieltext

Machine Learning ist ein Teilgebiet der künstlichen Intelligenz. Algorithmen lernen aus Daten, ohne explizit programmiert zu werden. Typische Anwendungen sind Bilderkennung, Sprachverarbeitung und Empfehlungssysteme. Neuronale Netze sind vom menschlichen Gehirn inspiriert. Sie bestehen aus Schichten von künstlichen Neuronen. Durch Training mit großen Datenmengen können sie komplexe Muster erkennen. Deep Learning nutzt besonders tiefe Netzwerke mit vielen Schichten. Transformer-Modelle haben die Sprachverarbeitung revolutioniert. Der Attention-Mechanismus erlaubt es, Beziehungen zwischen allen Wörtern gleichzeitig zu erfassen. GPT, BERT und T5 sind bekannte Transformer-Architekturen. Sie werden für Übersetzung, Zusammenfassung und Textgenerierung eingesetzt.

20 Wörter pro Chunk, 5 Wörter Overlap. Schneidet manchmal mitten im Satz.

#120 WörterSatz abgeschnittenMachine Learning ist ein Teilgebiet der künstlichen Intelligenz. Algorithmen lernen aus Daten, ohne explizit programmiert zu werden. Typische Anwendungen sind
#220 WörterSatz abgeschnittenzu werden. Typische Anwendungen sind Bilderkennung, Sprachverarbeitung und Empfehlungssysteme. Neuronale Netze sind vom menschlichen Gehirn inspiriert. Sie bestehen aus Schichten
#320 WörterSatz abgeschnitteninspiriert. Sie bestehen aus Schichten von künstlichen Neuronen. Durch Training mit großen Datenmengen können sie komplexe Muster erkennen. Deep Learning
#420 WörterSatz abgeschnittenkomplexe Muster erkennen. Deep Learning nutzt besonders tiefe Netzwerke mit vielen Schichten. Transformer-Modelle haben die Sprachverarbeitung revolutioniert. Der Attention-Mechanismus erlaubt
#520 WörterSprachverarbeitung revolutioniert. Der Attention-Mechanismus erlaubt es, Beziehungen zwischen allen Wörtern gleichzeitig zu erfassen. GPT, BERT und T5 sind bekannte Transformer-Architekturen.
#613 Wörterund T5 sind bekannte Transformer-Architekturen. Sie werden für Übersetzung, Zusammenfassung und Textgenerierung eingesetzt.

Chunks

6

Durchschn. Wörter

19

Overlap

5 Wörter

Vergleiche die drei Strategien und beobachte, wie sich Chunk-Größe und Qualität unterscheiden.

Warum verwendet Parent-Child Chunking unterschiedliche Chunks für Retrieval und Generierung?

Anwenden

Chunking-Strategie auswählen

DokumenttypEmpfohlene StrategieBegründung
Fließtext (Artikel, Berichte)Semantic ChunkingInhaltliche Bruchstellen bilden natürliche Einheiten
Strukturierte Dokumente (Verträge, Handbücher)Strukturbasiert + Parent-ChildVorhandene Gliederung nutzen, Hierarchie abbilden
Code-DokumentationFunktions-/Klassen-basiertLogische Code-Einheiten als Chunks
Tabellarische DatenZeilen- oder AbschnittsbasiertZeilen als atomare Einheiten erhalten
Chat-VerläufeNachrichten-basiert mit Kontext-WindowDialog-Turns als natürliche Einheiten

Overlap-Strategien im Detail

Overlap ist keine Universallösung, aber oft nützlich:

  • Token-Overlap: Feste Anzahl Tokens überlappen. Einfach, aber blind.
  • Satz-Overlap: Ganze Sätze am Rand des vorherigen Chunks wiederholen. Erhält grammatische Vollständigkeit.
  • Sliding Window: Chunks werden wie ein Fenster über den Text geschoben mit festem Schritt. Maximaler Overlap, aber auch maximale Redundanz in der DB.

Reflektieren

Überlege dir ein Szenario aus deiner Arbeitswelt: Welche Dokumente würdest du per RAG zugänglich machen? Welche Chunking-Strategie passt am besten -- und warum? Bedenke, dass die "richtige" Strategie immer vom Dokumenttyp und der Art der Fragen abhängt.