Context Strategies
Wissen
Jedes LLM hat ein Context Window -- die maximale Menge an Text, die es gleichzeitig "sehen" kann. Alles, was du an das Modell schickst (System-Prompt, Chatverlauf, Dokumente, deine aktuelle Frage) plus die Antwort muss in dieses Fenster passen.
Die Context-Window-Größen haben sich rasant entwickelt:
- 2022: GPT-3.5 hatte 4.096 Tokens (~3.000 Wörter)
- 2023: GPT-4 startete mit 8K Tokens (März 2023), GPT-4 Turbo brachte 128K Tokens (November 2023)
- 2024: Gemini 1.5 Pro erreichte 1M Tokens (~750.000 Wörter)
- 2025/26: Claude Opus 5 bietet 1M Tokens, Gemini 3.1 ebenfalls 1M
128K Tokens
GPT-4 Turbo / GPT-4o
Bücher
~1.4 Bücher
Seiten
~191 Seiten
Code-Dateien
~512
je ~250 Tokens
Chat-Nachrichten
~3.200
je ~40 Tokens
Vergleich der Context Windows
Hinweis: Angaben sind Näherungswerte. 1 Token entspricht ca. 3/4 eines englischen Wortes.
Doch ein großes Context Window allein löst nicht alle Probleme. Mehr Kontext bedeutet höhere Kosten, längere Antwortzeiten und das Risiko, dass wichtige Informationen in der Mitte "verloren" gehen (das sogenannte Lost in the Middle-Problem).
Verstehen
Strategie 1: Sliding Window
Beim Sliding-Window-Ansatz behält das Modell nur die letzten N Nachrichten im Kontext. Ältere Nachrichten werden verworfen. Das ist die einfachste Strategie und funktioniert gut für kurze Gespräche.
Vorteil: Günstig, schnell, vorhersagbar. Nachteil: Das Modell "vergisst" frühe Teile des Gesprächs.
Strategie 2: Summarization
Eine intelligentere Variante: Statt alte Nachrichten zu verwerfen, fasst ein LLM sie zusammen. Die Zusammenfassung wird als Kontext beibehalten, während die Originalnachrichten entfernt werden.
Vorteil: Wichtige Informationen bleiben erhalten. Nachteil: Zusammenfassungen können Details verlieren; zusätzliche API-Calls nötig.
Strategie 3: RAG (Retrieval-Augmented Generation)
Statt alles in den Kontext zu packen, holt RAG nur die relevanten Informationen aus einer externen Datenbank. Die Suchanfrage bestimmt, welche Dokumente ins Context Window geladen werden.
Vorteil: Skaliert auf Millionen von Dokumenten; Kontext bleibt fokussiert. Nachteil: Erfordert Infrastruktur (Vector Database, Embedding Pipeline).
*Praxisregel
Kleine Kontexte (unter 10K Tokens): Sliding Window reicht. Mittlere Kontexte (10K-100K): Summarization hilft. Große Wissensbasen (100K+ Dokumente): RAG ist der richtige Ansatz.
Anwenden
Stell dir vor, du baust einen Chatbot für den Kundensupport eines Online-Shops. Der Chatbot soll:
- Auf 500 FAQ-Artikel zugreifen können
- Den Chatverlauf mit dem Kunden berücksichtigen
- Schnell und kosteneffizient antworten
Die optimale Lösung kombiniert Strategien: RAG für die FAQ-Artikel (nur relevante laden), Sliding Window für den aktuellen Chatverlauf und optional Summarization für längere Support-Sitzungen.
Reflektieren
Ein Nutzer führt seit 2 Stunden ein technisches Gespräch mit einem AI-Assistenten. Plötzlich scheint das Modell frühere Anweisungen vergessen zu haben. Was ist die wahrscheinlichste Ursache?