Zum Inhalt springen

Context Strategies

Wissen

Jedes LLM hat ein Context Window -- die maximale Menge an Text, die es gleichzeitig "sehen" kann. Alles, was du an das Modell schickst (System-Prompt, Chatverlauf, Dokumente, deine aktuelle Frage) plus die Antwort muss in dieses Fenster passen.

Die Context-Window-Größen haben sich rasant entwickelt:

  • 2022: GPT-3.5 hatte 4.096 Tokens (~3.000 Wörter)
  • 2023: GPT-4 startete mit 8K Tokens (März 2023), GPT-4 Turbo brachte 128K Tokens (November 2023)
  • 2024: Gemini 1.5 Pro erreichte 1M Tokens (~750.000 Wörter)
  • 2025/26: Claude Opus 5 bietet 1M Tokens, Gemini 3.1 ebenfalls 1M

128K Tokens

GPT-4 Turbo / GPT-4o

128K

Bücher

~1.4 Bücher

Seiten

~191 Seiten

Code-Dateien

~512

je ~250 Tokens

Chat-Nachrichten

~3.200

je ~40 Tokens

Vergleich der Context Windows

Hinweis: Angaben sind Näherungswerte. 1 Token entspricht ca. 3/4 eines englischen Wortes.

Doch ein großes Context Window allein löst nicht alle Probleme. Mehr Kontext bedeutet höhere Kosten, längere Antwortzeiten und das Risiko, dass wichtige Informationen in der Mitte "verloren" gehen (das sogenannte Lost in the Middle-Problem).

Verstehen

Strategie 1: Sliding Window

Beim Sliding-Window-Ansatz behält das Modell nur die letzten N Nachrichten im Kontext. Ältere Nachrichten werden verworfen. Das ist die einfachste Strategie und funktioniert gut für kurze Gespräche.

Vorteil: Günstig, schnell, vorhersagbar. Nachteil: Das Modell "vergisst" frühe Teile des Gesprächs.

Strategie 2: Summarization

Eine intelligentere Variante: Statt alte Nachrichten zu verwerfen, fasst ein LLM sie zusammen. Die Zusammenfassung wird als Kontext beibehalten, während die Originalnachrichten entfernt werden.

Vorteil: Wichtige Informationen bleiben erhalten. Nachteil: Zusammenfassungen können Details verlieren; zusätzliche API-Calls nötig.

Strategie 3: RAG (Retrieval-Augmented Generation)

Statt alles in den Kontext zu packen, holt RAG nur die relevanten Informationen aus einer externen Datenbank. Die Suchanfrage bestimmt, welche Dokumente ins Context Window geladen werden.

Vorteil: Skaliert auf Millionen von Dokumenten; Kontext bleibt fokussiert. Nachteil: Erfordert Infrastruktur (Vector Database, Embedding Pipeline).

*Praxisregel

Kleine Kontexte (unter 10K Tokens): Sliding Window reicht. Mittlere Kontexte (10K-100K): Summarization hilft. Große Wissensbasen (100K+ Dokumente): RAG ist der richtige Ansatz.

Anwenden

Stell dir vor, du baust einen Chatbot für den Kundensupport eines Online-Shops. Der Chatbot soll:

  1. Auf 500 FAQ-Artikel zugreifen können
  2. Den Chatverlauf mit dem Kunden berücksichtigen
  3. Schnell und kosteneffizient antworten

Die optimale Lösung kombiniert Strategien: RAG für die FAQ-Artikel (nur relevante laden), Sliding Window für den aktuellen Chatverlauf und optional Summarization für längere Support-Sitzungen.

Reflektieren

Ein Nutzer führt seit 2 Stunden ein technisches Gespräch mit einem AI-Assistenten. Plötzlich scheint das Modell frühere Anweisungen vergessen zu haben. Was ist die wahrscheinlichste Ursache?