RAG -- Retrieval-Augmented Generation
Wissen
LLMs haben ein fundamentales Problem: Ihr Wissen ist auf die Trainingsdaten begrenzt. Ein Modell, das im Januar 2026 trainiert wurde, weiß nichts über Ereignisse danach. Es kennt auch keine internen Unternehmensdokumente, keine privaten Datenbanken und keine täglichen Aktualisierungen.
Retrieval-Augmented Generation (RAG) löst dieses Problem. Statt das Modell neu zu trainieren, gibst du ihm relevante Informationen direkt im Prompt mit. RAG kombiniert zwei Stärken: die Fähigkeit eines LLMs, natürliche Sprache zu generieren, mit der Präzision einer Datenbank.
iRAG in einem Satz
RAG = Zuerst die richtigen Informationen finden, dann das LLM damit antworten lassen.
Verstehen
Die RAG-Pipeline in sechs Schritten
Klicke auf einen Schritt, um die Erklärung zu sehen. Die Animation zeigt den Datenfluss durch die RAG-Pipeline.
- Query: Der Nutzer stellt eine Frage, z.B. "Wie ist die Rückgabefrist bei Online-Bestellungen?"
- Embedding: Die Frage wird in einen Embedding-Vektor umgewandelt -- mit demselben Modell, das auch die Dokumente eingebettet hat.
- VectorDB: Der Frage-Vektor wird gegen die Vector Database abgeglichen, in der alle Dokument-Embeddings liegen.
- Retrieval: Die Top-K ähnlichsten Dokumente werden abgerufen und als Kontext für das LLM aufbereitet.
- LLM: Das Sprachmodell erhält die Frage plus die abgerufenen Dokumente und generiert eine Antwort, die auf beiden basiert.
- Answer: Die fundierte Antwort wird ausgegeben -- gestützt auf aktuelle, relevante Quellen statt nur auf Trainingsdaten.
RAG vs. reines Prompting
| Aspekt | Reines Prompting | RAG |
|---|---|---|
| Wissensquelle | Nur Trainingsdaten | Trainingsdaten + externe Dokumente |
| Aktualität | Stichtag des Trainings | So aktuell wie die Datenbank |
| Halluzinationen | Höher (kein Faktencheck) | Niedriger (Antwort basiert auf Quellen) |
| Quellenangaben | Nicht möglich | Möglich (Dokument-Referenzen) |
| Aufwand | Minimal | Embedding-Pipeline + Vector DB nötig |
Warum reduziert RAG Halluzinationen im Vergleich zu reinem Prompting?
Anwenden
Wann RAG und wann nicht?
RAG ist sinnvoll bei:
- Unternehmensspezifischem Wissen (interne Dokumentation, Richtlinien)
- Sich häufig ändernden Informationen (Produktkataloge, Preise)
- Bereichen, in denen Quellenangaben wichtig sind (Compliance, Recht)
RAG ist übertrieben bei:
- Allgemeinwissen, das jedes LLM kennt ("Was ist die Hauptstadt von Frankreich?")
- Kreativen Aufgaben ohne Faktenbasis (Gedichte schreiben, Brainstorming)
- Einfachen Konversationen ohne Fachbezug
Die Indexierungs-Phase
Bevor RAG funktioniert, müssen die Dokumente vorbereitet werden:
- Chunking: Dokumente in kleinere Abschnitte aufteilen (z.B. 500 Tokens pro Chunk)
- Embedding: Jeden Chunk in einen Vektor umwandeln
- Speichern: Vektoren in einer Vector Database ablegen (z.B. Pinecone, Weaviate, pgvector)
Die Qualität des Chunkings hat großen Einfluss auf die Ergebnisse. Zu große Chunks verwischen die Relevanz, zu kleine verlieren den Zusammenhang.
Reflektieren
Dein Unternehmen hat 10.000 PDF-Dokumente mit internen Richtlinien. Mitarbeiter sollen per Chat Fragen dazu stellen können. Welcher Ansatz ist am geeignetsten?