Zum Inhalt springen

RAG -- Retrieval-Augmented Generation

Wissen

LLMs haben ein fundamentales Problem: Ihr Wissen ist auf die Trainingsdaten begrenzt. Ein Modell, das im Januar 2026 trainiert wurde, weiß nichts über Ereignisse danach. Es kennt auch keine internen Unternehmensdokumente, keine privaten Datenbanken und keine täglichen Aktualisierungen.

Retrieval-Augmented Generation (RAG) löst dieses Problem. Statt das Modell neu zu trainieren, gibst du ihm relevante Informationen direkt im Prompt mit. RAG kombiniert zwei Stärken: die Fähigkeit eines LLMs, natürliche Sprache zu generieren, mit der Präzision einer Datenbank.

iRAG in einem Satz

RAG = Zuerst die richtigen Informationen finden, dann das LLM damit antworten lassen.

Verstehen

Die RAG-Pipeline in sechs Schritten

Klicke auf einen Schritt, um die Erklärung zu sehen. Die Animation zeigt den Datenfluss durch die RAG-Pipeline.

  1. Query: Der Nutzer stellt eine Frage, z.B. "Wie ist die Rückgabefrist bei Online-Bestellungen?"
  2. Embedding: Die Frage wird in einen Embedding-Vektor umgewandelt -- mit demselben Modell, das auch die Dokumente eingebettet hat.
  3. VectorDB: Der Frage-Vektor wird gegen die Vector Database abgeglichen, in der alle Dokument-Embeddings liegen.
  4. Retrieval: Die Top-K ähnlichsten Dokumente werden abgerufen und als Kontext für das LLM aufbereitet.
  5. LLM: Das Sprachmodell erhält die Frage plus die abgerufenen Dokumente und generiert eine Antwort, die auf beiden basiert.
  6. Answer: Die fundierte Antwort wird ausgegeben -- gestützt auf aktuelle, relevante Quellen statt nur auf Trainingsdaten.

RAG vs. reines Prompting

AspektReines PromptingRAG
WissensquelleNur TrainingsdatenTrainingsdaten + externe Dokumente
AktualitätStichtag des TrainingsSo aktuell wie die Datenbank
HalluzinationenHöher (kein Faktencheck)Niedriger (Antwort basiert auf Quellen)
QuellenangabenNicht möglichMöglich (Dokument-Referenzen)
AufwandMinimalEmbedding-Pipeline + Vector DB nötig

Warum reduziert RAG Halluzinationen im Vergleich zu reinem Prompting?

Anwenden

Wann RAG und wann nicht?

RAG ist sinnvoll bei:

  • Unternehmensspezifischem Wissen (interne Dokumentation, Richtlinien)
  • Sich häufig ändernden Informationen (Produktkataloge, Preise)
  • Bereichen, in denen Quellenangaben wichtig sind (Compliance, Recht)

RAG ist übertrieben bei:

  • Allgemeinwissen, das jedes LLM kennt ("Was ist die Hauptstadt von Frankreich?")
  • Kreativen Aufgaben ohne Faktenbasis (Gedichte schreiben, Brainstorming)
  • Einfachen Konversationen ohne Fachbezug

Die Indexierungs-Phase

Bevor RAG funktioniert, müssen die Dokumente vorbereitet werden:

  1. Chunking: Dokumente in kleinere Abschnitte aufteilen (z.B. 500 Tokens pro Chunk)
  2. Embedding: Jeden Chunk in einen Vektor umwandeln
  3. Speichern: Vektoren in einer Vector Database ablegen (z.B. Pinecone, Weaviate, pgvector)

Die Qualität des Chunkings hat großen Einfluss auf die Ergebnisse. Zu große Chunks verwischen die Relevanz, zu kleine verlieren den Zusammenhang.

Reflektieren

Dein Unternehmen hat 10.000 PDF-Dokumente mit internen Richtlinien. Mitarbeiter sollen per Chat Fragen dazu stellen können. Welcher Ansatz ist am geeignetsten?