Training — Wie ein LLM lernt
Wissen
Ein LLM wie ChatGPT oder Claude wird nicht programmiert, um Fragen zu beantworten. Es wird trainiert — in mehreren Phasen, die aufeinander aufbauen. Dieser Prozess dauert Wochen bis Monate und erfordert tausende spezialisierte Computerchips (GPUs). Aber das Ergebnis ist beeindruckend: ein System, das menschliche Sprache verstehen und erzeugen kann.
Das Training besteht aus zwei zentralen Phasen:
Phase 1: Pre-Training — Sprache lernen
In der ersten Phase liest das Modell riesige Mengen an Text aus dem Internet: Bücher, Wikipedia-Artikel, Webseiten, Programmcode, wissenschaftliche Arbeiten und vieles mehr. Wir sprechen hier von Billionen von Wörtern — mehr Text, als ein Mensch in tausend Leben lesen könnte.
Dabei lernt das Modell keine Fakten auswendig. Stattdessen lernt es statistische Muster: Welche Wörter folgen wahrscheinlich aufeinander? Welche Satzstrukturen sind üblich? Wie hängen Konzepte zusammen? Das Modell lernt zum Beispiel, dass nach "Die Hauptstadt von Deutschland ist" sehr wahrscheinlich "Berlin" kommt — nicht weil es das als Fakt gespeichert hat, sondern weil es dieses Muster tausende Male gesehen hat.
Eine hilfreiche Analogie: Stell dir ein Kind vor, das Sprache lernt, indem es seiner Umgebung zuhört. Es hört tausende Sätze und erkennt nach und nach Muster: "Ich bin", "Du bist", "Er ist". Niemand erklärt dem Kind die Grammatikregeln — es lernt sie aus den Mustern. Genauso lernt ein LLM im Pre-Training.
Nach dem Pre-Training kann das Modell beeindruckend gut Texte vervollständigen. Aber es ist noch kein hilfreicher Assistent. Es ist eher wie eine Textmaschine, die einfach weiterschreibt — ohne Rücksicht darauf, ob die Antwort hilfreich, korrekt oder sicher ist.
Phase 2: RLHF — Umgangsformen lernen
RLHF steht für Reinforcement Learning from Human Feedback — auf Deutsch: Verstärkungslernen durch menschliches Feedback. In dieser Phase lernt das Modell, nicht einfach nur Text zu vervollständigen, sondern hilfreiche, harmlose und ehrliche Antworten zu geben.
So funktioniert es: Menschen stellen dem Modell Fragen und bekommen mehrere verschiedene Antworten. Dann bewerten sie diese Antworten: Welche ist am hilfreichsten? Welche ist am sichersten? Welche ist am genauesten? Aus diesen Bewertungen lernt das Modell, welche Art von Antworten bevorzugt werden.
Die Analogie weitergedacht: Wenn das Pre-Training wie "Sprache lernen" ist, dann ist RLHF wie "Umgangsformen lernen". Das Kind hat zuerst gelernt zu sprechen. Jetzt lernt es, wie man spricht: höflich sein, hilfreiche Antworten geben, keine gefährlichen Dinge sagen und zugeben, wenn man etwas nicht weiß.
iWarum RLHF so wichtig ist
Ohne RLHF wäre ein LLM nur eine Textvervollständigungsmaschine. Es würde auf die Frage "Wie kann ich jemandem helfen, der traurig ist?" vielleicht einfach einen Wikipedia-Artikel über Depression weiterschreiben, anstatt eine einfühlsame, praktische Antwort zu geben. RLHF ist der entscheidende Schritt, der aus einer Textmaschine einen hilfreichen Assistenten macht.
Der Trainings-Prozess eines LLM
Klicke auf einen Schritt, um Details zu sehen
Verstehen
Warum kann ein LLM nach dem Pre-Training noch kein guter Assistent sein?
Der Unterschied zwischen den beiden Phasen zeigt sich im Alltag. Wenn ein LLM eine Frage besonders klar und strukturiert beantwortet, Gefahren erkennt oder ehrlich sagt "Das weiß ich nicht" — dann ist das ein Ergebnis von RLHF. Die Sprachfähigkeit selbst kommt aus dem Pre-Training.
Ein konkretes Beispiel: Wenn du ein LLM fragst "Wie backe ich einen Kuchen?", könnte das Modell nach dem Pre-Training einen Text ausgeben, der mit einem Kuchenrezept beginnt, dann in einen Blogpost über Bäckereien übergeht und schließlich bei einem Zeitungsartikel über Weizenpreise landet. Nach RLHF gibt es dir eine klare, hilfreiche Schritt-für-Schritt-Anleitung.
Anwenden
Wenn du das nächste Mal ein LLM benutzt, achte auf diese Hinweise, die zeigen, dass RLHF gewirkt hat:
- Das Modell strukturiert seine Antwort klar (Überschriften, Aufzählungen, Schritte)
- Es warnt dich bei gefährlichen oder sensiblen Themen
- Es sagt "Ich bin mir nicht sicher" statt falsche Informationen zu erfinden
- Es fragt nach, wenn deine Frage unklar ist
Ausblick: RLHF war ein Durchbruch, aber die Forschung geht weiter. Neuere Methoden wie Constitutional AI (entwickelt von Anthropic, dem Unternehmen hinter Claude) lassen das Modell sich teilweise selbst bewerten, anhand von festgelegten Prinzipien. Eine andere Methode namens DPO (Direct Preference Optimization) vereinfacht den Trainingsprozess. Diese Methoden werden im Fortgeschrittenen-Pfad genauer erklärt.
Reflektieren
Ein Freund sagt: 'ChatGPT weiß alles, weil es das ganze Internet gelesen hat.' Was antwortest du?