Wann Fine-Tuning?
Wissen
Die häufigste Frage in der Praxis ist nicht "Wie mache ich Fine-Tuning?", sondern "Brauche ich überhaupt Fine-Tuning?". Die Antwort hängt von deinem konkreten Use Case ab -- und die falsche Entscheidung kostet entweder zu viel Geld oder liefert zu schlechte Ergebnisse.
Die Entscheidungskriterien
Prompt Engineering reicht, wenn:
- Deine Aufgabe mit wenigen Beispielen (Few-Shot) gut funktioniert
- Du flexibel zwischen verschiedenen Aufgaben wechseln willst
- Du keine eigenen Trainingsdaten hast
- Die Aufgabe generisch ist (Zusammenfassung, Übersetzung, Klassifizierung)
RAG ist besser, wenn:
- Dein Wissen sich häufig ändert (Produktkataloge, Dokumentation, News)
- Du Quellen nachvollziehbar referenzieren musst
- Die Datenmenge groß ist (Tausende Dokumente)
- Aktualität kritisch ist
Fine-Tuning ist nötig, wenn:
- Das Modell einen spezifischen Stil oder Ton konsistent einhalten muss
- Fachterminologie oder domänenspezifisches Reasoning erforderlich ist
- Latenz und Kosten pro Anfrage minimiert werden müssen
- Du ein kleines, spezialisiertes Modell statt eines großen General-Purpose-Modells brauchst
- Prompt Engineering die Qualität nicht zuverlässig erreicht
Daten-Anforderungen
Fine-Tuning ist datengetrieben. Ohne qualitativ hochwertige Trainingsdaten scheitert jedes Projekt.
| Datenmenge | Geeignet für | Qualitätsanforderung |
|---|---|---|
| 50-200 Beispiele | Stil-Anpassung, Formatierung | Sehr hoch -- jedes Beispiel zählt |
| 200-1.000 Beispiele | Domänen-Anpassung, Fachsprache | Hoch -- konsistente Qualität |
| 1.000-10.000 Beispiele | Neue Fähigkeiten, komplexes Reasoning | Mittel -- Diversität wichtiger als Perfektion |
| 10.000+ Beispiele | Full Fine-Tuning, Spezialmodelle | Automatische QA-Prozesse nötig |
Kosten-Vergleich
Ein realistischer Kostenvergleich für einen Kundenservice-Chatbot mit 10.000 Anfragen pro Tag:
Prompt Engineering (GPT-5): ~500 Tokens Systemkontext pro Anfrage = ~150 USD/Monat für Inference.
RAG (GPT-5-mini + Vektordatenbank): ~200 Tokens Kontext + Retrieval = ~80 USD/Monat für Inference + 50 USD/Monat Infrastruktur.
Fine-Tuning (Llama 4 Maverick, LoRA): Einmaliges Training ~50 USD + ~30 USD/Monat für Self-Hosting (oder Pay-per-Token bei Anbietern).
Die Inference-Kosten sinken mit Fine-Tuning dramatisch, weil kürzere Prompts ausreichen und kleinere Modelle eingesetzt werden können.
Verstehen
Der Decision Tree in der Praxis
Nutze den interaktiven Entscheidungsbaum, um für deinen Use Case die richtige Strategie zu finden:
Entscheidungsbaum: Prompt Engineering vs RAG vs Fine-Tuning
Wie viele eigene Trainingsdaten hast du?
Ein Fintech-Startup will seinen Chatbot so trainieren, dass er regulatorische Fachbegriffe (MiFID II, KYC, AML) korrekt verwendet und immer im formellen Bankdeutsch antwortet. Welcher Ansatz ist am besten?
Anwenden
Die Hybrid-Strategie
In der Praxis ist die Antwort oft nicht "entweder oder", sondern eine Kombination:
- Prompt Engineering als Baseline -- schnell getestet, sofort nutzbar
- RAG für aktuelles Wissen -- Dokumente einbinden, Quellen referenzieren
- Fine-Tuning für Spezialisierung -- wenn die Baseline nicht reicht
Diesen Dreiklang findest du bei fast jedem erfolgreichen Enterprise-AI-Projekt. Ein fine-getuntes Modell, das zusätzlich per RAG auf aktuelle Daten zugreift und per System Prompt für die konkrete Aufgabe konfiguriert wird.
Dein Team hat ein Modell per Fine-Tuning auf medizinische Fachsprache trainiert. Jetzt soll es aktuelle Behandlungsleitlinien berücksichtigen, die sich quartalsweise ändern. Was empfiehlst du?
Reflektieren
Die Entscheidung zwischen Prompt Engineering, RAG und Fine-Tuning ist keine technische Frage allein -- sie ist eine Business-Entscheidung. Die Kosten, die Datenqualität, die Latenzanforderungen und die langfristige Wartbarkeit bestimmen den richtigen Ansatz. Und meistens ist die beste Lösung eine Kombination aller drei Säulen.