Zum Inhalt springen

Wann Fine-Tuning?

Wissen

Die häufigste Frage in der Praxis ist nicht "Wie mache ich Fine-Tuning?", sondern "Brauche ich überhaupt Fine-Tuning?". Die Antwort hängt von deinem konkreten Use Case ab -- und die falsche Entscheidung kostet entweder zu viel Geld oder liefert zu schlechte Ergebnisse.

Die Entscheidungskriterien

Prompt Engineering reicht, wenn:

  • Deine Aufgabe mit wenigen Beispielen (Few-Shot) gut funktioniert
  • Du flexibel zwischen verschiedenen Aufgaben wechseln willst
  • Du keine eigenen Trainingsdaten hast
  • Die Aufgabe generisch ist (Zusammenfassung, Übersetzung, Klassifizierung)

RAG ist besser, wenn:

  • Dein Wissen sich häufig ändert (Produktkataloge, Dokumentation, News)
  • Du Quellen nachvollziehbar referenzieren musst
  • Die Datenmenge groß ist (Tausende Dokumente)
  • Aktualität kritisch ist

Fine-Tuning ist nötig, wenn:

  • Das Modell einen spezifischen Stil oder Ton konsistent einhalten muss
  • Fachterminologie oder domänenspezifisches Reasoning erforderlich ist
  • Latenz und Kosten pro Anfrage minimiert werden müssen
  • Du ein kleines, spezialisiertes Modell statt eines großen General-Purpose-Modells brauchst
  • Prompt Engineering die Qualität nicht zuverlässig erreicht

Daten-Anforderungen

Fine-Tuning ist datengetrieben. Ohne qualitativ hochwertige Trainingsdaten scheitert jedes Projekt.

DatenmengeGeeignet fürQualitätsanforderung
50-200 BeispieleStil-Anpassung, FormatierungSehr hoch -- jedes Beispiel zählt
200-1.000 BeispieleDomänen-Anpassung, FachspracheHoch -- konsistente Qualität
1.000-10.000 BeispieleNeue Fähigkeiten, komplexes ReasoningMittel -- Diversität wichtiger als Perfektion
10.000+ BeispieleFull Fine-Tuning, SpezialmodelleAutomatische QA-Prozesse nötig

Kosten-Vergleich

Ein realistischer Kostenvergleich für einen Kundenservice-Chatbot mit 10.000 Anfragen pro Tag:

Prompt Engineering (GPT-5): ~500 Tokens Systemkontext pro Anfrage = ~150 USD/Monat für Inference.

RAG (GPT-5-mini + Vektordatenbank): ~200 Tokens Kontext + Retrieval = ~80 USD/Monat für Inference + 50 USD/Monat Infrastruktur.

Fine-Tuning (Llama 4 Maverick, LoRA): Einmaliges Training ~50 USD + ~30 USD/Monat für Self-Hosting (oder Pay-per-Token bei Anbietern).

Die Inference-Kosten sinken mit Fine-Tuning dramatisch, weil kürzere Prompts ausreichen und kleinere Modelle eingesetzt werden können.

Verstehen

Der Decision Tree in der Praxis

Nutze den interaktiven Entscheidungsbaum, um für deinen Use Case die richtige Strategie zu finden:

Entscheidungsbaum: Prompt Engineering vs RAG vs Fine-Tuning

Wie viele eigene Trainingsdaten hast du?

Ein Fintech-Startup will seinen Chatbot so trainieren, dass er regulatorische Fachbegriffe (MiFID II, KYC, AML) korrekt verwendet und immer im formellen Bankdeutsch antwortet. Welcher Ansatz ist am besten?

Anwenden

Die Hybrid-Strategie

In der Praxis ist die Antwort oft nicht "entweder oder", sondern eine Kombination:

  1. Prompt Engineering als Baseline -- schnell getestet, sofort nutzbar
  2. RAG für aktuelles Wissen -- Dokumente einbinden, Quellen referenzieren
  3. Fine-Tuning für Spezialisierung -- wenn die Baseline nicht reicht

Diesen Dreiklang findest du bei fast jedem erfolgreichen Enterprise-AI-Projekt. Ein fine-getuntes Modell, das zusätzlich per RAG auf aktuelle Daten zugreift und per System Prompt für die konkrete Aufgabe konfiguriert wird.

Dein Team hat ein Modell per Fine-Tuning auf medizinische Fachsprache trainiert. Jetzt soll es aktuelle Behandlungsleitlinien berücksichtigen, die sich quartalsweise ändern. Was empfiehlst du?

Reflektieren

Die Entscheidung zwischen Prompt Engineering, RAG und Fine-Tuning ist keine technische Frage allein -- sie ist eine Business-Entscheidung. Die Kosten, die Datenqualität, die Latenzanforderungen und die langfristige Wartbarkeit bestimmen den richtigen Ansatz. Und meistens ist die beste Lösung eine Kombination aller drei Säulen.