Zum Inhalt springen

MLOps für Fine-Tuning

Wissen

Fine-Tuning endet nicht, wenn das Training abgeschlossen ist. In der Praxis scheitern die meisten Projekte nicht am Modelltraining, sondern an allem drumherum: schlechte Datenqualität, fehlende Evaluation, kein Monitoring in Produktion. MLOps (Machine Learning Operations) ist die Disziplin, die dieses "Drumherum" systematisiert.

Die fünf Phasen eines Fine-Tuning-Projekts

Phase 1: Datenvorbereitung

Das Fundament. Deine Daten bestimmen die Qualität deines Modells.

  • Daten sammeln: Interne Dokumente, Kundenservice-Logs, Fachtext-Korpora
  • Daten bereinigen: Duplikate entfernen, Formatierung vereinheitlichen, PII (personenbezogene Daten) entfernen
  • Daten formatieren: Instruction-Tuning-Format (Prompt-Completion-Paare), Chat-Format oder Preference-Daten (für DPO/RLHF)
  • Train/Eval/Test-Split: Typischerweise 80/10/10 oder 90/5/5
{"messages": [
  {"role": "system", "content": "Du bist ein Versicherungsberater."},
  {"role": "user", "content": "Was deckt meine Hausratversicherung bei Wasserschaden ab?"},
  {"role": "assistant", "content": "Ihre Hausratversicherung deckt Leitungswasserschäden ab..."}
]}

Phase 2: Training

Mit vorbereiteten Daten und gewähltem Basismodell startet das eigentliche Training.

  • Hyperparameter setzen: Learning Rate (typisch: 1e-4 bis 2e-5), Epochs (1-5), Batch Size, LoRA-Rang
  • Training starten: Hugging Face Trainer, Unsloth oder Axolotl
  • Monitoring: Loss-Kurve beobachten -- sinkt sie stetig oder oszilliert sie?
  • Checkpoints: Regelmäßig Zwischenstände speichern

Phase 3: Evaluation

Das fertige Modell muss beweisen, dass es besser ist als die Baseline.

  • Automatische Metriken: Perplexity, ROUGE (für Zusammenfassungen), BLEU (für Übersetzungen), Pass@k (für Code)
  • Human Evaluation: Experten bewerten Output-Qualität auf einer Skala
  • A/B-Vergleich: Fine-Tuned Model vs. Basismodell + Prompt Engineering
  • Regressionstests: Kann das Modell nach dem Fine-Tuning immer noch allgemeine Aufgaben lösen? (Catastrophic Forgetting)

Phase 4: Deployment

Das evaluierte Modell kommt in die Produktion.

  • Model Registry: Versionierung der Modelle (MLflow Model Registry, Hugging Face Hub)
  • Serving-Infrastruktur: vLLM, TGI (Text Generation Inference), NVIDIA Triton
  • Quantisierung für Inference: GPTQ, AWQ oder GGUF für effizientes Serving
  • API-Layer: FastAPI, LitServe oder Cloud-Provider-Endpoints

Phase 5: Monitoring

In Produktion muss das Modell kontinuierlich überwacht werden.

  • Performance-Metriken: Latenz, Throughput, Error-Rate
  • Qualitäts-Metriken: Nutzerfeedback, automatische Qualitätschecks
  • Drift-Detection: Verändern sich die Eingabedaten? Verändert sich die Output-Qualität?
  • Kosten-Tracking: Token-Verbrauch, GPU-Auslastung, Kosten pro Anfrage

Verstehen

Tooling-Landschaft

Weights & Biases (W&B): Der De-facto-Standard für Experiment-Tracking. Loggt Hyperparameter, Loss-Kurven, Metriken und Modell-Artefakte. Kostenlos für Einzelpersonen.

import wandb

wandb.init(project="fine-tuning-kundenservice")
wandb.config.update({
    "base_model": "meta-llama/Llama-4-Maverick",
    "lora_r": 16,
    "learning_rate": 2e-5,
    "epochs": 3
})

# Training-Loop -- W&B loggt automatisch
trainer.train()

wandb.finish()

MLflow: Open-Source-Alternative zu W&B. Fokus auf Model Registry und Deployment. Gut für Teams, die Daten nicht in die Cloud schicken wollen.

Hugging Face Hub: Nicht nur Modell-Download, sondern auch Model Registry und Deployment. Integriert sich nahtlos mit dem Transformers-Ökosystem.

Die häufigsten Fehler

  1. Zu wenig Evaluationsaufwand: Teams trainieren tagelang, evaluieren aber nur 5 Minuten. Investiere mindestens 20% der Projektzeit in Evaluation.
  2. Kein Baseline-Vergleich: Ohne Baseline weißt du nicht, ob Fine-Tuning überhaupt geholfen hat. Immer erst Prompt Engineering + RAG testen.
  3. Catastrophic Forgetting ignorieren: Dein Modell kann durch Fine-Tuning allgemeine Fähigkeiten verlieren. Teste immer auch generelle Aufgaben.
  4. Kein Monitoring in Produktion: Modelle degradieren über die Zeit, weil sich Nutzungspatterns ändern. Ohne Monitoring merkst du es zu spät.

Dein Team hat ein Modell fine-getuned und der Eval-Loss ist deutlich niedriger als der Trainings-Loss des Basismodells. Beim A/B-Test mit echten Nutzern schneidet das Modell aber schlechter ab als erwartet. Was ist die wahrscheinlichste Ursache?

Anwenden

Minimaler MLOps-Stack für den Einstieg

Du brauchst nicht sofort Enterprise-Tooling. Dieser Stack reicht für die ersten Projekte:

  1. Datenvorbereitung: Python-Skript + Pandas für Bereinigung, Hugging Face Datasets für Formatierung
  2. Training: Unsloth (schnell) oder Hugging Face Trainer (flexibel) mit LoRA/QLoRA
  3. Experiment-Tracking: Weights & Biases (kostenloser Account)
  4. Evaluation: lm-eval-harness für automatische Benchmarks + manuelle Stichproben
  5. Deployment: vLLM auf einer Cloud-GPU oder Hugging Face Inference Endpoints
  6. Monitoring: W&B Monitoring oder einfaches Logging + Dashboards

Der Workflow als Checkliste

  • Trainingsdaten gesammelt und bereinigt
  • Train/Eval/Test-Split erstellt
  • Baseline-Performance mit Prompt Engineering gemessen
  • LoRA-Konfiguration festgelegt (Rang, Alpha, Target Modules)
  • Training gestartet und Loss-Kurve beobachtet
  • Evaluation auf Eval-Set und manuelle Stichproben
  • A/B-Vergleich: Fine-Tuned vs. Baseline
  • Regressionstests für allgemeine Fähigkeiten
  • Modell quantisiert und deployed
  • Monitoring eingerichtet

Reflektieren

MLOps ist kein optionales Add-on, sondern die Grundlage für produktive AI-Systeme. Die meisten Teams investieren 80% in Training und 20% in alles andere -- erfolgreiche Teams kehren dieses Verhältnis fast um. Datenqualität, systematische Evaluation und kontinuierliches Monitoring unterscheiden ein erfolgreiches Fine-Tuning-Projekt von einem teuren Experiment.