MLOps für Fine-Tuning
Wissen
Fine-Tuning endet nicht, wenn das Training abgeschlossen ist. In der Praxis scheitern die meisten Projekte nicht am Modelltraining, sondern an allem drumherum: schlechte Datenqualität, fehlende Evaluation, kein Monitoring in Produktion. MLOps (Machine Learning Operations) ist die Disziplin, die dieses "Drumherum" systematisiert.
Die fünf Phasen eines Fine-Tuning-Projekts
Phase 1: Datenvorbereitung
Das Fundament. Deine Daten bestimmen die Qualität deines Modells.
- Daten sammeln: Interne Dokumente, Kundenservice-Logs, Fachtext-Korpora
- Daten bereinigen: Duplikate entfernen, Formatierung vereinheitlichen, PII (personenbezogene Daten) entfernen
- Daten formatieren: Instruction-Tuning-Format (Prompt-Completion-Paare), Chat-Format oder Preference-Daten (für DPO/RLHF)
- Train/Eval/Test-Split: Typischerweise 80/10/10 oder 90/5/5
{"messages": [
{"role": "system", "content": "Du bist ein Versicherungsberater."},
{"role": "user", "content": "Was deckt meine Hausratversicherung bei Wasserschaden ab?"},
{"role": "assistant", "content": "Ihre Hausratversicherung deckt Leitungswasserschäden ab..."}
]}
Phase 2: Training
Mit vorbereiteten Daten und gewähltem Basismodell startet das eigentliche Training.
- Hyperparameter setzen: Learning Rate (typisch: 1e-4 bis 2e-5), Epochs (1-5), Batch Size, LoRA-Rang
- Training starten: Hugging Face Trainer, Unsloth oder Axolotl
- Monitoring: Loss-Kurve beobachten -- sinkt sie stetig oder oszilliert sie?
- Checkpoints: Regelmäßig Zwischenstände speichern
Phase 3: Evaluation
Das fertige Modell muss beweisen, dass es besser ist als die Baseline.
- Automatische Metriken: Perplexity, ROUGE (für Zusammenfassungen), BLEU (für Übersetzungen), Pass@k (für Code)
- Human Evaluation: Experten bewerten Output-Qualität auf einer Skala
- A/B-Vergleich: Fine-Tuned Model vs. Basismodell + Prompt Engineering
- Regressionstests: Kann das Modell nach dem Fine-Tuning immer noch allgemeine Aufgaben lösen? (Catastrophic Forgetting)
Phase 4: Deployment
Das evaluierte Modell kommt in die Produktion.
- Model Registry: Versionierung der Modelle (MLflow Model Registry, Hugging Face Hub)
- Serving-Infrastruktur: vLLM, TGI (Text Generation Inference), NVIDIA Triton
- Quantisierung für Inference: GPTQ, AWQ oder GGUF für effizientes Serving
- API-Layer: FastAPI, LitServe oder Cloud-Provider-Endpoints
Phase 5: Monitoring
In Produktion muss das Modell kontinuierlich überwacht werden.
- Performance-Metriken: Latenz, Throughput, Error-Rate
- Qualitäts-Metriken: Nutzerfeedback, automatische Qualitätschecks
- Drift-Detection: Verändern sich die Eingabedaten? Verändert sich die Output-Qualität?
- Kosten-Tracking: Token-Verbrauch, GPU-Auslastung, Kosten pro Anfrage
Verstehen
Tooling-Landschaft
Weights & Biases (W&B): Der De-facto-Standard für Experiment-Tracking. Loggt Hyperparameter, Loss-Kurven, Metriken und Modell-Artefakte. Kostenlos für Einzelpersonen.
import wandb
wandb.init(project="fine-tuning-kundenservice")
wandb.config.update({
"base_model": "meta-llama/Llama-4-Maverick",
"lora_r": 16,
"learning_rate": 2e-5,
"epochs": 3
})
# Training-Loop -- W&B loggt automatisch
trainer.train()
wandb.finish()
MLflow: Open-Source-Alternative zu W&B. Fokus auf Model Registry und Deployment. Gut für Teams, die Daten nicht in die Cloud schicken wollen.
Hugging Face Hub: Nicht nur Modell-Download, sondern auch Model Registry und Deployment. Integriert sich nahtlos mit dem Transformers-Ökosystem.
Die häufigsten Fehler
- Zu wenig Evaluationsaufwand: Teams trainieren tagelang, evaluieren aber nur 5 Minuten. Investiere mindestens 20% der Projektzeit in Evaluation.
- Kein Baseline-Vergleich: Ohne Baseline weißt du nicht, ob Fine-Tuning überhaupt geholfen hat. Immer erst Prompt Engineering + RAG testen.
- Catastrophic Forgetting ignorieren: Dein Modell kann durch Fine-Tuning allgemeine Fähigkeiten verlieren. Teste immer auch generelle Aufgaben.
- Kein Monitoring in Produktion: Modelle degradieren über die Zeit, weil sich Nutzungspatterns ändern. Ohne Monitoring merkst du es zu spät.
Dein Team hat ein Modell fine-getuned und der Eval-Loss ist deutlich niedriger als der Trainings-Loss des Basismodells. Beim A/B-Test mit echten Nutzern schneidet das Modell aber schlechter ab als erwartet. Was ist die wahrscheinlichste Ursache?
Anwenden
Minimaler MLOps-Stack für den Einstieg
Du brauchst nicht sofort Enterprise-Tooling. Dieser Stack reicht für die ersten Projekte:
- Datenvorbereitung: Python-Skript + Pandas für Bereinigung, Hugging Face Datasets für Formatierung
- Training: Unsloth (schnell) oder Hugging Face Trainer (flexibel) mit LoRA/QLoRA
- Experiment-Tracking: Weights & Biases (kostenloser Account)
- Evaluation: lm-eval-harness für automatische Benchmarks + manuelle Stichproben
- Deployment: vLLM auf einer Cloud-GPU oder Hugging Face Inference Endpoints
- Monitoring: W&B Monitoring oder einfaches Logging + Dashboards
Der Workflow als Checkliste
- Trainingsdaten gesammelt und bereinigt
- Train/Eval/Test-Split erstellt
- Baseline-Performance mit Prompt Engineering gemessen
- LoRA-Konfiguration festgelegt (Rang, Alpha, Target Modules)
- Training gestartet und Loss-Kurve beobachtet
- Evaluation auf Eval-Set und manuelle Stichproben
- A/B-Vergleich: Fine-Tuned vs. Baseline
- Regressionstests für allgemeine Fähigkeiten
- Modell quantisiert und deployed
- Monitoring eingerichtet
Reflektieren
MLOps ist kein optionales Add-on, sondern die Grundlage für produktive AI-Systeme. Die meisten Teams investieren 80% in Training und 20% in alles andere -- erfolgreiche Teams kehren dieses Verhältnis fast um. Datenqualität, systematische Evaluation und kontinuierliches Monitoring unterscheiden ein erfolgreiches Fine-Tuning-Projekt von einem teuren Experiment.