Energieverbrauch von LLMs
iStand: September 2026
Emissionsfaktoren und Trainingszahlen entsprechen dem Stand vom September 2026. Der deutsche Strommix-Wert stammt aus der jüngsten Erhebung des Umweltbundesamts (344 g CO2/kWh für 2025) und sinkt jährlich weiter.
Wissen
KI-Systeme verbrauchen Energie. Viel Energie. Und der Verbrauch wächst exponentiell mit der Modellgröße. Während die Branche sich auf Fähigkeiten und Benchmarks konzentriert, wird der ökologische Fußabdruck oft ignoriert -- oder bewusst heruntergespielt.
Als Experte musst du den Energieverbrauch deiner KI-Systeme nicht nur kennen, sondern aktiv optimieren. Das ist nicht nur eine ethische Frage, sondern auch eine ökonomische: Energie kostet Geld, und im EU AI Act müssen GPAI-Anbieter ihren Energieverbrauch seit 2025 transparent melden.
Training vs. Inferenz
Training: Der einmalige Energieschock
| Modell | Geschätzte Trainingsenergie | CO2-Äquivalent | Vergleich |
|---|---|---|---|
| GPT-3 (175B, 2020) | ~1.287 MWh | ~552 t CO2 | etwa 112 Autos, 1 Jahr |
| GPT-4 (geschätzt, 2023) | ~50.000-62.000 MWh | ~25.000-30.000 t CO2 | Kleinstadt, 1 Monat |
| Llama 3.1 405B (2024) | ~21.600 MWh | ~11.390 t CO2eq | Offiziell von Meta gemeldet |
Trend: Jede Modellgeneration verbraucht 3-10x mehr Trainingsenergie als die vorherige.
iKontext beachten
Diese Zahlen klingen dramatisch, aber Kontext ist wichtig: Das Training findet einmal statt und wird dann von Millionen Nutzern geteilt. Der Pro-Kopf-Verbrauch ist gering. Die Frage ist, ob der gesellschaftliche Nutzen den Energieaufwand rechtfertigt -- und wie man ihn minimiert.
Inferenz: Der stille Dauerverbraucher
- Einzelne Anfrage: ~0,001-0,01 kWh (je nach Modellgröße und Antwortlänge)
- ChatGPT (geschätzt): Mit über 900 Millionen wöchentlichen Nutzern liegt der geschätzte Tagesverbrauch bei mehreren Dutzend GWh
- Gesamte Inferenz-Branche: Der Inferenz-Verbrauch übersteigt den Trainingsverbrauch mittlerweile um den Faktor 3-10
Warum Inferenz langfristig problematischer ist: Training ist einmalig, Nutzerzahlen wachsen exponentiell, agentische Systeme vervielfachen die Anfragen, multimodale Modelle verbrauchen deutlich mehr.
CO2-Fußabdruck
Der CO2-Fußabdruck hängt entscheidend vom Strommix des Rechenzentrums ab:
| Rechenzentrumsstandort | CO2 pro kWh | Bewertung |
|---|---|---|
| Schweden, Norwegen (Wasserkraft) | ~20-30 g | Hervorragend |
| Frankreich (Atomkraft) | ~50-80 g | Gut |
| Deutschland (Energiemix) | ~344 g (UBA, 2025) | Mittel |
| USA (Durchschnitt) | ~380-420 g | Mittel |
| Indien, China (Kohle-lastig) | ~600-900 g | Schlecht |
Dasselbe Training verursacht in Norwegen 10x weniger CO2 als in Indien.
Wasserverbrauch
Neben Strom verbrauchen Rechenzentren erhebliche Mengen Wasser für die Kühlung:
- GPT-3 Training: Geschätzt 700.000 Liter Frischwasser
- Einzelne ChatGPT-Konversation (20-50 Fragen): ~500 ml Wasser (Schätzung aus 2023 — neuere Analysen deuten auf deutlich niedrigere Werte hin, ca. 0,3-5 ml pro einzelne Anfrage)
Verstehen
Optimierungsstrategien
1. Modell-Destillation -- Ein großes Modell (Teacher) trainiert ein kleineres (Student) für spezifische Aufgaben. Energieeinsparung: 80-95% für Inferenz.
2. Quantisierung -- Reduzierung der numerischen Präzision:
- FP32 → FP16: ~50% weniger Speicher
- FP16 → INT8: Weitere ~50% Reduktion
- INT8 → INT4: Nochmal ~50%, messbare aber oft akzeptable Einbußen
- Gesamteinsparung: INT4 braucht ~8x weniger Speicher und ~4x weniger Rechenleistung als FP32.
3. Caching und Prompt Caching -- Semantic Caching für repetitive Anfragen, Prompt Caching für lange System-Prompts. Einsparung bei repetitiven Workloads: bis zu 90%.
4. Routing: Richtige Modellgröße für die Aufgabe
Einfache Fragen (FAQ, Formatierung) → Kleines Modell (Haiku)
Mittlere Komplexität (Zusammenfassung) → Mittleres Modell (Sonnet)
Komplexes Reasoning (Analyse, Planung) → Großes Modell (Opus)
Ein intelligenter Router spart 60-80% der Inferenz-Kosten, weil 70-80% aller Anfragen einfach bis mittel sind.
5. Batch Processing statt Echtzeit -- Bessere Hardware-Auslastung, dynamisches Batching, Möglichkeit für günstigere Off-Peak-Zeiten.
Interaktiver Energie-Rechner
Berechne selbst, wie viel Energie deine KI-Nutzung verbraucht -- je nach Modell, Nutzungsintensität und Standort des Rechenzentrums:
Energie-Fussabdruck-Rechner
Berechne den Energieverbrauch deiner KI-Nutzung
Monatlicher Verbrauch
MittelDas entspricht...
18 km Autofahrt
900 Smartphone-Ladungen
0,9 Tage Haushaltsstrom
900 Stunden LED-Lampe
Geschätzte Werte basierend auf veröffentlichten Daten und Branchenschätzungen. Tatsächlicher Verbrauch kann variieren.
*Praktische Faustregel
Frag dich bei jedem KI-Einsatz: Brauche ich wirklich das größte Modell? Brauche ich Echtzeit? Kann ich cachen? Diese drei Fragen allein können 70-90% der Energie einsparen -- ohne Qualitätsverlust.
Anwenden
Ein Unternehmen betreibt einen KI-Chatbot mit 100.000 Anfragen pro Tag. 75% der Anfragen sind FAQ-Antworten, die sich kaum unterscheiden. Welche Optimierungsstrategie hat das größte Einsparpotenzial?
Reflektieren
Der Energieverbrauch von LLMs ist real und messbar -- aber auch optimierbar. Strategien wie Semantic Caching, Modell-Routing und effiziente Infrastruktur können den Footprint deutlich reduzieren. Im nächsten Abschnitt bringen wir alles zusammen mit Responsible AI Frameworks.