Zum Inhalt springen

Energieverbrauch von LLMs

iStand: September 2026

Emissionsfaktoren und Trainingszahlen entsprechen dem Stand vom September 2026. Der deutsche Strommix-Wert stammt aus der jüngsten Erhebung des Umweltbundesamts (344 g CO2/kWh für 2025) und sinkt jährlich weiter.

Wissen

KI-Systeme verbrauchen Energie. Viel Energie. Und der Verbrauch wächst exponentiell mit der Modellgröße. Während die Branche sich auf Fähigkeiten und Benchmarks konzentriert, wird der ökologische Fußabdruck oft ignoriert -- oder bewusst heruntergespielt.

Als Experte musst du den Energieverbrauch deiner KI-Systeme nicht nur kennen, sondern aktiv optimieren. Das ist nicht nur eine ethische Frage, sondern auch eine ökonomische: Energie kostet Geld, und im EU AI Act müssen GPAI-Anbieter ihren Energieverbrauch seit 2025 transparent melden.

Training vs. Inferenz

Training: Der einmalige Energieschock

ModellGeschätzte TrainingsenergieCO2-ÄquivalentVergleich
GPT-3 (175B, 2020)~1.287 MWh~552 t CO2etwa 112 Autos, 1 Jahr
GPT-4 (geschätzt, 2023)~50.000-62.000 MWh~25.000-30.000 t CO2Kleinstadt, 1 Monat
Llama 3.1 405B (2024)~21.600 MWh~11.390 t CO2eqOffiziell von Meta gemeldet

Trend: Jede Modellgeneration verbraucht 3-10x mehr Trainingsenergie als die vorherige.

iKontext beachten

Diese Zahlen klingen dramatisch, aber Kontext ist wichtig: Das Training findet einmal statt und wird dann von Millionen Nutzern geteilt. Der Pro-Kopf-Verbrauch ist gering. Die Frage ist, ob der gesellschaftliche Nutzen den Energieaufwand rechtfertigt -- und wie man ihn minimiert.

Inferenz: Der stille Dauerverbraucher

  • Einzelne Anfrage: ~0,001-0,01 kWh (je nach Modellgröße und Antwortlänge)
  • ChatGPT (geschätzt): Mit über 900 Millionen wöchentlichen Nutzern liegt der geschätzte Tagesverbrauch bei mehreren Dutzend GWh
  • Gesamte Inferenz-Branche: Der Inferenz-Verbrauch übersteigt den Trainingsverbrauch mittlerweile um den Faktor 3-10

Warum Inferenz langfristig problematischer ist: Training ist einmalig, Nutzerzahlen wachsen exponentiell, agentische Systeme vervielfachen die Anfragen, multimodale Modelle verbrauchen deutlich mehr.

CO2-Fußabdruck

Der CO2-Fußabdruck hängt entscheidend vom Strommix des Rechenzentrums ab:

RechenzentrumsstandortCO2 pro kWhBewertung
Schweden, Norwegen (Wasserkraft)~20-30 gHervorragend
Frankreich (Atomkraft)~50-80 gGut
Deutschland (Energiemix)~344 g (UBA, 2025)Mittel
USA (Durchschnitt)~380-420 gMittel
Indien, China (Kohle-lastig)~600-900 gSchlecht

Dasselbe Training verursacht in Norwegen 10x weniger CO2 als in Indien.

Wasserverbrauch

Neben Strom verbrauchen Rechenzentren erhebliche Mengen Wasser für die Kühlung:

  • GPT-3 Training: Geschätzt 700.000 Liter Frischwasser
  • Einzelne ChatGPT-Konversation (20-50 Fragen): ~500 ml Wasser (Schätzung aus 2023 — neuere Analysen deuten auf deutlich niedrigere Werte hin, ca. 0,3-5 ml pro einzelne Anfrage)

Verstehen

Optimierungsstrategien

1. Modell-Destillation -- Ein großes Modell (Teacher) trainiert ein kleineres (Student) für spezifische Aufgaben. Energieeinsparung: 80-95% für Inferenz.

2. Quantisierung -- Reduzierung der numerischen Präzision:

  • FP32 → FP16: ~50% weniger Speicher
  • FP16 → INT8: Weitere ~50% Reduktion
  • INT8 → INT4: Nochmal ~50%, messbare aber oft akzeptable Einbußen
  • Gesamteinsparung: INT4 braucht ~8x weniger Speicher und ~4x weniger Rechenleistung als FP32.

3. Caching und Prompt Caching -- Semantic Caching für repetitive Anfragen, Prompt Caching für lange System-Prompts. Einsparung bei repetitiven Workloads: bis zu 90%.

4. Routing: Richtige Modellgröße für die Aufgabe

Einfache Fragen (FAQ, Formatierung)     → Kleines Modell (Haiku)
Mittlere Komplexität (Zusammenfassung)  → Mittleres Modell (Sonnet)
Komplexes Reasoning (Analyse, Planung)  → Großes Modell (Opus)

Ein intelligenter Router spart 60-80% der Inferenz-Kosten, weil 70-80% aller Anfragen einfach bis mittel sind.

5. Batch Processing statt Echtzeit -- Bessere Hardware-Auslastung, dynamisches Batching, Möglichkeit für günstigere Off-Peak-Zeiten.

Interaktiver Energie-Rechner

Berechne selbst, wie viel Energie deine KI-Nutzung verbraucht -- je nach Modell, Nutzungsintensität und Standort des Rechenzentrums:

Energie-Fussabdruck-Rechner

Berechne den Energieverbrauch deiner KI-Nutzung

105001000

Monatlicher Verbrauch

Mittel
9,00kWh / Monat
2,970kg CO₂ / Monat
1,50Liter Wasser / Monat

Das entspricht...

Autofahrt

18 km Autofahrt

Smartphone

900 Smartphone-Ladungen

Haushalt

0,9 Tage Haushaltsstrom

LED-Lampe

900 Stunden LED-Lampe

Geschätzte Werte basierend auf veröffentlichten Daten und Branchenschätzungen. Tatsächlicher Verbrauch kann variieren.

*Praktische Faustregel

Frag dich bei jedem KI-Einsatz: Brauche ich wirklich das größte Modell? Brauche ich Echtzeit? Kann ich cachen? Diese drei Fragen allein können 70-90% der Energie einsparen -- ohne Qualitätsverlust.

Anwenden

Ein Unternehmen betreibt einen KI-Chatbot mit 100.000 Anfragen pro Tag. 75% der Anfragen sind FAQ-Antworten, die sich kaum unterscheiden. Welche Optimierungsstrategie hat das größte Einsparpotenzial?

Reflektieren

Der Energieverbrauch von LLMs ist real und messbar -- aber auch optimierbar. Strategien wie Semantic Caching, Modell-Routing und effiziente Infrastruktur können den Footprint deutlich reduzieren. Im nächsten Abschnitt bringen wir alles zusammen mit Responsible AI Frameworks.