Zum Inhalt springen

Benchmarks verstehen

iStand: September 2026

Die genannten Benchmark-Scores entsprechen dem Stand vom September 2026. Frontier-Modelle erscheinen im Monatsrhythmus — aktuelle Leaderboards findest du unter llm-stats.com, artificialanalysis.ai und swebench.com.

Wissen

Woher weißt du, ob ein LLM "besser" ist als ein anderes? Die AI-Branche nutzt Benchmarks -- standardisierte Tests, die Modelle in verschiedenen Kategorien bewerten. Aber nicht jeder Benchmark misst das Gleiche, und kein einzelner Benchmark gibt das vollständige Bild.

Die wichtigsten Benchmarks, die du kennen solltest:

MMLU (Massive Multitask Language Understanding)

  • Was es misst: Fachwissen in 57 Bereichen (Mathematik, Recht, Medizin, Geschichte, etc.)
  • Format: Multiple-Choice-Fragen
  • Typische Scores: Top-Modelle erreichen 88-92 % (GPT-5.6, Claude Opus 5, Gemini 3.1 Pro liegen alle in diesem Bereich)
  • Limitation: Multiple Choice testet Erkennen, nicht Anwenden. Ein Modell kann MMLU bestehen und trotzdem schlecht erklären. Inzwischen wird MMLU oft als "gesättigt" bezeichnet — Top-Modelle differenzieren sich kaum noch.

HumanEval

  • Was es misst: Fähigkeit, Programmieraufgaben zu lösen
  • Format: Python-Funktionen anhand von Docstrings schreiben
  • Typische Scores: Top-Modelle lösen 90-95% der Aufgaben
  • Limitation: Nur Python, relativ einfache Aufgaben. Reale Software-Entwicklung ist deutlich komplexer.

SWE-bench

  • Was es misst: Fähigkeit, echte GitHub Issues zu lösen (Bugs fixen, Features implementieren)
  • Format: Das Modell erhält ein Issue und muss einen funktionierenden Pull Request erzeugen
  • Typische Scores (Stand September 2026): Top-Agenten lösen 90-97 % der Issues auf SWE-bench Verified — Spitze: Claude Opus 5 (96–97 %), GPT-5.6 Sol (96,2 %), Claude Mythos 5 (95,5 %, limitierter Zugang), Claude Fable 5 (95 %)
  • Stärke: Misst reale Software-Engineering-Fähigkeiten, nicht nur isolierte Coding-Aufgaben

!Achtung: SWE-bench Verified ist kontaminiert

Im Frühjahr 2026 hat OpenAI in einem Audit festgestellt, dass alle getesteten Frontier-Modelle (GPT-5.2, Claude Opus 4.5, Gemini 3 Flash) Teile der "Gold Patches" oder Problem-Statements wörtlich reproduzieren konnten — die Aufgaben sind also vermutlich in den Trainingsdaten gewesen. OpenAI berichtet daher keine Verified-Scores mehr und empfiehlt SWE-bench Pro, wo die Top-Scores aktuell bei rund 46 % liegen. Wenn du Modelle vergleichst, achte darauf, welche SWE-bench-Variante zitiert wird.

Arena ELO (Chatbot Arena)

  • Was es misst: Nutzerpräferenz im Blindvergleich
  • Format: Zwei Modelle antworten anonym auf dieselbe Frage, der Nutzer wählt die bessere Antwort
  • Stärke: Misst reale Nutzerzufriedenheit, nicht nur technische Metriken
  • Limitation: Subjektiv, beeinflusst durch Antwortlänge und Stil

Verstehen

Modell-Vergleich: Open-Source LLMs

Hover auf eine Achse für Detailwerte. Klicke in der Legende, um Modelle ein-/auszublenden.

PerformanceKostenKontextlängeLizenzCommunitySprachen

Modelle (klicken zum Ein-/Ausblenden)

Warum einzelne Benchmarks trügen

Ein Modell kann bei MMLU führen und im Alltag schlechter abschneiden als ein Modell mit niedrigerem Score. Warum?

  1. Kontamination: Benchmark-Fragen könnten in den Trainingsdaten gewesen sein
  2. Overfitting: Modelle können für spezifische Benchmarks optimiert werden
  3. Reale Aufgaben sind anders: MMLU fragt Multiple Choice, aber du brauchst lange Erklärungen. HumanEval testet einfache Funktionen, aber du brauchst komplexe Systeme.

Deshalb ist es wichtig, mehrere Benchmarks gemeinsam zu betrachten und eigene Tests für deinen spezifischen Use Case durchzuführen.

Nützliche Vergleichsplattformen

  • artificialanalysis.ai: Vergleicht Modelle nach Speed, Preis und Qualität. Besonders nützlich für Kostenoptimierung.
  • lmcouncil.ai: Automatisierte Bewertung von LLMs auf realen Aufgaben mit mehreren Evaluatoren.

Anwenden

Wenn du für ein Projekt das richtige LLM wählen musst, geh so vor:

  1. Use Case definieren: Was soll das Modell konkret tun? (Code schreiben? Texte zusammenfassen? Kunden beraten?)
  2. Relevante Benchmarks identifizieren: Code → HumanEval + SWE-bench. Allgemeinwissen → MMLU. Nutzerzufriedenheit → Arena ELO.
  3. Preis und Speed prüfen: artificialanalysis.ai zeigt Kosten pro Token und Geschwindigkeit.
  4. Eigene Evaluation machen: 20-50 typische Anfragen an 2-3 Modelle schicken und die Ergebnisse vergleichen.

*Die beste Strategie

Vertrau keinem einzelnen Benchmark. Erstelle stattdessen ein Eval-Set mit 30-50 Fragen, die deinen realen Use Case abbilden, und teste damit 2-3 Kandidaten-Modelle. Das dauert einen halben Tag und spart Monate an Frustration.

Jenseits einzelner Benchmarks: Der Weg zu AGI

Einzelne Benchmarks messen isolierte Fähigkeiten. Aber wie nah sind LLMs an allgemeiner Intelligenz? Der KI-Forscher Dan Hendrycks (UC Berkeley, bekannt für MMLU) hat ein Framework vorgeschlagen, das auf der Cattell-Horn-Carroll-Theorie (CHC) basiert — einem etablierten Intelligenzmodell aus der Psychologie.

Die Idee: Menschliche Intelligenz besteht aus mehreren kognitiven Dimensionen, und AGI (Artificial General Intelligence) wäre erreicht, wenn ein KI-System in allen diesen Dimensionen mindestens das Niveau eines gebildeten Erwachsenen erreicht:

DimensionWas sie misstLLMs heute
WissenFaktenwissen, FachwissenStark (MMLU 88-92 %)
ReasoningLogisches SchlussfolgernStark (besonders mit Chain-of-Thought)
ArbeitsgedächtnisInformationen aktiv haltenGut (begrenzt durch Context Window)
VerarbeitungsgeschwindigkeitSchnelle InformationsverarbeitungSehr stark
KreativitätNeue Ideen generierenÜberraschend gut
LangzeitgedächtnisDauerhaft Gelerntes abrufenSchwach — LLMs vergessen zwischen Sessions
WahrnehmungSensorische Informationen verarbeitenWachsend (multimodal)
Soziale KognitionAbsichten und Emotionen anderer verstehenOberflächlich

iDas 'Jagged Profile'

LLMs haben ein ungleichmäßiges Profil: Übermenschlich in Wissen und Geschwindigkeit, aber mit kritischen Lücken beim Langzeitgedächtnis und echtem Weltverständnis. AGI erfordert, dass alle Dimensionen ein Mindestniveau erreichen — nicht nur einige.

Das macht Benchmarks wie MMLU oder HumanEval zu einem Teil des Puzzles, aber nicht zum ganzen Bild. Ein Modell kann bei MMLU 90% erreichen und trotzdem keine Aufgabe lösen, die Langzeitgedächtnis über mehrere Tage erfordert.

Reflektieren

Ein neues LLM wirbt mit dem höchsten MMLU-Score aller Zeiten. Was ist die richtige Schlussfolgerung?