Benchmarks verstehen
iStand: September 2026
Die genannten Benchmark-Scores entsprechen dem Stand vom September 2026. Frontier-Modelle erscheinen im Monatsrhythmus — aktuelle Leaderboards findest du unter llm-stats.com, artificialanalysis.ai und swebench.com.
Wissen
Woher weißt du, ob ein LLM "besser" ist als ein anderes? Die AI-Branche nutzt Benchmarks -- standardisierte Tests, die Modelle in verschiedenen Kategorien bewerten. Aber nicht jeder Benchmark misst das Gleiche, und kein einzelner Benchmark gibt das vollständige Bild.
Die wichtigsten Benchmarks, die du kennen solltest:
MMLU (Massive Multitask Language Understanding)
- Was es misst: Fachwissen in 57 Bereichen (Mathematik, Recht, Medizin, Geschichte, etc.)
- Format: Multiple-Choice-Fragen
- Typische Scores: Top-Modelle erreichen 88-92 % (GPT-5.6, Claude Opus 5, Gemini 3.1 Pro liegen alle in diesem Bereich)
- Limitation: Multiple Choice testet Erkennen, nicht Anwenden. Ein Modell kann MMLU bestehen und trotzdem schlecht erklären. Inzwischen wird MMLU oft als "gesättigt" bezeichnet — Top-Modelle differenzieren sich kaum noch.
HumanEval
- Was es misst: Fähigkeit, Programmieraufgaben zu lösen
- Format: Python-Funktionen anhand von Docstrings schreiben
- Typische Scores: Top-Modelle lösen 90-95% der Aufgaben
- Limitation: Nur Python, relativ einfache Aufgaben. Reale Software-Entwicklung ist deutlich komplexer.
SWE-bench
- Was es misst: Fähigkeit, echte GitHub Issues zu lösen (Bugs fixen, Features implementieren)
- Format: Das Modell erhält ein Issue und muss einen funktionierenden Pull Request erzeugen
- Typische Scores (Stand September 2026): Top-Agenten lösen 90-97 % der Issues auf SWE-bench Verified — Spitze: Claude Opus 5 (96–97 %), GPT-5.6 Sol (96,2 %), Claude Mythos 5 (95,5 %, limitierter Zugang), Claude Fable 5 (95 %)
- Stärke: Misst reale Software-Engineering-Fähigkeiten, nicht nur isolierte Coding-Aufgaben
!Achtung: SWE-bench Verified ist kontaminiert
Im Frühjahr 2026 hat OpenAI in einem Audit festgestellt, dass alle getesteten Frontier-Modelle (GPT-5.2, Claude Opus 4.5, Gemini 3 Flash) Teile der "Gold Patches" oder Problem-Statements wörtlich reproduzieren konnten — die Aufgaben sind also vermutlich in den Trainingsdaten gewesen. OpenAI berichtet daher keine Verified-Scores mehr und empfiehlt SWE-bench Pro, wo die Top-Scores aktuell bei rund 46 % liegen. Wenn du Modelle vergleichst, achte darauf, welche SWE-bench-Variante zitiert wird.
Arena ELO (Chatbot Arena)
- Was es misst: Nutzerpräferenz im Blindvergleich
- Format: Zwei Modelle antworten anonym auf dieselbe Frage, der Nutzer wählt die bessere Antwort
- Stärke: Misst reale Nutzerzufriedenheit, nicht nur technische Metriken
- Limitation: Subjektiv, beeinflusst durch Antwortlänge und Stil
Verstehen
Modell-Vergleich: Open-Source LLMs
Hover auf eine Achse für Detailwerte. Klicke in der Legende, um Modelle ein-/auszublenden.
Modelle (klicken zum Ein-/Ausblenden)
Warum einzelne Benchmarks trügen
Ein Modell kann bei MMLU führen und im Alltag schlechter abschneiden als ein Modell mit niedrigerem Score. Warum?
- Kontamination: Benchmark-Fragen könnten in den Trainingsdaten gewesen sein
- Overfitting: Modelle können für spezifische Benchmarks optimiert werden
- Reale Aufgaben sind anders: MMLU fragt Multiple Choice, aber du brauchst lange Erklärungen. HumanEval testet einfache Funktionen, aber du brauchst komplexe Systeme.
Deshalb ist es wichtig, mehrere Benchmarks gemeinsam zu betrachten und eigene Tests für deinen spezifischen Use Case durchzuführen.
Nützliche Vergleichsplattformen
- artificialanalysis.ai: Vergleicht Modelle nach Speed, Preis und Qualität. Besonders nützlich für Kostenoptimierung.
- lmcouncil.ai: Automatisierte Bewertung von LLMs auf realen Aufgaben mit mehreren Evaluatoren.
Anwenden
Wenn du für ein Projekt das richtige LLM wählen musst, geh so vor:
- Use Case definieren: Was soll das Modell konkret tun? (Code schreiben? Texte zusammenfassen? Kunden beraten?)
- Relevante Benchmarks identifizieren: Code → HumanEval + SWE-bench. Allgemeinwissen → MMLU. Nutzerzufriedenheit → Arena ELO.
- Preis und Speed prüfen: artificialanalysis.ai zeigt Kosten pro Token und Geschwindigkeit.
- Eigene Evaluation machen: 20-50 typische Anfragen an 2-3 Modelle schicken und die Ergebnisse vergleichen.
*Die beste Strategie
Vertrau keinem einzelnen Benchmark. Erstelle stattdessen ein Eval-Set mit 30-50 Fragen, die deinen realen Use Case abbilden, und teste damit 2-3 Kandidaten-Modelle. Das dauert einen halben Tag und spart Monate an Frustration.
Jenseits einzelner Benchmarks: Der Weg zu AGI
Einzelne Benchmarks messen isolierte Fähigkeiten. Aber wie nah sind LLMs an allgemeiner Intelligenz? Der KI-Forscher Dan Hendrycks (UC Berkeley, bekannt für MMLU) hat ein Framework vorgeschlagen, das auf der Cattell-Horn-Carroll-Theorie (CHC) basiert — einem etablierten Intelligenzmodell aus der Psychologie.
Die Idee: Menschliche Intelligenz besteht aus mehreren kognitiven Dimensionen, und AGI (Artificial General Intelligence) wäre erreicht, wenn ein KI-System in allen diesen Dimensionen mindestens das Niveau eines gebildeten Erwachsenen erreicht:
| Dimension | Was sie misst | LLMs heute |
|---|---|---|
| Wissen | Faktenwissen, Fachwissen | Stark (MMLU 88-92 %) |
| Reasoning | Logisches Schlussfolgern | Stark (besonders mit Chain-of-Thought) |
| Arbeitsgedächtnis | Informationen aktiv halten | Gut (begrenzt durch Context Window) |
| Verarbeitungsgeschwindigkeit | Schnelle Informationsverarbeitung | Sehr stark |
| Kreativität | Neue Ideen generieren | Überraschend gut |
| Langzeitgedächtnis | Dauerhaft Gelerntes abrufen | Schwach — LLMs vergessen zwischen Sessions |
| Wahrnehmung | Sensorische Informationen verarbeiten | Wachsend (multimodal) |
| Soziale Kognition | Absichten und Emotionen anderer verstehen | Oberflächlich |
iDas 'Jagged Profile'
LLMs haben ein ungleichmäßiges Profil: Übermenschlich in Wissen und Geschwindigkeit, aber mit kritischen Lücken beim Langzeitgedächtnis und echtem Weltverständnis. AGI erfordert, dass alle Dimensionen ein Mindestniveau erreichen — nicht nur einige.
Das macht Benchmarks wie MMLU oder HumanEval zu einem Teil des Puzzles, aber nicht zum ganzen Bild. Ein Modell kann bei MMLU 90% erreichen und trotzdem keine Aufgabe lösen, die Langzeitgedächtnis über mehrere Tage erfordert.
Reflektieren
Ein neues LLM wirbt mit dem höchsten MMLU-Score aller Zeiten. Was ist die richtige Schlussfolgerung?