KI-Weltrangliste · Disziplin · Reichweite belegt · Fähigkeit geprüft

Mathematik

Sprachmodelle, bewertet speziell auf „Mathematik". Wer hier führt, ist nicht automatisch Gesamt-Erster. Jede Zahl mit Quelle und Lizenz — plus eigene Analyse, die kein anderer Anbieter liefert.

Mathematik

15 Modelle · Arena-Score · Stand 2026-09-01

Sprachmodelle, bewertet speziell auf „Mathematik". Wer hier führt, ist nicht automatisch Gesamt-Erster.

#ModellArena-ScoreStimmenLizenz
1 claude-opus-5-maxAnthropic 1542±22 738 proprietär
2 claude-opus-5-highAnthropic 1535±16 2 Tsd. proprietär
3 gemini-3.7-flash-highGoogle 1527±33 313 proprietär
4 claude-fable-5Anthropic 1525±17 1 Tsd. proprietär
5 claude-opus-4-6-highAnthropic 1516±10 4 Tsd. proprietär
6 claude-opus-4-6Anthropic 1512±10 4 Tsd. proprietär
7 gemini-3.5-flash-highGoogle 1510±15 2 Tsd. proprietär
8 glm-5.3-maxZ.ai 1506±33 287 offen
9 gemini-3.6-flash-highGoogle 1505±19 1 Tsd. proprietär
10 qwen3.8-maxAlibaba 1500±24 583 proprietär
11 claude-opus-4-7-highAnthropic 1498±11 3 Tsd. proprietär
12 kimi-k3-maxMoonshot 1497±22 756 offen
13 qwen3.7-max-previewAlibaba 1493±40 218 proprietär
14 gpt-5.4-highOpenAI 1490±11 3 Tsd. proprietär
15 claude-opus-4-7Anthropic 1489±11 3 Tsd. proprietär

Quelle: © LMArena (lmarena-ai), lizenziert CC-BY-4.0 · 1:1 wiedergegeben (Modell, Anbieter, Arena-Score, Stimmen, Lizenz), deutsch beschriftet + von uns analysiert. Arena-Score = Bradley-Terry-Wert aus blinden Mensch-Votes. Logos aus eigener Logo-DB.

Was diese Rangliste nicht misst.

Der Arena-Score misst bevorzugte Antworten, nicht nachhaltiges Können über lange, autonome Aufgaben. Genau diese Lücke schließt Global Rank mit einer eigenen Capability-Achse aus der Aufnahmeprüfung — die einzige, die nicht zukaufbar ist.

Saubere Übersicht →