LLM Leaderboard
Ranked by LMArena Elo · source LMArena
Human preference Elo from chatbot arena head-to-head votes.
#1 by LMArena Elo
Claude Opus 5 (Adaptive Reasoning, High Effort)
1505
Anthropic · in $5.00 / out $25.0 per 1M · 51 tok/s
| # | Model | LMArena |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, High Effort) | 1505 |
| 2 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | 1498 |
| 3 | Claude Opus 4.6 (Non-reasoning, High Effort) | 1498 |
| 4 | Gemini 3.8 Flash (high) | 1495 |
| 5 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 5 Fallback) | 1493 |
| 6 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 1493 |
| 7 | Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) | 1493 |
| 8 | Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) | 1493 |
| 9 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | 1493 |
| 10 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | 1493 |
| 11 | Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) | 1493 |
| 12 | Gemini 3.7 Flash (high) | 1490 |
| 13 | Muse Spark 1.3 (max) | 1490 |
| 14 | Muse Spark 1.2 (xhigh) | 1489 |
| 15 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | 1483 |
| 16 | Claude Opus 4.7 (Non-reasoning, High Effort) | 1483 |
| 17 | Gemini 3.5 Flash (high) | 1482 |
| 18 | Qwen3.8 Max | 1481 |
| 19 | Muse Spark 1.1 (xhigh) | 1480 |
| 20 | Gemini 3.1 Pro Preview | 1480 |
| 21 | Gemini 3 Pro Preview (high) | 1479 |
| 22 | Gemini 3 Pro Preview (low) | 1479 |
| 23 | Gemini 3.6 Flash (high) | 1476 |
| 24 | Gemini 3.5 Flash (medium) | 1476 |
| 25 | GLM-5.3 (max) | 1475 |
| 26 | Qwen3.7 Max | 1474 |
| 27 | Muse Spark 1.3 (max) | 1473 |
| 28 | Muse Spark 1.3 (xhigh) | 1473 |
| 29 | Muse Spark | 1473 |
| 30 | Kimi K3 (max) | 1472 |
| 31 | GLM-5.3-Flash | 1472 |
| 32 | GPT-5.5 (high) | 1471 |
| 33 | GLM-5.2 (max) | 1467 |
| 34 | Gemini 3 Flash Preview (Reasoning) | 1467 |
| 35 | Gemini 3 Flash Preview (Non-reasoning) | 1467 |
| 36 | GPT-5.5 (xhigh) | 1466 |
| 37 | GPT-5.5 (medium) | 1466 |
| 38 | GPT-5.5 (low) | 1466 |
| 39 | GPT-5.5 Instant (June 2026) | 1466 |
| 40 | GPT-5.5 (Non-reasoning) | 1466 |
| 41 | GPT-5.5 Instant (May 2026) | 1466 |
| 42 | GPT-5.5 Pro (xhigh) | 1466 |
| 43 | MiMo-V2.5-Pro | 1465 |
| 44 | MiMo-V2.5-Pro (Non-reasoning) | 1465 |
| 45 | GLM-5.1 (Reasoning) | 1462 |
| 46 | GLM-5.1 (Non-reasoning) | 1462 |
| 47 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | 1458 |
| 48 | Claude Sonnet 4.6 (Non-reasoning, High Effort) | 1458 |
| 49 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) | 1458 |
| 50 | Gemini 2.5 Pro | 1458 |
Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .
About the metrics
Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.