LLM Leaderboard
Ranked by Humanity's Last Exam · source AA
Frontier reasoning benchmark; most models still score low.
#1 by Humanity's Last Exam
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
59.1%
Anthropic · in $10.0 / out $50.0 per 1M · 70 tok/s
| # | Model | HLE |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 59.1% |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) | 58.7% |
| 3 | Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) | 55.9% |
| 4 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | 55.5% |
| 5 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | 54.9% |
| 6 | GPT-6 Astra (max) | 54.7% |
| 7 | GPT-6 Astra (xhigh) | 54.6% |
| 8 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 54.4% |
| 9 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | 53.8% |
| 10 | GPT-6 Astra (high) | 53.1% |
| 11 | Claude Opus 5 (Adaptive Reasoning, High Effort) | 52.8% |
| 12 | GPT-6 Astra (medium) | 52.7% |
| 13 | Claude Opus 5 (Adaptive Reasoning, Medium Effort) | 51.3% |
| 14 | GPT-5.6 Sol (max) | 49.5% |
| 15 | GPT-6 Astra (low) | 49.2% |
| 16 | Muse Spark 1.3 (max) | 49.1% |
| 17 | Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) | 48.9% |
| 18 | Muse Spark 1.3 (max) | 48.7% |
| 19 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | 48.7% |
| 20 | Gemini 3.7 Flash (high) | 47.9% |
| 21 | Gemini 3.8 Flash (high) | 47.8% |
| 22 | Muse Spark 1.3 (xhigh) | 47.5% |
| 23 | GPT-5.6 Sol (xhigh) | 47.3% |
| 24 | Gemini 3.1 Pro Preview | 47.0% |
| 25 | Kimi K3 (max) | 46.9% |
| 26 | Muse Spark 1.1 (xhigh) | 46.2% |
| 27 | GPT-5.6 Sol (high) | 46.0% |
| 28 | GPT-5.5 (xhigh) | 45.8% |
| 29 | Muse Spark 1.2 (xhigh) | 45.5% |
| 30 | GPT-5.5 (high) | 45.0% |
| 31 | Grok 4.6 (xhigh) | 44.1% |
| 32 | GPT-5.4 (xhigh) | 43.7% |
| 33 | Claude Opus 5 (Adaptive Reasoning, Low Effort) | 43.4% |
| 34 | Qwen3.8 Max | 43.0% |
| 35 | Grok 4.6 (high) | 42.9% |
| 36 | GPT-5.6 Terra (max) | 42.9% |
| 37 | Grok 4.5 (high) | 42.7% |
| 38 | Gemini 3.5 Flash (high) | 42.7% |
| 39 | GPT-5.3 Codex (xhigh) | 42.5% |
| 40 | Qwen3.8 2.4T A95B | 42.4% |
| 41 | GPT-5.5 (medium) | 42.4% |
| 42 | GLM-5.3 (max) | 42.3% |
| 43 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | 42.3% |
| 44 | GPT-5.6 Sol (medium) | 42.2% |
| 45 | Grok 4.6 (medium) | 42.1% |
| 46 | Gemini 3.8 Flash (medium) | 42.1% |
| 47 | GPT-5.6 Terra (xhigh) | 41.9% |
| 48 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 41.3% |
| 49 | Gemini 3.5 Flash (medium) | 41.3% |
| 50 | GLM-5.2 (max) | 41.1% |
Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .
About the metrics
Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.