frostflash

LLM Leaderboard

Ranked by Humanity's Last Exam · source AA

Frontier reasoning benchmark; most models still score low.

#1 by Humanity's Last Exam
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
59.1%
Anthropic · in $10.0 / out $50.0 per 1M · 70 tok/s
#ModelHLE
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)59.1%
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)58.7%
3Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)55.9%
4Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)55.5%
5Claude Opus 5 (Adaptive Reasoning, Max Effort)54.9%
6GPT-6 Astra (max)54.7%
7GPT-6 Astra (xhigh)54.6%
8Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)54.4%
9Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)53.8%
10GPT-6 Astra (high)53.1%
11Claude Opus 5 (Adaptive Reasoning, High Effort)52.8%
12GPT-6 Astra (medium)52.7%
13Claude Opus 5 (Adaptive Reasoning, Medium Effort)51.3%
14GPT-5.6 Sol (max)49.5%
15GPT-6 Astra (low)49.2%
16Muse Spark 1.3 (max)49.1%
17Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)48.9%
18Muse Spark 1.3 (max)48.7%
19Claude Opus 4.8 (Adaptive Reasoning, Max Effort)48.7%
20Gemini 3.7 Flash (high)47.9%
21Gemini 3.8 Flash (high)47.8%
22Muse Spark 1.3 (xhigh)47.5%
23GPT-5.6 Sol (xhigh)47.3%
24Gemini 3.1 Pro Preview47.0%
25Kimi K3 (max)46.9%
26Muse Spark 1.1 (xhigh)46.2%
27GPT-5.6 Sol (high)46.0%
28GPT-5.5 (xhigh)45.8%
29Muse Spark 1.2 (xhigh)45.5%
30GPT-5.5 (high)45.0%
31Grok 4.6 (xhigh)44.1%
32GPT-5.4 (xhigh)43.7%
33Claude Opus 5 (Adaptive Reasoning, Low Effort)43.4%
34Qwen3.8 Max43.0%
35Grok 4.6 (high)42.9%
36GPT-5.6 Terra (max)42.9%
37Grok 4.5 (high)42.7%
38Gemini 3.5 Flash (high)42.7%
39GPT-5.3 Codex (xhigh)42.5%
40Qwen3.8 2.4T A95B42.4%
41GPT-5.5 (medium)42.4%
42GLM-5.3 (max)42.3%
43Claude Opus 4.7 (Adaptive Reasoning, Max Effort)42.3%
44GPT-5.6 Sol (medium)42.2%
45Grok 4.6 (medium)42.1%
46Gemini 3.8 Flash (medium)42.1%
47GPT-5.6 Terra (xhigh)41.9%
48Claude Sonnet 5 (Adaptive Reasoning, Max Effort)41.3%
49Gemini 3.5 Flash (medium)41.3%
50GLM-5.2 (max)41.1%

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.