frostflash

LLM Leaderboard

Ranked by Intelligence Index · source AA

Artificial Analysis composite of reasoning, knowledge, coding, math.

#1 by Intelligence Index
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
53.4
Anthropic · in $10.0 / out $50.0 per 1M · 70 tok/s
#ModelIntelligence
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53.4
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)53.2
3Muse Spark 1.3 (max)53.0
4GPT-6 Astra (max)52.8
5GPT-6 Astra (xhigh)52.5
6Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)51.2
7GPT-6 Astra (high)51.0
8Claude Opus 5 (Adaptive Reasoning, Max Effort)50.7
9Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)49.7
10Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)49.7
11GPT-6 Astra (medium)49.7
12Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)49.1
13Claude Opus 5 (Adaptive Reasoning, High Effort)48.2
14Muse Spark 1.3 (max)48.2
15GPT-5.6 Sol (max)47.1
16Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)47.0
17GPT-6 Astra (low)46.0
18GPT-6 Astra (Non-reasoning)45.2
19Muse Spark 1.3 (xhigh)45.2
20Claude Opus 5 (Adaptive Reasoning, Medium Effort)45.1
21GLM-5.3 (max)44.9
22Grok 4.6 (high)44.4
23Grok 4.6 (xhigh)44.3
24GPT-5.6 Sol (xhigh)44.1
25Kimi K3 (max)43.8
26Grok 4.6 (medium)43.0
27GPT-5.6 Sol (high)42.5
28GPT-5.6 Terra (max)42.3
29Claude Opus 4.8 (Adaptive Reasoning, Max Effort)42.0
30GLM-5.3-Flash41.9
31Gemini 3.8 Flash (high)41.2
32Claude Opus 4.7 (Adaptive Reasoning, Max Effort)40.7
33Qwen3.8 Max40.3
34Gemini 3.8 Flash (medium)40.0
35Qwen3.8 2.4T A95B40.0
36Qwen3.8-Flash-Next39.9
37Muse Spark 1.2 (xhigh)39.8
38Claude Opus 5 (Adaptive Reasoning, Low Effort)39.8
39Gemini 3.7 Flash (medium)39.6
40DeepSeek V4.1 Flash (Reasoning, Max Effort)39.5
41GPT-5.6 Sol (medium)39.5
42Gemini 3.7 Flash (high)39.4
43Grok 4.5 (high)39.1
44GPT-5.4 (xhigh)39.0
45GPT-5.5 (xhigh)38.6
46Claude Sonnet 5 (Adaptive Reasoning, Max Effort)38.4
47GPT-5.6 Terra (xhigh)38.2
48GPT-5.6 Luna (max)37.5
49GPT-5.5 (high)37.3
50Gemini 3.7 Flash (low)36.9

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.