frostflash

LLM Leaderboard

Ranked by Coding Index · source AA

AA composite — LiveCodeBench, SciCode, etc.

#1 by Coding Index
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
81.6
Anthropic · in $10.0 / out $50.0 per 1M · 70 tok/s
#ModelCoding
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)81.6
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)80.7
3Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)79.1
4GPT-5.6 Sol (xhigh)78.3
5Claude Opus 5 (Adaptive Reasoning, Max Effort)78.0
6GPT-5.6 Sol (max)77.4
7GPT-5.6 Sol (high)77.2
8GPT-6 Astra (high)77.1
9Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)77.1
10Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)77.0
11GPT-6 Astra (max)76.9
12Grok 4.6 (high)76.8
13GPT-6 Astra (medium)76.7
14GPT-5.6 Terra (max)76.7
15Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)76.5
16Claude Opus 5 (Adaptive Reasoning, High Effort)76.5
17Muse Spark 1.3 (xhigh)76.5
18Muse Spark 1.3 (max)76.3
19Gemini 3.8 Flash (high)76.3
20GPT-5.6 Sol (medium)76.3
21GPT-6 Astra (Non-reasoning)76.2
22Kimi K3 (max)76.2
23Gemini 3.7 Flash (high)76.1
24GPT-6 Astra (xhigh)75.9
25Grok 4.6 (xhigh)75.9
26Muse Spark 1.3 (max)75.8
27GPT-6 Astra (low)75.7
28Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)75.2
29GPT-5.5 (xhigh)74.9
30GLM-5.3 (max)74.8
31Grok 4.6 (medium)74.4
32Claude Opus 5 (Adaptive Reasoning, Medium Effort)74.3
33Claude Opus 4.8 (Adaptive Reasoning, Max Effort)74.3
34Gemini 3.8 Flash (medium)74.1
35Claude Opus 4.7 (Adaptive Reasoning, Max Effort)73.6
36Gemini 3.8 Flash (low)73.5
37Qwen3.8-Flash-Next73.1
38Grok 4.5 (high)72.4
39Muse Spark 1.2 (xhigh)72.2
40Kimi K3 (low)72.0
41Qwen3.8 2.4T A95B71.9
42Qwen3.8 Max71.8
43GPT-5.5 (high)71.6
44GLM-5.3-Flash71.5
45Gemini 3.7 Flash (medium)71.5
46Claude Sonnet 5 (Adaptive Reasoning, Max Effort)71.5
47GPT-5.5 (medium)71.5
48GPT-5.6 Luna (max)71.4
49Muse Spark 1.1 (xhigh)71.3
50GPT-5.4 (xhigh)71.1

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.