frostflash

LLM Leaderboard

Ranked by LMArena Elo · source LMArena

Human preference Elo from chatbot arena head-to-head votes.

#1 by LMArena Elo
Claude Opus 5 (Adaptive Reasoning, High Effort)
1505
Anthropic · in $5.00 / out $25.0 per 1M · 51 tok/s
#ModelLMArena
1Claude Opus 5 (Adaptive Reasoning, High Effort)1505
2Claude Opus 4.6 (Adaptive Reasoning, Max Effort)1498
3Claude Opus 4.6 (Non-reasoning, High Effort)1498
4Gemini 3.8 Flash (high)1495
5Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 5 Fallback)1493
6Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)1493
7Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)1493
8Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)1493
9Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)1493
10Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)1493
11Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)1493
12Gemini 3.7 Flash (high)1490
13Muse Spark 1.3 (max)1490
14Muse Spark 1.2 (xhigh)1489
15Claude Opus 4.7 (Adaptive Reasoning, Max Effort)1483
16Claude Opus 4.7 (Non-reasoning, High Effort)1483
17Gemini 3.5 Flash (high)1482
18Qwen3.8 Max1481
19Muse Spark 1.1 (xhigh)1480
20Gemini 3.1 Pro Preview1480
21Gemini 3 Pro Preview (high)1479
22Gemini 3 Pro Preview (low)1479
23Gemini 3.6 Flash (high)1476
24Gemini 3.5 Flash (medium)1476
25GLM-5.3 (max)1475
26Qwen3.7 Max1474
27Muse Spark 1.3 (max)1473
28Muse Spark 1.3 (xhigh)1473
29Muse Spark1473
30Kimi K3 (max)1472
31GLM-5.3-Flash1472
32GPT-5.5 (high)1471
33GLM-5.2 (max)1467
34Gemini 3 Flash Preview (Reasoning)1467
35Gemini 3 Flash Preview (Non-reasoning)1467
36GPT-5.5 (xhigh)1466
37GPT-5.5 (medium)1466
38GPT-5.5 (low)1466
39GPT-5.5 Instant (June 2026)1466
40GPT-5.5 (Non-reasoning)1466
41GPT-5.5 Instant (May 2026)1466
42GPT-5.5 Pro (xhigh)1466
43MiMo-V2.5-Pro1465
44MiMo-V2.5-Pro (Non-reasoning)1465
45GLM-5.1 (Reasoning)1462
46GLM-5.1 (Non-reasoning)1462
47Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)1458
48Claude Sonnet 4.6 (Non-reasoning, High Effort)1458
49Claude Sonnet 4.6 (Non-reasoning, Low Effort)1458
50Gemini 2.5 Pro1458

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.