frostflash

LLM Leaderboard

Ranked by SciCode · source AA

Scientific coding tasks.

#1 by SciCode
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
63.1%
Anthropic · in $10.0 / out $50.0 per 1M · 70 tok/s
#ModelSciCode
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)63.1%
2Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)61.0%
3Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)60.9%
4Gemini 3.7 Flash (medium)59.8%
5Muse Spark 1.3 (xhigh)59.7%
6Kimi K3 (max)59.5%
7GLM-5.3 (max)59.0%
8Muse Spark 1.3 (max)58.8%
9Muse Spark 1.1 (xhigh)58.8%
10Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)58.7%
11Gemini 3.1 Pro Preview58.7%
12Muse Spark 1.3 (max)58.3%
13GPT-5.6 Sol (high)57.8%
14Muse Spark 1.2 (xhigh)57.4%
15GPT-5.6 Sol (medium)57.4%
16Gemini 3.7 Flash (high)57.2%
17GPT-5.6 Sol (max)57.1%
18GPT-5.6 Sol (xhigh)57.1%
19Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)56.7%
20Gemini 3.8 Flash (high)56.6%
21GPT-6 Astra (max)56.5%
22Grok 4.6 (high)56.5%
23Claude Opus 5 (Adaptive Reasoning, Max Effort)56.4%
24Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)56.4%
25GPT-5.6 Sol (low)56.4%
26GPT-5.5 (high)56.1%
27Grok 4.6 (medium)55.9%
28GPT-5.5 (xhigh)55.8%
29GPT-6 Astra (xhigh)55.7%
30Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)55.7%
31Gemini 3.7 Flash (low)55.7%
32GPT-6 Astra (high)55.4%
33Claude Opus 5 (Adaptive Reasoning, High Effort)55.4%
34Gemini 3.8 Flash (medium)55.1%
35GPT-5.6 Terra (max)55.0%
36Grok 4.5 (high)55.0%
37Gemini 3.8 Flash (low)55.0%
38GPT-5.5 (medium)54.5%
39Claude Opus 4.8 (Adaptive Reasoning, Max Effort)54.4%
40Claude Sonnet 5 (Adaptive Reasoning, Max Effort)54.3%
41Claude Sonnet 5 (Adaptive Reasoning, High Effort)54.3%
42GPT-6 Astra (medium)54.2%
43GPT-6 Astra (low)54.1%
44Qwen3.8 2.4T A95B54.1%
45Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)54.1%
46Gemini 3.5 Flash (high)53.9%
47GPT-5.6 Luna (max)53.6%
48GPT-6 Astra (Non-reasoning)53.5%
49Gemini 3.6 Flash (high)53.4%
50Qwen3.8 Max53.2%

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.