frostflash

LLM Leaderboard

Ranked by GPQA Diamond · source AA

Graduate-level science Q&A. Strong reasoning signal.

#1 by GPQA Diamond
GPT-6 Astra (xhigh)
96.3%
OpenAI · in $10.0 / out $50.0 per 1M · 60 tok/s
#ModelGPQA
1GPT-6 Astra (xhigh)96.3%
2GPT-6 Astra (max)96.1%
3Gemini 3.8 Flash (high)95.3%
4GPT-6 Astra (high)94.9%
5Grok 4.6 (high)94.9%
6Gemini 3.7 Flash (high)94.5%
7GPT-5.6 Sol (max)94.1%
8Muse Spark 1.3 (xhigh)94.1%
9Gemini 3.1 Pro Preview94.1%
10GPT-6 Astra (medium)93.9%
11Muse Spark 1.3 (max)93.8%
12Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)93.7%
13Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)93.7%
14Claude Opus 5 (Adaptive Reasoning, High Effort)93.7%
15Muse Spark 1.3 (max)93.5%
16Grok 4.6 (xhigh)93.5%
17Kimi K3 (max)93.5%
18Grok 4.6 (medium)93.5%
19Gemini 3.8 Flash (medium)93.5%
20Qwen3.8 2.4T A95B93.5%
21GPT-5.5 (xhigh)93.5%
22Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)93.4%
23Claude Opus 5 (Adaptive Reasoning, Max Effort)93.2%
24GPT-5.5 (high)93.2%
25GPT-6 Astra (low)93.1%
26GPT-5.6 Sol (xhigh)93.1%
27Grok 4.5 (high)93.1%
28MiniMax-M392.9%
29GPT-5.6 Sol (high)92.8%
30DeepSeek V4 Pro 0813 (Reasoning, Max Effort)92.8%
31Gemini 3.6 Flash (high)92.8%
32Qwen3.8 Max92.7%
33Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)92.6%
34GPT-5.6 Sol (medium)92.6%
35GPT-5.5 (medium)92.6%
36GPT-5.6 Terra (max)92.5%
37Agnes 3.0 Flash92.4%
38Qwen3.8-Flash-Next92.3%
39Qwen3.7 Max92.3%
40Gemini 3.5 Flash (high)92.2%
41Gemini 3.7 Flash (medium)92.1%
42Gemini 3.5 Flash (medium)92.1%
43Claude Opus 4.8 (Adaptive Reasoning, Max Effort)92.0%
44GPT-5.4 (xhigh)92.0%
45Gemini 3.8 Flash (low)92.0%
46Claude Opus 5 (Adaptive Reasoning, Medium Effort)91.9%
47GLM-5.3 (max)91.7%
48GPT-5.3 Codex (xhigh)91.5%
49Claude Opus 4.7 (Adaptive Reasoning, Max Effort)91.4%
50DeepSeek V4 Flash Vision (Reasoning, Max Effort)91.3%

Quality, pricing, and speed benchmarks via Artificial Analysis. Human preference Elo via LMArena. Refreshed daily at 06:00 UTC · last sync .

About the metrics

Intelligence Index
AA
Artificial Analysis composite of reasoning, knowledge, coding, math.
LMArena Elo
LMArena
Human preference Elo from chatbot arena head-to-head votes.
Coding Index
AA
AA composite — LiveCodeBench, SciCode, etc.
Math Index
AA
AA composite — MATH-500, AIME, etc.
MMLU-Pro
AA
Multi-domain knowledge & reasoning. Harder than MMLU.
GPQA Diamond
AA
Graduate-level science Q&A. Strong reasoning signal.
LiveCodeBench
AA
Competitive programming, contamination-resistant.
MATH-500
AA
Subset of the MATH benchmark.
AIME
AA
American Invitational Mathematics Examination — olympiad math.
Humanity's Last Exam
AA
Frontier reasoning benchmark; most models still score low.
SciCode
AA
Scientific coding tasks.