LLM Leaderboard

Open-weight models (Llama, Qwen, DeepSeek, Mistral…) ranked side by side with the proprietary frontier (GPT, Claude, Gemini, Grok) — live pricing, context, benchmarks and capabilities. No marketing — just the facts.

Live data Loading…
🕐 Time machine
#ModelCreatorIntelligenceCoding
1Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic60.778.0
2Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic59.976.5
3GPT-5.6 Sol (max)OpenAI58.977.4
4Kimi K3Kimi57.176.2
5Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic55.774.3
6GPT-5.6 Terra (max)OpenAI55.076.7
7GPT-5.5 (xhigh)OpenAI54.874.9
8Grok 4.5 (high)SpaceXAI53.872.4
9Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic53.573.6
10Claude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic53.471.5
11GPT-5.4 (xhigh)OpenAI51.471.1
12GPT-5.6 Luna (max)OpenAI51.271.4
13GLM-5.2 (max)Z AI51.168.8
14Muse Spark 1.1 (xhigh)Meta50.671.3
15Gemini 3.5 Flash (high)Google50.270.1
16Gemini 3.6 Flash (high)Google50.169.2
17Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic47.263.0
18Gemini 3.1 Pro PreviewGoogle46.568.8
19Qwen3.7 MaxAlibaba46.066.0
20MiniMax-M3MiniMax44.458.6
21DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek44.359.4
22GPT-5.3 Codex (xhigh)OpenAI44.3
23Kimi K2.6Kimi44.261.8
24Motif 3 (Beta)Motif Technologies44.162.0
25Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic43.7
26Muse SparkMeta43.158.6
27GPT-5.2 (xhigh)OpenAI42.2
28MiMo-V2.5-ProXiaomi42.260.2
29Kimi K2.7 CodeKimi41.960.8
30Hy3Tencent41.258.8
31Nex-N2-ProNex AGI41.059.1
32Claude Opus 4.5 (Reasoning)Anthropic40.8
33Inkling (xhigh)Thinking Machines40.752.1
34DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek40.356.2
35MiMo-V2-ProXiaomi40.3
36GLM-5.1 (Reasoning)Z AI40.255.8
37GPT-5.2 Codex (xhigh)OpenAI40.1
38GPT-5.4 mini (xhigh)OpenAI40.056.1
39Qwen3.6 Max PreviewAlibaba40.0
40Grok Build 0.1 0616SpaceXAI39.851.5
41Gemini 3 Pro Preview (high)Google39.6
42Qwen3.6 PlusAlibaba39.654.5
43GLM-5 (Reasoning)Z AI39.5
44Qwen3.7 PlusAlibaba39.055.9
45Agnes 2.5 Pro AlphaSapiens AI38.858.8
46JT-4.1 Flash 236B A21BChina Mobile38.852.4
47GPT-5.4 nano (xhigh)OpenAI38.256.1
48GLM-5-TurboZ AI38.1
49MiniMax-M2.7MiniMax38.152.6
50Gemini 3 Flash Preview (Reasoning)Google37.8
51Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA37.849.3
52Grok 4.3 (high)SpaceXAI37.642.2
53MiMo-V2.5Xiaomi37.256.8
54Qwen3.6 27B (Reasoning)Alibaba37.153.7
55Grok 4.20 0309 v2 (Reasoning)SpaceXAI37.0
56GPT-5.1 (high)OpenAI36.949.4
57Gemini 3.5 Flash-LiteGoogle36.549.3
58Grok 4.20 0309 (Reasoning)SpaceXAI36.5
59Claude 4.5 Sonnet (Reasoning)Anthropic36.452.1
60MiMo-V2-Omni-0327Xiaomi36.4
Loading the leaderboard…

How this is ranked: models are ordered by real usage popularity (weekly tokens processed across apps), via the OpenRouter API. Only open-weight models are included (Llama, DeepSeek, Qwen, Mistral, Gemma, Kimi, GLM, Phi, Nemotron, and more). Pricing is per million tokens; context is the maximum window. Movement arrows compare today's rank to the previous snapshot. Data refreshes daily.