Leaderboard / Model
Grok 4.20
xAI · Closed weights · Released Feb 17, 2026 · $1.25 in · $2.50 out per 1M tokens
23Overall · rank 33
Score by job
Coding
Not enough data · 2 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| Terminal-Bench | 57.3% | grok-4-20 | -1.06 |
| LMArena Coding | 1458 rating | grok-4.20-beta-0309-reasoning | -1.55 |
Agents
Not enough data · 0 of 4 benchmarks
Reasoning
37 · rank 27 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 89.3% | grok-4.20-0309-reasoning | -0.90 |
| ARC-AGI-2 | 65.1% | grok-4-20 | 0.05 |
Math
11 · rank 38 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 44.9% | grok-4.20-0309-reasoning | -1.59 |
| FrontierMath Tier 4 | 17.1% | grok-4.20-0309-reasoning | -1.00 |
| OTIS Mock AIME | 92.2% | grok-4.20-0309-reasoning | -0.82 |
| ProofBench | 14.0% | grok-4.20-0309-reasoning | -1.33 |
| LMArena Math | 1457 rating | grok-4.20-beta-0309-reasoning | -0.86 |
Writing
42 · rank 38 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1437 rating | grok-4.20-beta1 | -0.43 |
| LMArena Instruction Following | 1419 rating | grok-4.20-multi-agent-beta-0309 | -1.69 |
Design
0 · rank 46 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1373 rating | grok-4.20-beta-0309-reasoning | -1.83 |