Leaderboard / Model
Grok 4.5
xAI · Closed weights · Released Jul 8, 2026 · $2 in · $6 out per 1M tokens
47Overall · rank 20
Score by job
Coding
53 · rank 20 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 53.8% | grok-4.5_high | -0.22 |
| FrontierCode | 42.4% | grok-4.5_unknown | 0.30 |
| LMArena Coding | 1478 rating | grok-4.5 | -0.58 |
Agents
Not enough data · 1 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 56.2% | grok-4.5_unknown | 0.37 |
Reasoning
56 · rank 15 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 93.4% | grok-4.5_high | 0.76 |
| ARC-AGI-2 | 52.6% | grok-4.5_high | -0.52 |
| SimpleBench | 70.0% | grok-4.5_unknown | 0.46 |
Math
31 · rank 29 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 57.2% | grok-4.5_high | -0.74 |
| FrontierMath Tier 4 | 24.4% | grok-4.5_high | -0.69 |
| OTIS Mock AIME | 97.8% | grok-4.5_high | 0.54 |
| ProofBench | 31.0% | grok-4.5_high | -0.66 |
| LMArena Math | 1462 rating | grok-4.5 | -0.69 |
Writing
54 · rank 30 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1440 rating | grok-4.5 | -0.32 |
| LMArena Instruction Following | 1449 rating | grok-4.5 | -0.56 |
Design
40 · rank 22 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1552 rating | grok-4.5 | -0.05 |