Leaderboard / Model
Grok 4.6
xAI · Closed weights · Released Aug 12, 2026 · $2 in · $6 out per 1M tokens
53Overall · rank 14
Score by job
Coding
60 · rank 16 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 67.5% | grok-4.6_medium | 0.66 |
| FrontierCode | 48.0% | grok-4.6_unknown | 0.88 |
| LMArena Coding | 1463 rating | grok-4.6-high | -1.30 |
Agents
Not enough data · 1 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 65.3% | grok-4.6_unknown | 1.23 |
Reasoning
71 · rank 11 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 94.0% | grok-4.6_high | 0.98 |
| ARC-AGI-2 | 67.1% | grok-4.6_xhigh | 0.14 |
| SimpleBench | 75.9% | grok-4.6_unknown | 1.05 |
Math
33 · rank 27 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 66.0% | grok-4.6_xhigh | -0.14 |
| FrontierMath Tier 4 | 31.7% | grok-4.6_xhigh | -0.39 |
| OTIS Mock AIME | 99.2% | grok-4.6_xhigh | 0.88 |
| ProofBench | 51.0% | grok-4.6_unknown | 0.13 |
| LMArena Math | 1415 rating | grok-4.6-high | -2.46 |
Writing
47 · rank 33 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1437 rating | grok-4.6-high | -0.43 |
| LMArena Instruction Following | 1433 rating | grok-4.6-high | -1.17 |
Design
56 · rank 11 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1624 rating | grok-4.6-high | 0.66 |