Benchfolio

Leaderboard / Model

Grok 4.20

xAI · Closed weights · Released Feb 17, 2026 · $1.25 in · $2.50 out per 1M tokens

23Overall · rank 33

Score by job

Coding

Not enough data · 2 of 5 benchmarks

BenchmarkResultVariantz
Terminal-Bench57.3%grok-4-20-1.06
LMArena Coding1458 ratinggrok-4.20-beta-0309-reasoning-1.55

Agents

Not enough data · 0 of 4 benchmarks

Reasoning

37 · rank 27 · 2 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond89.3%grok-4.20-0309-reasoning-0.90
ARC-AGI-265.1%grok-4-200.05

Math

11 · rank 38 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–344.9%grok-4.20-0309-reasoning-1.59
FrontierMath Tier 417.1%grok-4.20-0309-reasoning-1.00
OTIS Mock AIME92.2%grok-4.20-0309-reasoning-0.82
ProofBench14.0%grok-4.20-0309-reasoning-1.33
LMArena Math1457 ratinggrok-4.20-beta-0309-reasoning-0.86

Writing

42 · rank 38 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1437 ratinggrok-4.20-beta1-0.43
LMArena Instruction Following1419 ratinggrok-4.20-multi-agent-beta-0309-1.69

Design

0 · rank 46 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1373 ratinggrok-4.20-beta-0309-reasoning-1.83