Benchfolio

Leaderboard / Model

Grok 4.6

xAI · Closed weights · Released Aug 12, 2026 · $2 in · $6 out per 1M tokens

53Overall · rank 14

Score by job

Coding

60 · rank 16 · 3 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE67.5%grok-4.6_medium0.66
FrontierCode48.0%grok-4.6_unknown0.88
LMArena Coding1463 ratinggrok-4.6-high-1.30

Agents

Not enough data · 1 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents65.3%grok-4.6_unknown1.23

Reasoning

71 · rank 11 · 3 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond94.0%grok-4.6_high0.98
ARC-AGI-267.1%grok-4.6_xhigh0.14
SimpleBench75.9%grok-4.6_unknown1.05

Math

33 · rank 27 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–366.0%grok-4.6_xhigh-0.14
FrontierMath Tier 431.7%grok-4.6_xhigh-0.39
OTIS Mock AIME99.2%grok-4.6_xhigh0.88
ProofBench51.0%grok-4.6_unknown0.13
LMArena Math1415 ratinggrok-4.6-high-2.46

Writing

47 · rank 33 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1437 ratinggrok-4.6-high-0.43
LMArena Instruction Following1433 ratinggrok-4.6-high-1.17

Design

56 · rank 11 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1624 ratinggrok-4.6-high0.66