Benchfolio

Leaderboard / Model

Grok 4.5

xAI · Closed weights · Released Jul 8, 2026 · $2 in · $6 out per 1M tokens

47Overall · rank 20

Score by job

Coding

53 · rank 20 · 3 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE53.8%grok-4.5_high-0.22
FrontierCode42.4%grok-4.5_unknown0.30
LMArena Coding1478 ratinggrok-4.5-0.58

Agents

Not enough data · 1 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents56.2%grok-4.5_unknown0.37

Reasoning

56 · rank 15 · 3 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond93.4%grok-4.5_high0.76
ARC-AGI-252.6%grok-4.5_high-0.52
SimpleBench70.0%grok-4.5_unknown0.46

Math

31 · rank 29 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–357.2%grok-4.5_high-0.74
FrontierMath Tier 424.4%grok-4.5_high-0.69
OTIS Mock AIME97.8%grok-4.5_high0.54
ProofBench31.0%grok-4.5_high-0.66
LMArena Math1462 ratinggrok-4.5-0.69

Writing

54 · rank 30 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1440 ratinggrok-4.5-0.32
LMArena Instruction Following1449 ratinggrok-4.5-0.56

Design

40 · rank 22 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1552 ratinggrok-4.5-0.05