Benchfolio

Leaderboard / Model

Claude Opus 5

Anthropic · Closed weights · Released Jul 24, 2026 · $5 in · $25 out per 1M tokens

90Overall · rank 2

Score by job

Coding

100 · rank 1 · 3 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE73.6%claude-opus-5_max1.06
FrontierCode53.4%claude-opus-5_max1.44
LMArena Coding1532 ratingclaude-opus-5-high1.98

Agents

97 · rank 3 · 2 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents65.8%claude-opus-5_max1.28
OSWorld 2.031.4%claude-opus-5_max1.53

Reasoning

86 · rank 2 · 3 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond93.9%claude-opus-5_max0.93
ARC-AGI-290.4%claude-opus-5_max1.22
SimpleBench80.6%claude-opus-5_unknown1.52

Math

91 · rank 4 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–385.6%claude-opus-5_max1.22
FrontierMath Tier 473.2%claude-opus-5_max1.35
OTIS Mock AIME98.9%claude-opus-5_max0.81
ProofBench99.0%claude-opus-5_max2.02
LMArena Math1537 ratingclaude-opus-5-max2.14

Writing

94 · rank 3 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1492 ratingclaude-opus-5-max1.22
LMArena Instruction Following1517 ratingclaude-opus-5-high1.97

Design

72 · rank 4 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1692 ratingclaude-opus-5-max1.33