Benchfolio

Leaderboard / Model

Claude Opus 4.5

Anthropic · Closed weights · Released Nov 24, 2025 · $5 in · $25 out per 1M tokens

30Overall · rank 29

Score by job

Coding

59 · rank 17 · 3 of 5 benchmarks

BenchmarkResultVariantz
Terminal-Bench63.1%claude-opus-4-5-20251101_unknown-0.56
SWE-bench Verified76.7%claude-opus-4-5-202511010.09
LMArena Coding1503 ratingclaude-opus-4-5-20251101-high-32k0.60

Agents

21 · rank 13 · 2 of 4 benchmarks

BenchmarkResultVariantz
Remote Labor Index3.8%claude-opus-4-5-20251101_unknown-0.73
METR Time Horizons4.9 hclaude-opus-4-5-20251101-0.62

Reasoning

10 · rank 39 · 4 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond86.0%claude-opus-4-5-20251101_32K-2.22
ARC-AGI-237.6%claude-opus-4-5-20251101_64K-1.21
SimpleBench62.0%claude-opus-4-5-20251101-0.34
Humanity’s Last Exam25.2%claude-opus-4-5-20251101_unknown-1.46

Math

0 · rank 41 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–334.4%claude-opus-4-5-20251101_32K-2.32
FrontierMath Tier 44.9%claude-opus-4-5-20251101_32K-1.51
OTIS Mock AIME86.1%claude-opus-4-5-20251101_32K-2.32
ProofBench36.0%claude-opus-4-5-20251101_unknown-0.46
LMArena Math1460 ratingclaude-opus-4-5-20251101-high-32k-0.75

Writing

65 · rank 19 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1444 ratingclaude-opus-4-5-20251101-high-32k-0.22
LMArena Instruction Following1477 ratingclaude-opus-4-5-20251101-high-32k0.47

Design

27 · rank 36 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1495 ratingclaude-opus-4-5-20251101-high-32k-0.63