Benchfolio

Leaderboard / Model

Claude Opus 4.6

Anthropic · Closed weights · Released Feb 5, 2026 · $5 in · $25 out per 1M tokens

61Overall · rank 9

Score by job

Coding

75 · rank 8 · 4 of 5 benchmarks

BenchmarkResultVariantz
Terminal-Bench79.8%claude-opus-4-6_unknown0.87
FrontierCode26.6%claude-opus-4-6_unknown-1.34
SWE-bench Verified78.7%claude-opus-4-60.71
LMArena Coding1535 ratingclaude-opus-4-6-high2.13

Agents

56 · rank 7 · 3 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents46.3%claude-opus-4-6_max-0.57
Remote Labor Index4.2%claude-opus-4-6_unknown-0.67
METR Time Horizons12.0 hclaude-opus-4-6_unknown2.12

Reasoning

47 · rank 23 · 4 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond90.5%claude-opus-4-6_32K-0.41
ARC-AGI-269.2%claude-opus-4-6_120K0.24
SimpleBench67.6%claude-opus-4-60.22
Humanity’s Last Exam34.4%claude-opus-4-6_max-0.39

Math

47 · rank 17 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–366.0%claude-opus-4-6_max-0.14
FrontierMath Tier 426.8%claude-opus-4-6_max-0.59
OTIS Mock AIME94.4%claude-opus-4-6_64K-0.28
ProofBench50.0%claude-opus-4-6_max0.09
LMArena Math1516 ratingclaude-opus-4-6-high1.34

Writing

100 · rank 1 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1505 ratingclaude-opus-4-6-high1.62
LMArena Instruction Following1523 ratingclaude-opus-4-6-high2.20

Design

39 · rank 23 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1547 ratingclaude-opus-4-6-high-0.11