Leaderboard / Model
Claude Opus 5
Anthropic · Closed weights · Released Jul 24, 2026 · $5 in · $25 out per 1M tokens
90Overall · rank 2
Score by job
Coding
100 · rank 1 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 73.6% | claude-opus-5_max | 1.06 |
| FrontierCode | 53.4% | claude-opus-5_max | 1.44 |
| LMArena Coding | 1532 rating | claude-opus-5-high | 1.98 |
Agents
97 · rank 3 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 65.8% | claude-opus-5_max | 1.28 |
| OSWorld 2.0 | 31.4% | claude-opus-5_max | 1.53 |
Reasoning
86 · rank 2 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 93.9% | claude-opus-5_max | 0.93 |
| ARC-AGI-2 | 90.4% | claude-opus-5_max | 1.22 |
| SimpleBench | 80.6% | claude-opus-5_unknown | 1.52 |
Math
91 · rank 4 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 85.6% | claude-opus-5_max | 1.22 |
| FrontierMath Tier 4 | 73.2% | claude-opus-5_max | 1.35 |
| OTIS Mock AIME | 98.9% | claude-opus-5_max | 0.81 |
| ProofBench | 99.0% | claude-opus-5_max | 2.02 |
| LMArena Math | 1537 rating | claude-opus-5-max | 2.14 |
Writing
94 · rank 3 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1492 rating | claude-opus-5-max | 1.22 |
| LMArena Instruction Following | 1517 rating | claude-opus-5-high | 1.97 |
Design
72 · rank 4 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1692 rating | claude-opus-5-max | 1.33 |