Leaderboard / Model
Claude Opus 4.5
Anthropic · Closed weights · Released Nov 24, 2025 · $5 in · $25 out per 1M tokens
30Overall · rank 29
Score by job
Coding
59 · rank 17 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| Terminal-Bench | 63.1% | claude-opus-4-5-20251101_unknown | -0.56 |
| SWE-bench Verified | 76.7% | claude-opus-4-5-20251101 | 0.09 |
| LMArena Coding | 1503 rating | claude-opus-4-5-20251101-high-32k | 0.60 |
Agents
21 · rank 13 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| Remote Labor Index | 3.8% | claude-opus-4-5-20251101_unknown | -0.73 |
| METR Time Horizons | 4.9 h | claude-opus-4-5-20251101 | -0.62 |
Reasoning
10 · rank 39 · 4 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 86.0% | claude-opus-4-5-20251101_32K | -2.22 |
| ARC-AGI-2 | 37.6% | claude-opus-4-5-20251101_64K | -1.21 |
| SimpleBench | 62.0% | claude-opus-4-5-20251101 | -0.34 |
| Humanity’s Last Exam | 25.2% | claude-opus-4-5-20251101_unknown | -1.46 |
Math
0 · rank 41 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 34.4% | claude-opus-4-5-20251101_32K | -2.32 |
| FrontierMath Tier 4 | 4.9% | claude-opus-4-5-20251101_32K | -1.51 |
| OTIS Mock AIME | 86.1% | claude-opus-4-5-20251101_32K | -2.32 |
| ProofBench | 36.0% | claude-opus-4-5-20251101_unknown | -0.46 |
| LMArena Math | 1460 rating | claude-opus-4-5-20251101-high-32k | -0.75 |
Writing
65 · rank 19 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1444 rating | claude-opus-4-5-20251101-high-32k | -0.22 |
| LMArena Instruction Following | 1477 rating | claude-opus-4-5-20251101-high-32k | 0.47 |
Design
27 · rank 36 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1495 rating | claude-opus-4-5-20251101-high-32k | -0.63 |