Leaderboard / Model
Claude Opus 4.8
Anthropic · Closed weights · Released May 28, 2026 · $5 in · $25 out per 1M tokens
55Overall · rank 13
Score by job
Coding
66 · rank 12 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 59.0% | claude-opus-4-8_max | 0.12 |
| FrontierCode | 46.5% | claude-opus-4-8_unknown | 0.72 |
| LMArena Coding | 1491 rating | claude-opus-4-8-high | -0.00 |
Agents
45 · rank 8 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 48.9% | claude-opus-4-8_max | -0.33 |
| OSWorld 2.0 | 20.6% | claude-opus-4-8_max | 0.32 |
| Remote Labor Index | 8.3% | claude-opus-4-8_unknown | -0.04 |
Reasoning
50 · rank 18 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 91.0% | claude-opus-4-8_max | -0.21 |
| ARC-AGI-2 | 72.1% | claude-opus-4-8_high | 0.37 |
| SimpleBench | 64.8% | claude-opus-4-8_unknown | -0.06 |
Math
64 · rank 9 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 80.0% | claude-opus-4-8_max | 0.83 |
| FrontierMath Tier 4 | 56.1% | claude-opus-4-8_max | 0.63 |
| OTIS Mock AIME | 98.3% | claude-opus-4-8_max | 0.68 |
| ProofBench | 69.0% | claude-opus-4-8_max | 0.84 |
| LMArena Math | 1486 rating | claude-opus-4-8-high | 0.21 |
Writing
66 · rank 18 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1450 rating | claude-opus-4-8-high | -0.04 |
| LMArena Instruction Following | 1476 rating | claude-opus-4-8-high | 0.43 |
Design
41 · rank 20 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1555 rating | claude-opus-4-8-high | -0.03 |