Leaderboard / Model
Claude Opus 4.6
Anthropic · Closed weights · Released Feb 5, 2026 · $5 in · $25 out per 1M tokens
61Overall · rank 9
Score by job
Coding
75 · rank 8 · 4 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| Terminal-Bench | 79.8% | claude-opus-4-6_unknown | 0.87 |
| FrontierCode | 26.6% | claude-opus-4-6_unknown | -1.34 |
| SWE-bench Verified | 78.7% | claude-opus-4-6 | 0.71 |
| LMArena Coding | 1535 rating | claude-opus-4-6-high | 2.13 |
Agents
56 · rank 7 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 46.3% | claude-opus-4-6_max | -0.57 |
| Remote Labor Index | 4.2% | claude-opus-4-6_unknown | -0.67 |
| METR Time Horizons | 12.0 h | claude-opus-4-6_unknown | 2.12 |
Reasoning
47 · rank 23 · 4 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 90.5% | claude-opus-4-6_32K | -0.41 |
| ARC-AGI-2 | 69.2% | claude-opus-4-6_120K | 0.24 |
| SimpleBench | 67.6% | claude-opus-4-6 | 0.22 |
| Humanity’s Last Exam | 34.4% | claude-opus-4-6_max | -0.39 |
Math
47 · rank 17 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 66.0% | claude-opus-4-6_max | -0.14 |
| FrontierMath Tier 4 | 26.8% | claude-opus-4-6_max | -0.59 |
| OTIS Mock AIME | 94.4% | claude-opus-4-6_64K | -0.28 |
| ProofBench | 50.0% | claude-opus-4-6_max | 0.09 |
| LMArena Math | 1516 rating | claude-opus-4-6-high | 1.34 |
Writing
100 · rank 1 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1505 rating | claude-opus-4-6-high | 1.62 |
| LMArena Instruction Following | 1523 rating | claude-opus-4-6-high | 2.20 |
Design
39 · rank 23 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1547 rating | claude-opus-4-6-high | -0.11 |