Leaderboard / Model
Claude Sonnet 4.6
Anthropic · Closed weights · Released Feb 17, 2026 · $3 in · $15 out per 1M tokens
29Overall · rank 31
Score by job
Coding
33 · rank 27 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 29.9% | claude-sonnet-4-6_high | -1.74 |
| Terminal-Bench | 53.4% | claude-sonnet-4-6_unknown | -1.39 |
| FrontierCode | 24.3% | claude-sonnet-4-6_unknown | -1.58 |
| SWE-bench Verified | 75.2% | claude-sonnet-4-6 | -0.35 |
| LMArena Coding | 1504 rating | claude-sonnet-4-6 | 0.64 |
Agents
13 · rank 15 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 43.0% | claude-sonnet-4-6_high | -0.89 |
| OSWorld 2.0 | 9.3% | claude-sonnet-4-6_medium | -0.95 |
Reasoning
22 · rank 33 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 87.4% | claude-sonnet-4-6_32K | -1.69 |
| ARC-AGI-2 | 60.4% | claude-sonnet-4-6_high | -0.16 |
Math
12 · rank 37 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| OTIS Mock AIME | 85.8% | claude-sonnet-4-6_32K | -2.40 |
| ProofBench | 45.0% | claude-sonnet-4-6_max | -0.11 |
| LMArena Math | 1462 rating | claude-sonnet-4-6 | -0.69 |
Writing
63 · rank 23 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1436 rating | claude-sonnet-4-6 | -0.44 |
| LMArena Instruction Following | 1477 rating | claude-sonnet-4-6 | 0.47 |
Design
33 · rank 28 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1521 rating | claude-sonnet-4-6 | -0.37 |