Leaderboard / Model
Claude Sonnet 5
Anthropic · Closed weights · Released Jun 30, 2026 · $2 in · $10 out per 1M tokens
44Overall · rank 23
Score by job
Coding
57 · rank 18 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 53.8% | claude-sonnet-5_max | -0.21 |
| FrontierCode | 42.7% | claude-sonnet-5_unknown | 0.33 |
| LMArena Coding | 1485 rating | claude-sonnet-5-high | -0.29 |
Agents
Not enough data · 1 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 54.5% | claude-sonnet-5_unknown | 0.21 |
Reasoning
36 · rank 28 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 90.5% | claude-sonnet-5_xhigh | -0.41 |
| SimpleBench | 60.6% | claude-sonnet-5_unknown | -0.48 |
Math
44 · rank 19 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 65.6% | claude-sonnet-5_max | -0.16 |
| FrontierMath Tier 4 | 29.3% | claude-sonnet-5_max | -0.49 |
| OTIS Mock AIME | 94.7% | claude-sonnet-5_xhigh | -0.21 |
| ProofBench | 77.0% | claude-sonnet-5_max | 1.16 |
| LMArena Math | 1469 rating | claude-sonnet-5-high | -0.41 |
Writing
47 · rank 33 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1417 rating | claude-sonnet-5-high | -1.01 |
| LMArena Instruction Following | 1450 rating | claude-sonnet-5-high | -0.53 |
Design
37 · rank 25 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1538 rating | claude-sonnet-5-high | -0.20 |