Leaderboard / Model
GPT-5.6 Sol
OpenAI · Closed weights · Released Jul 9, 2026 · $4 in · $20 out per 1M tokens
69Overall · rank 5
Score by job
Coding
75 · rank 8 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 72.7% | gpt-5.6-sol_max | 0.99 |
| FrontierCode | 47.5% | gpt-5.6-sol_unknown | 0.82 |
| LMArena Coding | 1490 rating | gpt-5.6-sol-xhigh | -0.04 |
Agents
64 · rank 5 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 51.4% | gpt-5.6-sol_promax | -0.09 |
| OSWorld 2.0 | 27.3% | gpt-5.6-sol_max | 1.07 |
Reasoning
76 · rank 9 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 93.5% | gpt-5.6-sol_max | 0.78 |
| ARC-AGI-2 | 92.5% | gpt-5.6-sol_max | 1.31 |
| SimpleBench | 71.7% | gpt-5.6-sol_proxhigh | 0.63 |
Math
76 · rank 6 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 89.1% | gpt-5.6-sol_max | 1.46 |
| FrontierMath Tier 4 | 82.9% | gpt-5.6-sol_max | 1.75 |
| OTIS Mock AIME | 100.0% | gpt-5.6-sol_max | 1.09 |
| ProofBench | 83.0% | gpt-5.6-sol_max | 1.39 |
| LMArena Math | 1466 rating | gpt-5.6-sol-xhigh | -0.54 |
Writing
67 · rank 16 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1452 rating | gpt-5.6-sol-xhigh | 0.04 |
| LMArena Instruction Following | 1477 rating | gpt-5.6-sol-xhigh | 0.48 |
Design
55 · rank 13 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1617 rating | gpt-5.6-sol-xhigh (codex-harness) | 0.59 |