Leaderboard / Model
GPT-5.6 Terra
OpenAI · Closed weights · Released Jul 9, 2026 · $2 in · $12 out per 1M tokens
52Overall · rank 16
Score by job
Coding
65 · rank 14 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 69.6% | gpt-5.6-terra_max | 0.80 |
| FrontierCode | 41.3% | gpt-5.6-terra_unknown | 0.18 |
| LMArena Coding | 1485 rating | gpt-5.6-terra-xhigh | -0.26 |
Agents
Not enough data · 1 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 58.2% | gpt-5.6-terra_max | 0.56 |
Reasoning
49 · rank 19 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 93.3% | gpt-5.6-terra_max | 0.70 |
| ARC-AGI-2 | 83.9% | gpt-5.6-terra_max | 0.92 |
| SimpleBench | 48.9% | gpt-5.6-terra_unknown | -1.65 |
Math
68 · rank 8 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 86.0% | gpt-5.6-terra_max | 1.24 |
| FrontierMath Tier 4 | 70.7% | gpt-5.6-terra_max | 1.24 |
| OTIS Mock AIME | 99.7% | gpt-5.6-terra_max | 1.02 |
| ProofBench | 74.0% | gpt-5.6-terra_xhigh | 1.04 |
| LMArena Math | 1460 rating | gpt-5.6-terra-xhigh | -0.77 |
Writing
46 · rank 36 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1409 rating | gpt-5.6-terra-xhigh | -1.26 |
| LMArena Instruction Following | 1453 rating | gpt-5.6-terra-xhigh | -0.43 |
Design
33 · rank 28 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1519 rating | gpt-5.6-terra-xhigh (codex-harness) | -0.39 |