Leaderboard / Model
GPT-5.4
OpenAI · Closed weights · Released Mar 5, 2026 · $2.50 in · $15 out per 1M tokens
51Overall · rank 18
Score by job
Coding
66 · rank 12 · 4 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 51.8% | gpt-5.4-2026-03-05_xhigh | -0.34 |
| Terminal-Bench | 81.8% | gpt-5.4-2026-03-05_unknown | 1.04 |
| SWE-bench Verified | 76.9% | gpt-5.4-2026-03-05_high | 0.15 |
| LMArena Coding | 1496 rating | gpt-5.4-high | 0.24 |
Agents
43 · rank 9 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 52.4% | gpt-5.4-2026-03-05_unknown | 0.01 |
| METR Time Horizons | 5.7 h | gpt-5.4-2026-03-05_unknown | -0.15 |
Reasoning
59 · rank 14 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 93.3% | gpt-5.4-2026-03-05_xhigh | 0.70 |
| ARC-AGI-2 | 74.0% | gpt-5.4-2026-03-05_xhigh | 0.46 |
| Humanity’s Last Exam | 36.2% | gpt-5.4-2026-03-05_xhigh | -0.19 |
Math
59 · rank 13 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 78.6% | gpt-5.4-2026-03-05_xhigh | 0.73 |
| FrontierMath Tier 4 | 49.0% | gpt-5.4-2026-03-05_xhigh | 0.34 |
| OTIS Mock AIME | 97.8% | gpt-5.4-2026-03-05_high | 0.54 |
| ProofBench | 56.0% | gpt-5.4-2026-03-05_xhigh | 0.33 |
| LMArena Math | 1490 rating | gpt-5.4-high | 0.37 |
Writing
61 · rank 24 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1440 rating | gpt-5.4-high | -0.32 |
| LMArena Instruction Following | 1470 rating | gpt-5.4-high | 0.21 |
Design
20 · rank 38 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1463 rating | gpt-5.4-high (codex-harness) | -0.94 |