Benchfolio

Leaderboard / Model

GPT-5.5

OpenAI · Closed weights · Released Apr 23, 2026 · $5 in · $30 out per 1M tokens

60Overall · rank 10

Score by job

Coding

79 · rank 6 · 5 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE67.0%gpt-5.5_xhigh0.63
Terminal-Bench84.7%gpt-5.5_unknown1.29
FrontierCode43.0%gpt-5.5_unknown0.35
SWE-bench Verified80.6%gpt-5.5-pre-release_xhigh1.27
LMArena Coding1495 ratinggpt-5.5-high0.22

Agents

38 · rank 11 · 3 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents55.1%gpt-5.5_unknown0.26
OSWorld 2.013.0%gpt-5.5_xhigh-0.54
Remote Labor Index6.3%gpt-5.5_unknown-0.35

Reasoning

72 · rank 10 · 3 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond94.0%gpt-5.5-pre-release_xhigh0.98
ARC-AGI-285.0%gpt-5.5_xhigh0.97
SimpleBench69.0%gpt-5.5_unknown0.36

Math

69 · rank 7 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–385.3%gpt-5.5_xhigh1.19
FrontierMath Tier 472.5%gpt-5.5_xhigh1.32
OTIS Mock AIME100.0%gpt-5.5-pre-release_xhigh1.09
ProofBench50.0%gpt-5.5_xhigh0.09
LMArena Math1486 ratinggpt-5.50.23

Writing

68 · rank 12 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1454 ratinggpt-5.5-high0.08
LMArena Instruction Following1478 ratinggpt-5.5-high0.51

Design

31 · rank 32 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1510 ratinggpt-5.5-xhigh (codex-harness)-0.47