Benchfolio

Leaderboard / Model

Gemini 3.1 Pro

Google DeepMind · Closed weights · Released Feb 19, 2026 · $2 in · $12 out per 1M tokens

44Overall · rank 23

Score by job

Coding

40 · rank 25 · 4 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE11.7%gemini-3.1-pro-preview-2.91
Terminal-Bench80.2%gemini-3.1-pro-preview0.91
SWE-bench Verified75.6%gemini-3.1-pro-preview-customtools-0.22
LMArena Coding1482 ratinggemini-3.1-pro-preview-0.41

Agents

20 · rank 14 · 2 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents35.3%gemini-3.1-pro-preview-1.62
METR Time Horizons6.4 hgemini-3.1-pro-preview0.21

Reasoning

81 · rank 6 · 4 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond94.4%gemini-3.1-pro-preview_high1.16
ARC-AGI-277.1%gemini-3.1-pro-preview0.60
SimpleBench79.6%gemini-3.1-pro-preview1.42
Humanity’s Last Exam46.4%gemini-3.1-pro-preview0.99

Math

34 · rank 25 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–359.6%gemini-3.1-pro-preview-0.58
FrontierMath Tier 426.8%gemini-3.1-pro-preview-0.59
OTIS Mock AIME95.6%gemini-3.1-pro-preview0.01
ProofBench26.0%gemini-3.1-pro-preview-0.86
LMArena Math1486 ratinggemini-3.1-pro-preview0.21

Writing

72 · rank 9 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1482 ratinggemini-3.1-pro-preview0.92
LMArena Instruction Following1467 ratinggemini-3.1-pro-preview0.08

Design

16 · rank 39 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1447 ratinggemini-3.1-pro-preview-1.10