Leaderboard / Model
Gemini 3.1 Pro
Google DeepMind · Closed weights · Released Feb 19, 2026 · $2 in · $12 out per 1M tokens
44Overall · rank 23
Score by job
Coding
40 · rank 25 · 4 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 11.7% | gemini-3.1-pro-preview | -2.91 |
| Terminal-Bench | 80.2% | gemini-3.1-pro-preview | 0.91 |
| SWE-bench Verified | 75.6% | gemini-3.1-pro-preview-customtools | -0.22 |
| LMArena Coding | 1482 rating | gemini-3.1-pro-preview | -0.41 |
Agents
20 · rank 14 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 35.3% | gemini-3.1-pro-preview | -1.62 |
| METR Time Horizons | 6.4 h | gemini-3.1-pro-preview | 0.21 |
Reasoning
81 · rank 6 · 4 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 94.4% | gemini-3.1-pro-preview_high | 1.16 |
| ARC-AGI-2 | 77.1% | gemini-3.1-pro-preview | 0.60 |
| SimpleBench | 79.6% | gemini-3.1-pro-preview | 1.42 |
| Humanity’s Last Exam | 46.4% | gemini-3.1-pro-preview | 0.99 |
Math
34 · rank 25 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 59.6% | gemini-3.1-pro-preview | -0.58 |
| FrontierMath Tier 4 | 26.8% | gemini-3.1-pro-preview | -0.59 |
| OTIS Mock AIME | 95.6% | gemini-3.1-pro-preview | 0.01 |
| ProofBench | 26.0% | gemini-3.1-pro-preview | -0.86 |
| LMArena Math | 1486 rating | gemini-3.1-pro-preview | 0.21 |
Writing
72 · rank 9 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1482 rating | gemini-3.1-pro-preview | 0.92 |
| LMArena Instruction Following | 1467 rating | gemini-3.1-pro-preview | 0.08 |
Design
16 · rank 39 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1447 rating | gemini-3.1-pro-preview | -1.10 |