Leaderboard / Model
Gemini 3.8 Flash
Google DeepMind · Closed weights · Released Sep 2, 2026 · $0.75 in · $3.75 out per 1M tokens
69Overall · rank 5
Score by job
Coding
80 · rank 5 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 73.8% | gemini-3.8-flash_high | 1.07 |
| FrontierCode | 41.2% | gemini-3.8-flash_medium | 0.17 |
| LMArena Coding | 1514 rating | gemini-3.8-flash-high | 1.12 |
Agents
Not enough data · 1 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 64.3% | gemini-3.8-flash_unknown | 1.14 |
Reasoning
84 · rank 3 · 2 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 95.4% | gemini-3.8-flash_high | 1.54 |
| Humanity’s Last Exam | 44.5% | gemini-3.8-flash_unknown | 0.77 |
Math
45 · rank 18 · 4 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 68.4% | gemini-3.8-flash_high | 0.03 |
| FrontierMath Tier 4 | 22.0% | gemini-3.8-flash_high | -0.80 |
| OTIS Mock AIME | 98.9% | gemini-3.8-flash_high | 0.81 |
| ProofBench | 48.0% | gemini-3.8-flash_unknown | 0.01 |
Writing
87 · rank 5 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1498 rating | gemini-3.8-flash-high | 1.42 |
| LMArena Instruction Following | 1493 rating | gemini-3.8-flash-high | 1.07 |
Design
47 · rank 18 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1584 rating | gemini-3.8-flash-high | 0.26 |