Leaderboard / Model
Kimi K3
Moonshot · Open weights · Released Jul 16, 2026 · $3 in · $15 out per 1M tokens
64Overall · rank 8
Score by job
Coding
77 · rank 7 · 3 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| DeepSWE | 68.5% | kimi-k3_max | 0.73 |
| FrontierCode | 44.2% | kimi-k3_unknown | 0.48 |
| LMArena Coding | 1507 rating | kimi-k3-max | 0.80 |
Agents
Not enough data · 1 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| APEX-Agents | 50.6% | kimi-k3_unknown | -0.16 |
Reasoning
49 · rank 19 · 3 of 4 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| GPQA Diamond | 93.1% | kimi-k3_max | 0.63 |
| ARC-AGI-2 | 60.4% | kimi-k3_max | -0.16 |
| SimpleBench | 60.7% | kimi-k3_max | -0.47 |
Math
61 · rank 11 · 5 of 5 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| FrontierMath Tiers 1–3 | 72.2% | kimi-k3_max | 0.29 |
| FrontierMath Tier 4 | 39.0% | kimi-k3_max | -0.08 |
| OTIS Mock AIME | 97.2% | kimi-k3_max | 0.41 |
| ProofBench | 87.0% | kimi-k3_unknown | 1.55 |
| LMArena Math | 1494 rating | kimi-k3-max | 0.51 |
Writing
68 · rank 12 · 2 of 2 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena Creative Writing | 1452 rating | kimi-k3-max | 0.02 |
| LMArena Instruction Following | 1478 rating | kimi-k3-max | 0.52 |
Design
64 · rank 7 · 1 of 1 benchmarks
| Benchmark | Result | Variant | z |
|---|---|---|---|
| LMArena WebDev | 1660 rating | kimi-k3-max | 1.01 |