Benchfolio

Leaderboard / Model

Claude Sonnet 4.6

Anthropic · Closed weights · Released Feb 17, 2026 · $3 in · $15 out per 1M tokens

29Overall · rank 31

Score by job

Coding

33 · rank 27 · 5 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE29.9%claude-sonnet-4-6_high-1.74
Terminal-Bench53.4%claude-sonnet-4-6_unknown-1.39
FrontierCode24.3%claude-sonnet-4-6_unknown-1.58
SWE-bench Verified75.2%claude-sonnet-4-6-0.35
LMArena Coding1504 ratingclaude-sonnet-4-60.64

Agents

13 · rank 15 · 2 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents43.0%claude-sonnet-4-6_high-0.89
OSWorld 2.09.3%claude-sonnet-4-6_medium-0.95

Reasoning

22 · rank 33 · 2 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond87.4%claude-sonnet-4-6_32K-1.69
ARC-AGI-260.4%claude-sonnet-4-6_high-0.16

Math

12 · rank 37 · 3 of 5 benchmarks

BenchmarkResultVariantz
OTIS Mock AIME85.8%claude-sonnet-4-6_32K-2.40
ProofBench45.0%claude-sonnet-4-6_max-0.11
LMArena Math1462 ratingclaude-sonnet-4-6-0.69

Writing

63 · rank 23 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1436 ratingclaude-sonnet-4-6-0.44
LMArena Instruction Following1477 ratingclaude-sonnet-4-60.47

Design

33 · rank 28 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1521 ratingclaude-sonnet-4-6-0.37