Benchfolio

Leaderboard / Model

Claude Opus 4.8

Anthropic · Closed weights · Released May 28, 2026 · $5 in · $25 out per 1M tokens

55Overall · rank 13

Score by job

Coding

66 · rank 12 · 3 of 5 benchmarks

BenchmarkResultVariantz
DeepSWE59.0%claude-opus-4-8_max0.12
FrontierCode46.5%claude-opus-4-8_unknown0.72
LMArena Coding1491 ratingclaude-opus-4-8-high-0.00

Agents

45 · rank 8 · 3 of 4 benchmarks

BenchmarkResultVariantz
APEX-Agents48.9%claude-opus-4-8_max-0.33
OSWorld 2.020.6%claude-opus-4-8_max0.32
Remote Labor Index8.3%claude-opus-4-8_unknown-0.04

Reasoning

50 · rank 18 · 3 of 4 benchmarks

BenchmarkResultVariantz
GPQA Diamond91.0%claude-opus-4-8_max-0.21
ARC-AGI-272.1%claude-opus-4-8_high0.37
SimpleBench64.8%claude-opus-4-8_unknown-0.06

Math

64 · rank 9 · 5 of 5 benchmarks

BenchmarkResultVariantz
FrontierMath Tiers 1–380.0%claude-opus-4-8_max0.83
FrontierMath Tier 456.1%claude-opus-4-8_max0.63
OTIS Mock AIME98.3%claude-opus-4-8_max0.68
ProofBench69.0%claude-opus-4-8_max0.84
LMArena Math1486 ratingclaude-opus-4-8-high0.21

Writing

66 · rank 18 · 2 of 2 benchmarks

BenchmarkResultVariantz
LMArena Creative Writing1450 ratingclaude-opus-4-8-high-0.04
LMArena Instruction Following1476 ratingclaude-opus-4-8-high0.43

Design

41 · rank 20 · 1 of 1 benchmarks

BenchmarkResultVariantz
LMArena WebDev1555 ratingclaude-opus-4-8-high-0.03