Model comparison

Claude Sonnet 4.6 vs o1-mini

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 34.0 on the Noometry Index.

Last verified . 24 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

o1-mini OpenAI

34.0

Rank #235 Confirmed

Summary

  • They share 24 benchmarks with published results for both. Claude Sonnet 4.6 scores higher in 9 categories and o1-mini in 0 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Claude Sonnet 4.6 leads 46.1 to 8.8.
  • The biggest single-benchmark swing is ARC-AGI-1: 86.5% for Claude Sonnet 4.6 and 14% for o1-mini.

Side by side

Claude Sonnet 4.6 and o1-mini specifications
Claude Sonnet 4.6o1-mini
ProviderAnthropicOpenAI
Noometry Index50.334.0
Released2026-02-172024-09-12
WeightsProprietaryProprietary
Context window1M—
Max output128K—
Input $ / M tokens$3—
Output $ / M tokens$15—
Results tracked5739

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.3 (#67), o1-mini: 35.5 (#224)

Coding benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
WeirdML66.1%36.3%
LMArena Coding15041362
SWE-bench Verified75.2%—
DeepSWE29.9%—
FrontierCode24.3%—
Aider Polyglot—32.9%
LMArena WebDev1522—
SciCode46.8%—
LiveBench Coding—48%
ALE-Bench1,327—
HumanEval+—89%
MBPP+—78.8%

Agentic & Tool Use Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 39.1 (#28), o1-mini: 24.6 (#118)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
Terminal-Bench53.4%—
APEX-Agents43%—
OSWorld 2.09.3%—
Cybench—10%
DeepResearch Bench54.9%—
OSWorld72.1%—
ExploitBench23.6%—
GBAEval48.8%—
GDP.pdf18%—
LMArena Search1221—
Vending-Bench 27,204—

Reasoning Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.1 (#45), o1-mini: 8.8 (#346)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
ARC-AGI-260.4%0.8%
ARC-AGI-186.5%14%
LMArena Hard Prompts14841333
Epoch Capabilities Index152.24135.82
SimpleBench—18.1%
NYT Connections (extended)80.9%—
CritPt3.1%—
Chess Puzzles13%—
Thematic Generalization76.3%—
LiveBench Reasoning—72.3%
Mystery Game Puzzles16%—
DTBench89.9%—
LiveBench Data Analysis—57.9%
LMCA46.5%—
ForecastBench62—
LiveBench—57.8%

Math Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 52.9 (#49), o1-mini: 35.4 (#186)

Math benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
OTIS Mock AIME 2024-202585.8%46.9%
LMArena Math14621358
FrontierMath (Feb 2025 set)32.4%1.7%
ProofBench45%—
LiveBench Math—62%
MATH Level 5—89.2%
FrontierMath Tier 4 (v1)8.3%—

Knowledge Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 51.7 (#65), o1-mini: 34.9 (#192)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
GPQA Diamond87.4%62.4%
LMArena Expert15001316
SimpleQA Verified35.5%—
Confabulations—18.6%
Vectara Hallucination Rate10.6%—

Multimodal Not comparable

Claude Sonnet 4.6: 38.0 (#68), o1-mini: —

Multimodal benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
LMArena Vision1283—
Blueprint-Bench 26.7%—
LMArena Document1482—

Multilingual Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 54.4 (#41), o1-mini: 43.6 (#182)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
LMArena Non-English14401289
LMArena Chinese14911314
LMArena French14651293
LMArena German14281278
LMArena Japanese14201245
LMArena Korean14111223
LMArena Russian14401283
LMArena Spanish14641303

Instruction Following Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 77.4 (#25), o1-mini: 66.7 (#206)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
LMArena Instruction Following14751304
LiveBench Instruction Following—65.4%

Long Context Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 45.3 (#44), o1-mini: 40.1 (#161)

Long Context benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
LMArena Longer Query14791320

Writing & Preference Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 70.2 (#22), o1-mini: 48.4 (#202)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.6o1-mini
LMArena Text14581317
LMArena Creative Writing14351244
LMArena Multi-Turn14641314
Short-Story Creative Writing—64.9%
EQ-Bench Creative Writing1810—
EQ-Bench 41207—
LiveBench Language—40.9%

Frequently asked questions

Is Claude Sonnet 4.6 better than o1-mini?

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 34.0 on the Noometry Index.

Is Claude Sonnet 4.6 or o1-mini better for coding?

Claude Sonnet 4.6 scores higher on coding benchmarks: 46.3 versus 35.5 in the Noometry coding category.

How many benchmarks do Claude Sonnet 4.6 and o1-mini share?

24 benchmarks have published results for both models. Claude Sonnet 4.6 has 57 scored results on Noometry and o1-mini has 39.

Related comparisons

Go deeper