Model comparison

Claude Sonnet 5.5 vs Gemini 3 Pro

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 54.8 on the Noometry Index.

Last verified . 21 shared benchmarks.

Claude Sonnet 5.5 Anthropic

61.9

Rank #10 Confirmed

Gemini 3 Pro Google

54.8

Rank #28 Confirmed

Summary

  • They share 21 benchmarks with published results for both. Claude Sonnet 5.5 scores higher in 7 categories and Gemini 3 Pro in 3 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Claude Sonnet 5.5 leads 87.9 to 49.9.
  • The biggest single-benchmark swing is ProofBench: 100% for Claude Sonnet 5.5 and 20% for Gemini 3 Pro.

Side by side

Claude Sonnet 5.5 and Gemini 3 Pro specifications
Claude Sonnet 5.5Gemini 3 Pro
ProviderAnthropicGoogle
Noometry Index61.954.8
Released2026-09-282025-11-18
WeightsProprietaryProprietary
Context window1M—
Max output128K—
Input $ / M tokens$2—
Output $ / M tokens$10—
Results tracked3267

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 67.3 (#6), Gemini 3 Pro: 51.6 (#39)

Coding benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
LMArena WebDev17741440
LMArena Coding15131481
ALE-Bench1,8191,177
SWE-bench Verified—72.9%
FrontierCode52.1%—
SWE-bench Verified (bash only)—74.2%
CursorBench55.5%—
SWE-bench Multilingual—68.7%
FrontierSWE61.9%—
SciCode61%—
GSO—18.6%
WeirdML—69.9%
AlgoTune—1.83

Agentic & Tool Use Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 45.0 (#16), Gemini 3 Pro: 40.6 (#23)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
Terminal-Bench—69.4%
APEX-Agents75.5%—
Berkeley Function Calling Leaderboard—72.5%
GDPval—40.3%
Remote Labor Index—1.3%
τ²-bench Airline—80.5%
τ²-bench Banking—18%
τ²-bench Retail—75.9%
τ²-bench Telecom—91%
DeepResearch Bench—46.3%
BALROG—58.1%
LMArena Search—1207
METR Time Horizons—71%
Vending-Bench 2—5,478

Reasoning Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 54.0 (#28), Gemini 3 Pro: 52.5 (#31)

Reasoning benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
NYT Connections (extended)80.5%94.4%
CritPt31.4%6.9%
LMArena Hard Prompts14951480
Epoch Capabilities Index165.03152.92
ARC-AGI-2—31.1%
SimpleBench—76.4%
Kagi LLM Benchmark—80.1%
ARC-AGI-1—75%
Chess Puzzles—31%
EnigmaEval—18.2%
Mystery Game Puzzles65%—
ForecastBench—61.2

Math Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 87.9 (#6), Gemini 3 Pro: 49.9 (#59)

Knowledge Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 66.0 (#12), Gemini 3 Pro: 64.4 (#16)

Knowledge benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
GPQA Diamond95.6%92.6%
LMArena Expert15401475
Humanity's Last Exam—37.5%
SimpleQA Verified46.5%—
MMLU-Pro—90.3%
Vectara Hallucination Rate—13.6%
GPQA (HELM)—80.3%

Multimodal Gemini 3 Pro leads

Claude Sonnet 5.5: 51.5 (#6), Gemini 3 Pro: 57.6 (#2)

Multimodal benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
LMArena Vision12891305
GeoBench—84%
VPCT—91%
Furniture Assembly75%—
LMArena Document—1434

Multilingual Gemini 3 Pro leads

Claude Sonnet 5.5: 55.3 (#30), Gemini 3 Pro: 56.9 (#16)

Multilingual benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
LMArena Non-English14521474
LMArena Chinese15221523
LMArena Russian14511493
LMArena French—1492
LMArena German—1515
LMArena Japanese—1510
LMArena Korean—1448
LMArena Spanish—1470

Instruction Following Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 78.3 (#11), Gemini 3 Pro: 76.3 (#45)

Instruction Following benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
LMArena Instruction Following14951458
IFEval—87.7%

Long Context Claude Sonnet 5.5 leads

Claude Sonnet 5.5: 45.9 (#28), Gemini 3 Pro: 44.0 (#79)

Long Context benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
LMArena Longer Query14981471
CL-bench—15.8%

Writing & Preference Too close to call

Claude Sonnet 5.5: 66.0 (#40), Gemini 3 Pro: 66.4 (#35)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 5.5Gemini 3 Pro
LMArena Text14711479
LMArena Creative Writing14651482
LMArena Multi-Turn14741484
EQ-Bench Creative Writing—1525
WildBench—85.9%

Frequently asked questions

Is Claude Sonnet 5.5 better than Gemini 3 Pro?

Claude Sonnet 5.5 is the stronger model overall, scoring 61.9 to 54.8 on the Noometry Index.

Is Claude Sonnet 5.5 or Gemini 3 Pro better for coding?

Claude Sonnet 5.5 scores higher on coding benchmarks: 67.3 versus 51.6 in the Noometry coding category.

How many benchmarks do Claude Sonnet 5.5 and Gemini 3 Pro share?

21 benchmarks have published results for both models. Claude Sonnet 5.5 has 32 scored results on Noometry and Gemini 3 Pro has 67.

Related comparisons

Go deeper