Model comparison

Claude 3.5 Sonnet vs Gemini 3 Flash Preview

Gemini 3 Flash Preview is the stronger model overall, scoring 52.3 to 34.6 on the Noometry Index.

Last verified . 31 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Gemini 3 Flash Preview Google

52.3

Rank #40 Confirmed

Summary

  • They share 31 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 0 categories and Gemini 3 Flash Preview in 10 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 3 Flash Preview leads 51.7 to 19.2.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 8.5% for Claude 3.5 Sonnet and 95.6% for Gemini 3 Flash Preview.

Side by side

Claude 3.5 Sonnet and Gemini 3 Flash Preview specifications
Claude 3.5 SonnetGemini 3 Flash Preview
ProviderAnthropicGoogle
Noometry Index34.652.3
Released2024-06-202025-12-17
WeightsProprietaryProprietary
Context window—1.05M
Max output—66K
Input $ / M tokens—$0.50
Output $ / M tokens—$3
Results tracked6059

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 39.0 (#165), Gemini 3 Flash Preview: 50.9 (#42)

Coding benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
GSO4.6%9.8%
WeirdML40%61.6%
LMArena Coding13421460
SWE-bench Verified—75.4%
SWE-bench Verified (bash only)—75.8%
Aider Polyglot51.6%—
LMArena WebDev—1439
SWE-bench Multilingual—72.7%
BigCodeBench Instruct46.8%—
LiveBench Coding67.1%—
BigCodeBench Complete58.6%—
CadEval48%—
ALE-Bench—1,367
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 32.3 (#67), Gemini 3 Flash Preview: 38.7 (#29)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
BALROG32.6%48.1%
Terminal-Bench—64.3%
TheAgentCompany24%—
τ²-bench Airline—82.5%
τ²-bench Banking—27.3%
τ²-bench Retail—76.8%
τ²-bench Telecom—91.2%
Cybench17.5%—
DeepResearch Bench—49.8%
GDP.pdf—10%
LMArena Search—1198
METR Time Horizons45.2%—
Vending-Bench 2—3,635

Reasoning Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 23.1 (#183), Gemini 3 Flash Preview: 49.2 (#37)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
SimpleBench41.4%61.1%
LMArena Hard Prompts13051465
DTBench67.8%89.1%
Epoch Capabilities Index133.55151.8
ForecastBench60.758.5
ARC-AGI-2—33.6%
NYT Connections (extended)—83.1%
ARC-AGI-1—84.7%
Chess Puzzles—40%
EnigmaEval0.9%—
LiveBench Reasoning56.7%—
Mystery Game Puzzles—26%
LiveBench Data Analysis55%—
LMCA—43.1%
LiveBench59%—

Math Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 19.2 (#288), Gemini 3 Flash Preview: 51.7 (#55)

Math benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
OTIS Mock AIME 2024-20258.5%95.6%
LMArena Math13071473
FrontierMath (Feb 2025 set)2.1%35.6%
FrontierMath Tier 4 (v1)0%4.2%
FrontierMath (Tiers 1-3)—51.2%
FrontierMath Tier 4—17.1%
MathArena Final-Answer Competitions—67.6%
ProofBench—15%
Omni-MATH27.6%—
LiveBench Math52.3%—
MATH Level 556.9%—

Knowledge Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 28.6 (#245), Gemini 3 Flash Preview: 58.8 (#33)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
GPQA Diamond55.3%89.4%
LMArena Expert12651462
Humanity's Last Exam4.1%—
SimpleQA Verified—66.8%
MMLU-Pro77.7%—
Confabulations19.9%—
Vectara Hallucination Rate—13.5%
GPQA (HELM)56.5%—
MMLU87.3%—

Multimodal Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 26.5 (#120), Gemini 3 Flash Preview: 45.5 (#16)

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
LMArena Vision11251285
GeoBench62%88%
VPCT33%72.6%
Video-MME60%—
Blueprint-Bench 2—0%
LMArena Document—1413

Multilingual Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 43.2 (#185), Gemini 3 Flash Preview: 55.7 (#27)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
LMArena Non-English12831458
LMArena Chinese12721511
LMArena French13051477
LMArena German12971497
LMArena Japanese12341489
LMArena Korean12001443
LMArena Russian13061480
LMArena Spanish12901469

Instruction Following Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 68.8 (#182), Gemini 3 Flash Preview: 75.7 (#56)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
LMArena Instruction Following12971437
LiveBench Instruction Following69.3%—
IFEval85.5%—

Long Context Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 39.9 (#167), Gemini 3 Flash Preview: 44.4 (#67)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
LMArena Longer Query13111452

Writing & Preference Gemini 3 Flash Preview leads

Claude 3.5 Sonnet: 52.9 (#164), Gemini 3 Flash Preview: 65.5 (#45)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetGemini 3 Flash Preview
LMArena Text12981466
LMArena Creative Writing12921457
LMArena Multi-Turn13261471
Short-Story Creative Writing80.3%—
EQ-Bench Creative Writing1451—
WildBench79.2%—
LiveBench Language53.8%—

Frequently asked questions

Is Claude 3.5 Sonnet better than Gemini 3 Flash Preview?

Gemini 3 Flash Preview is the stronger model overall, scoring 52.3 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Gemini 3 Flash Preview better for coding?

Gemini 3 Flash Preview scores higher on coding benchmarks: 50.9 versus 39.0 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Gemini 3 Flash Preview share?

31 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Gemini 3 Flash Preview has 59.

Related comparisons

Go deeper