Model comparison

Claude Sonnet 4 vs Gemini 3 Flash Preview

Gemini 3 Flash Preview is the stronger model overall, scoring 52.3 to 40.8 on the Noometry Index.

Last verified . 37 shared benchmarks.

Claude Sonnet 4 Anthropic

40.8

Rank #145 Confirmed

Gemini 3 Flash Preview Google

52.3

Rank #40 Confirmed

Summary

  • They share 37 benchmarks with published results for both. Claude Sonnet 4 scores higher in 0 categories and Gemini 3 Flash Preview in 10 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Gemini 3 Flash Preview leads 49.2 to 22.9.
  • The biggest single-benchmark swing is GeoBench: 37% for Claude Sonnet 4 and 88% for Gemini 3 Flash Preview.
  • Gemini 3 Flash Preview is cheaper at $0.50 / $3 per million input/output tokens, against $3 / $15 for Claude Sonnet 4.
  • Gemini 3 Flash Preview accepts more context: 1.05M tokens versus 200K.

Side by side

Claude Sonnet 4 and Gemini 3 Flash Preview specifications
Claude Sonnet 4Gemini 3 Flash Preview
ProviderAnthropicGoogle
Noometry Index40.852.3
Released2025-05-222025-12-17
WeightsProprietaryProprietary
Context window200K1.05M
Max output64K66K
Input $ / M tokens$3$0.50
Output $ / M tokens$15$3
Results tracked5859

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 3 Flash Preview leads

Claude Sonnet 4: 43.5 (#88), Gemini 3 Flash Preview: 50.9 (#42)

Coding benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
SWE-bench Verified (bash only)64.9%75.8%
GSO4.9%9.8%
WeirdML46.1%61.6%
LMArena Coding14141460
ALE-Bench655.351,367
SWE-bench Verified—75.4%
Aider Polyglot61.3%—
LMArena WebDev—1439
SWE-bench Multilingual—72.7%
SciCode40%—

Agentic & Tool Use Too close to call

Claude Sonnet 4: 38.5 (#31), Gemini 3 Flash Preview: 38.7 (#29)

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
DeepResearch Bench46.6%49.8%
Terminal-Bench—64.3%
TheAgentCompany33.1%—
τ²-bench Airline—82.5%
τ²-bench Banking—27.3%
τ²-bench Retail—76.8%
τ²-bench Telecom—91.2%
Cybench35%—
OSWorld43.9%—
BALROG—48.1%
GDP.pdf—10%
LMArena Search—1198
METR Time Horizons62%—
Vending-Bench 2—3,635

Reasoning Gemini 3 Flash Preview leads

Claude Sonnet 4: 22.9 (#187), Gemini 3 Flash Preview: 49.2 (#37)

Reasoning benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
ARC-AGI-25.9%33.6%
SimpleBench45.5%61.1%
ARC-AGI-140%84.7%
LMArena Hard Prompts13721465
DTBench77.1%89.1%
LMCA29%43.1%
Epoch Capabilities Index141.69151.8
ForecastBench60.258.5
Kagi LLM Benchmark73%—
NYT Connections (extended)—83.1%
CritPt0.3%—
Chess Puzzles—40%
EnigmaEval3.1%—
Mystery Game Puzzles—26%

Math Gemini 3 Flash Preview leads

Claude Sonnet 4: 43.3 (#80), Gemini 3 Flash Preview: 51.7 (#55)

Math benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
OTIS Mock AIME 2024-202571.1%95.6%
LMArena Math13751473
FrontierMath (Feb 2025 set)4.1%35.6%
FrontierMath Tier 4 (v1)0%4.2%
FrontierMath (Tiers 1-3)—51.2%
FrontierMath Tier 4—17.1%
MathArena Final-Answer Competitions—67.6%
ProofBench—15%
Omni-MATH60.2%—
MATH Level 584.4%—

Knowledge Gemini 3 Flash Preview leads

Claude Sonnet 4: 41.8 (#108), Gemini 3 Flash Preview: 58.8 (#33)

Knowledge benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
GPQA Diamond79.2%89.4%
Vectara Hallucination Rate10.3%13.5%
LMArena Expert13721462
Humanity's Last Exam7.8%—
SimpleQA Verified—66.8%
MMLU-Pro84.3%—
Confabulations13.2%—
GPQA (HELM)70.6%—

Multimodal Gemini 3 Flash Preview leads

Claude Sonnet 4: 26.2 (#121), Gemini 3 Flash Preview: 45.5 (#16)

Multimodal benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
LMArena Vision11911285
GeoBench37%88%
VPCT34%72.6%
Blueprint-Bench 2—0%
LMArena Document—1413
MindCube44.8%—

Multilingual Gemini 3 Flash Preview leads

Claude Sonnet 4: 46.7 (#156), Gemini 3 Flash Preview: 55.7 (#27)

Multilingual benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
LMArena Non-English13331458
LMArena Chinese13501511
LMArena French13631477
LMArena German13311497
LMArena Japanese13021489
LMArena Korean12911443
LMArena Russian13551480
LMArena Spanish13571469

Instruction Following Gemini 3 Flash Preview leads

Claude Sonnet 4: 71.7 (#145), Gemini 3 Flash Preview: 75.7 (#56)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
LMArena Instruction Following13761437
IFEval84%—

Long Context Gemini 3 Flash Preview leads

Claude Sonnet 4: 33.7 (#259), Gemini 3 Flash Preview: 44.4 (#67)

Long Context benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
LMArena Longer Query13981452
Fiction.LiveBench46.9%—

Writing & Preference Gemini 3 Flash Preview leads

Claude Sonnet 4: 57.1 (#132), Gemini 3 Flash Preview: 65.5 (#45)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4Gemini 3 Flash Preview
LMArena Text13511466
LMArena Creative Writing13451457
LMArena Multi-Turn13761471
Short-Story Creative Writing81.4%—
EQ-Bench Creative Writing1483—
WildBench83.8%—

Frequently asked questions

Is Claude Sonnet 4 better than Gemini 3 Flash Preview?

Gemini 3 Flash Preview is the stronger model overall, scoring 52.3 to 40.8 on the Noometry Index.

Which is cheaper, Claude Sonnet 4 or Gemini 3 Flash Preview?

Gemini 3 Flash Preview is cheaper. It lists at $0.50 per million input tokens and $3 per million output tokens; Claude Sonnet 4 lists at $3 and $15.

Is Claude Sonnet 4 or Gemini 3 Flash Preview better for coding?

Gemini 3 Flash Preview scores higher on coding benchmarks: 50.9 versus 43.5 in the Noometry coding category.

Which has the bigger context window?

Gemini 3 Flash Preview does, with 1.05M tokens against 200K.

How many benchmarks do Claude Sonnet 4 and Gemini 3 Flash Preview share?

37 benchmarks have published results for both models. Claude Sonnet 4 has 58 scored results on Noometry and Gemini 3 Flash Preview has 59.

Related comparisons

Go deeper