Model comparison

Claude 3 Sonnet vs Gemini 2.5 Flash-Lite

Gemini 2.5 Flash-Lite is the stronger model overall, scoring 37.0 to 29.0 on the Noometry Index.

Last verified . 21 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Gemini 2.5 Flash-Lite Google

37.0

Rank #211 Confirmed

Summary

  • They share 21 benchmarks with published results for both. Claude 3 Sonnet scores higher in 1 category and Gemini 2.5 Flash-Lite in 8 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 2.5 Flash-Lite leads 38.0 to 10.7.
  • The biggest single-benchmark swing is WeirdML: 10.2% for Claude 3 Sonnet and 35.2% for Gemini 2.5 Flash-Lite.

Side by side

Claude 3 Sonnet and Gemini 2.5 Flash-Lite specifications
Claude 3 SonnetGemini 2.5 Flash-Lite
ProviderAnthropicGoogle
Noometry Index29.037.0
Released2024-02-292025-06-17
WeightsProprietaryProprietary
Context window—1.05M
Max output—66K
Input $ / M tokens—$0.10
Output $ / M tokens—$0.40
Results tracked3033

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 29.6 (#302), Gemini 2.5 Flash-Lite: 38.5 (#173)

Coding benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
WeirdML10.2%35.2%
LMArena Coding12231373
BigCodeBench Instruct42.7%—
BigCodeBench Complete53.8%—
ALE-Bench—325.9
HumanEval+64%—
MBPP+69.3%—

Agentic & Tool Use Not comparable

Claude 3 Sonnet: —, Gemini 2.5 Flash-Lite: 28.0 (#96)

Agentic & Tool Use benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
Berkeley Function Calling Leaderboard—36.9%

Reasoning Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 20.5 (#237), Gemini 2.5 Flash-Lite: 22.2 (#205)

Reasoning benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Hard Prompts11971377
DTBench53.6%62.8%
Epoch Capabilities Index120.7133.94
Kagi LLM Benchmark—40.5%
LMCA—18.1%
WinoGrande75.1%—

Math Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 10.7 (#310), Gemini 2.5 Flash-Lite: 38.0 (#144)

Math benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Math12131373
OTIS Mock AIME 2024-20252.5%—
Omni-MATH—48%
MATH Level 518.2%—

Knowledge Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 21.1 (#276), Gemini 2.5 Flash-Lite: 32.5 (#210)

Knowledge benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Expert11731373
GPQA Diamond40.6%—
MMLU-Pro—53.7%
Vectara Hallucination Rate—3.3%
GPQA (HELM)—30.9%
MMLU75.9%—

Multimodal Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 25.2 (#125), Gemini 2.5 Flash-Lite: 29.1 (#114)

Multimodal benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Vision9841198
VPCT—30%

Multilingual Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 37.8 (#234), Gemini 2.5 Flash-Lite: 49.3 (#134)

Multilingual benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Non-English12051369
LMArena Chinese11891404
LMArena French12291388
LMArena German12041389
LMArena Japanese11311359
LMArena Korean11281360
LMArena Russian12271373
LMArena Spanish12041396

Instruction Following Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 62.8 (#235), Gemini 2.5 Flash-Lite: 70.0 (#168)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Instruction Following11991367
IFEval—81%

Long Context Claude 3 Sonnet leads

Claude 3 Sonnet: 36.7 (#228), Gemini 2.5 Flash-Lite: 33.3 (#262)

Long Context benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Longer Query12111373
Fiction.LiveBench—47.2%

Writing & Preference Gemini 2.5 Flash-Lite leads

Claude 3 Sonnet: 42.1 (#238), Gemini 2.5 Flash-Lite: 56.8 (#135)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetGemini 2.5 Flash-Lite
LMArena Text12181379
LMArena Creative Writing11861367
LMArena Multi-Turn12271366
WildBench—81.8%

Frequently asked questions

Is Claude 3 Sonnet better than Gemini 2.5 Flash-Lite?

Gemini 2.5 Flash-Lite is the stronger model overall, scoring 37.0 to 29.0 on the Noometry Index.

Is Claude 3 Sonnet or Gemini 2.5 Flash-Lite better for coding?

Gemini 2.5 Flash-Lite scores higher on coding benchmarks: 38.5 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Gemini 2.5 Flash-Lite share?

21 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Gemini 2.5 Flash-Lite has 33.

Related comparisons

Go deeper