Model comparison

Claude 3.5 Sonnet vs Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 34.6 on the Noometry Index.

Last verified . 26 shared benchmarks.

Claude 3.5 Sonnet Anthropic

34.6

Rank #231 Confirmed

Gemini 3.1 Flash Lite Google

40.8

Rank #144 Confirmed

Summary

  • They share 26 benchmarks with published results for both. Claude 3.5 Sonnet scores higher in 3 categories and Gemini 3.1 Flash Lite in 7 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 3.1 Flash Lite leads 40.7 to 19.2.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 8.5% for Claude 3.5 Sonnet and 80% for Gemini 3.1 Flash Lite.

Side by side

Claude 3.5 Sonnet and Gemini 3.1 Flash Lite specifications
Claude 3.5 SonnetGemini 3.1 Flash Lite
ProviderAnthropicGoogle
Noometry Index34.640.8
Released2024-06-202026-03-03
WeightsProprietaryProprietary
Context window—1.05M
Max output—66K
Input $ / M tokens—$0.25
Output $ / M tokens—$1.50
Results tracked6038

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 39.0 (#165), Gemini 3.1 Flash Lite: 37.8 (#188)

Coding benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
WeirdML40%52.2%
LMArena Coding13421400
Aider Polyglot51.6%—
LMArena WebDev—1256
SciCode—41.9%
GSO4.6%—
BigCodeBench Instruct46.8%—
LiveBench Coding67.1%—
BigCodeBench Complete58.6%—
CadEval48%—
ALE-Bench—797.73
HumanEval+81.7%—
MBPP+74.3%—

Agentic & Tool Use Claude 3.5 Sonnet leads

Claude 3.5 Sonnet: 32.3 (#67), Gemini 3.1 Flash Lite: 30.2 (#79)

Agentic & Tool Use benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
TheAgentCompany24%—
Cybench17.5%—
DeepResearch Bench—37.3%
BALROG32.6%—
METR Time Horizons45.2%—

Reasoning Too close to call

Claude 3.5 Sonnet: 23.1 (#183), Gemini 3.1 Flash Lite: 22.9 (#186)

Reasoning benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
EnigmaEval0.9%3%
LMArena Hard Prompts13051407
DTBench67.8%76.8%
Epoch Capabilities Index133.55144.47
ForecastBench60.754.4
SimpleBench41.4%—
Kagi LLM Benchmark—67.2%
NYT Connections (extended)—8.2%
CritPt—1.1%
Chess Puzzles—25%
Thematic Generalization—63.3%
LiveBench Reasoning56.7%—
LiveBench Data Analysis55%—
LMCA—35%
LiveBench59%—

Math Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 19.2 (#288), Gemini 3.1 Flash Lite: 40.7 (#90)

Math benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
OTIS Mock AIME 2024-20258.5%80%
LMArena Math13071428
FrontierMath (Tiers 1-3)—27.7%
Omni-MATH27.6%—
LiveBench Math52.3%—
MATH Level 556.9%—
FrontierMath (Feb 2025 set)2.1%—
FrontierMath Tier 4 (v1)0%—

Knowledge Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 28.6 (#245), Gemini 3.1 Flash Lite: 41.9 (#104)

Knowledge benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
GPQA Diamond55.3%81.8%
Humanity's Last Exam4.1%8.6%
LMArena Expert12651398
MMLU-Pro77.7%—
Confabulations19.9%—
Vectara Hallucination Rate—8.2%
GPQA (HELM)56.5%—
MMLU87.3%—

Multimodal Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 26.5 (#120), Gemini 3.1 Flash Lite: 39.4 (#60)

Multimodal benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
LMArena Vision11251240
Video-MME60%—
GeoBench62%—
VPCT33%—

Multilingual Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 43.2 (#185), Gemini 3.1 Flash Lite: 52.3 (#86)

Multilingual benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
LMArena Non-English12831411
LMArena Chinese12721461
LMArena French13051424
LMArena German12971429
LMArena Japanese12341413
LMArena Korean12001392
LMArena Russian13061420
LMArena Spanish12901421

Instruction Following Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 68.8 (#182), Gemini 3.1 Flash Lite: 72.7 (#131)

Instruction Following benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
LMArena Instruction Following12971377
LiveBench Instruction Following69.3%—
IFEval85.5%—

Long Context Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 39.9 (#167), Gemini 3.1 Flash Lite: 42.5 (#122)

Long Context benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
LMArena Longer Query13111394

Writing & Preference Gemini 3.1 Flash Lite leads

Claude 3.5 Sonnet: 52.9 (#164), Gemini 3.1 Flash Lite: 60.9 (#94)

Writing & Preference benchmarks
BenchmarkClaude 3.5 SonnetGemini 3.1 Flash Lite
LMArena Text12981416
LMArena Creative Writing12921401
LMArena Multi-Turn13261417
Short-Story Creative Writing80.3%—
EQ-Bench Creative Writing1451—
WildBench79.2%—
LiveBench Language53.8%—

Frequently asked questions

Is Claude 3.5 Sonnet better than Gemini 3.1 Flash Lite?

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 34.6 on the Noometry Index.

Is Claude 3.5 Sonnet or Gemini 3.1 Flash Lite better for coding?

Claude 3.5 Sonnet scores higher on coding benchmarks: 39.0 versus 37.8 in the Noometry coding category.

How many benchmarks do Claude 3.5 Sonnet and Gemini 3.1 Flash Lite share?

26 benchmarks have published results for both models. Claude 3.5 Sonnet has 60 scored results on Noometry and Gemini 3.1 Flash Lite has 38.

Related comparisons

Go deeper