Model comparison

Claude Sonnet 4.6 vs Gemini 2.0 Flash-Lite

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 37.8 on the Noometry Index.

Last verified . 20 shared benchmarks.

Claude Sonnet 4.6 Anthropic

50.3

Rank #50 Confirmed

Gemini 2.0 Flash-Lite Google

37.8

Rank #194 Confirmed

Summary

  • They share 20 benchmarks with published results for both. Claude Sonnet 4.6 scores higher in 9 categories and Gemini 2.0 Flash-Lite in 0 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Claude Sonnet 4.6 leads 46.1 to 22.0.
  • The biggest single-benchmark swing is DTBench: 89.9% for Claude Sonnet 4.6 and 52.5% for Gemini 2.0 Flash-Lite.

Side by side

Claude Sonnet 4.6 and Gemini 2.0 Flash-Lite specifications
Claude Sonnet 4.6Gemini 2.0 Flash-Lite
ProviderAnthropicGoogle
Noometry Index50.337.8
Released2026-02-172025-02-05
WeightsProprietaryProprietary
Context window1M—
Max output128K—
Input $ / M tokens$3—
Output $ / M tokens$15—
Results tracked5732

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.3 (#67), Gemini 2.0 Flash-Lite: 37.9 (#185)

Coding benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Coding15041322
SWE-bench Verified75.2%—
DeepSWE29.9%—
FrontierCode24.3%—
LMArena WebDev1522—
SciCode46.8%—
WeirdML66.1%—
LiveBench Coding—47.1%
ALE-Bench1,327—

Agentic & Tool Use Not comparable

Claude Sonnet 4.6: 39.1 (#28), Gemini 2.0 Flash-Lite: —

Agentic & Tool Use benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
Terminal-Bench53.4%—
APEX-Agents43%—
OSWorld 2.09.3%—
DeepResearch Bench54.9%—
OSWorld72.1%—
ExploitBench23.6%—
GBAEval48.8%—
GDP.pdf18%—
LMArena Search1221—
Vending-Bench 27,204—

Reasoning Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 46.1 (#45), Gemini 2.0 Flash-Lite: 22.0 (#210)

Reasoning benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Hard Prompts14841324
DTBench89.9%52.5%
ForecastBench6257.1
ARC-AGI-260.4%—
NYT Connections (extended)80.9%—
ARC-AGI-186.5%—
CritPt3.1%—
Chess Puzzles13%—
Thematic Generalization76.3%—
LiveBench Reasoning—50.1%
Mystery Game Puzzles16%—
LiveBench Data Analysis—65.5%
LMCA46.5%—
Epoch Capabilities Index152.24—
LiveBench—54.3%

Math Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 52.9 (#49), Gemini 2.0 Flash-Lite: 34.1 (#196)

Math benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Math14621309
OTIS Mock AIME 2024-202585.8%—
ProofBench45%—
Omni-MATH—37.4%
LiveBench Math—58.1%
FrontierMath (Feb 2025 set)32.4%—
FrontierMath Tier 4 (v1)8.3%—

Knowledge Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 51.7 (#65), Gemini 2.0 Flash-Lite: 35.0 (#189)

Knowledge benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Expert15001305
GPQA Diamond87.4%—
SimpleQA Verified35.5%—
MMLU-Pro—72%
Vectara Hallucination Rate10.6%—
GPQA (HELM)—50%

Multimodal Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 38.0 (#68), Gemini 2.0 Flash-Lite: 31.2 (#109)

Multimodal benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Vision12831100
Blueprint-Bench 26.7%—
LMArena Document1482—

Multilingual Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 54.4 (#41), Gemini 2.0 Flash-Lite: 46.0 (#161)

Multilingual benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Non-English14401323
LMArena Chinese14911339
LMArena French14651347
LMArena German14281306
LMArena Japanese14201301
LMArena Korean14111325
LMArena Russian14401328
LMArena Spanish14641313

Instruction Following Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 77.4 (#25), Gemini 2.0 Flash-Lite: 70.4 (#163)

Instruction Following benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Instruction Following14751305
LiveBench Instruction Following—78.3%
IFEval—82.4%

Long Context Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 45.3 (#44), Gemini 2.0 Flash-Lite: 40.1 (#160)

Long Context benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Longer Query14791320

Writing & Preference Claude Sonnet 4.6 leads

Claude Sonnet 4.6: 70.2 (#22), Gemini 2.0 Flash-Lite: 51.7 (#177)

Writing & Preference benchmarks
BenchmarkClaude Sonnet 4.6Gemini 2.0 Flash-Lite
LMArena Text14581330
LMArena Creative Writing14351319
LMArena Multi-Turn14641307
EQ-Bench Creative Writing1810—
WildBench—79%
EQ-Bench 41207—
LiveBench Language—34.3%

Frequently asked questions

Is Claude Sonnet 4.6 better than Gemini 2.0 Flash-Lite?

Claude Sonnet 4.6 is the stronger model overall, scoring 50.3 to 37.8 on the Noometry Index.

Is Claude Sonnet 4.6 or Gemini 2.0 Flash-Lite better for coding?

Claude Sonnet 4.6 scores higher on coding benchmarks: 46.3 versus 37.9 in the Noometry coding category.

How many benchmarks do Claude Sonnet 4.6 and Gemini 2.0 Flash-Lite share?

20 benchmarks have published results for both models. Claude Sonnet 4.6 has 57 scored results on Noometry and Gemini 2.0 Flash-Lite has 32.

Related comparisons

Go deeper