Model comparison

Gemini 3.1 Flash Lite vs Qwen2.5 72B Instruct

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 31.9 on the Noometry Index.

Last verified . 24 shared benchmarks.

Gemini 3.1 Flash Lite Google

40.8

Rank #144 Confirmed

Qwen2.5 72B Instruct Alibaba (Qwen)

31.9

Rank #267 Confirmed

Summary

  • They share 24 benchmarks with published results for both. Gemini 3.1 Flash Lite scores higher in 9 categories and Qwen2.5 72B Instruct in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 3.1 Flash Lite leads 40.7 to 19.3.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 80% for Gemini 3.1 Flash Lite and 8.1% for Qwen2.5 72B Instruct.
  • Gemini 3.1 Flash Lite is cheaper at $0.25 / $1.50 per million input/output tokens, against $1.40 / $5.60 for Qwen2.5 72B Instruct.
  • Gemini 3.1 Flash Lite accepts more context: 1.05M tokens versus 131K.
  • Qwen2.5 72B Instruct has downloadable open weights; the other is API-only.

Side by side

Gemini 3.1 Flash Lite and Qwen2.5 72B Instruct specifications
Gemini 3.1 Flash LiteQwen2.5 72B Instruct
ProviderGoogleAlibaba (Qwen)
Noometry Index40.831.9
Released2026-03-032024-09
WeightsProprietaryOpen
Context window1.05M131K
Max output66K8K
Input $ / M tokens$0.25$1.40
Output $ / M tokens$1.50$5.60
Results tracked3843

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 37.8 (#188), Qwen2.5 72B Instruct: 33.2 (#260)

Coding benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
WeirdML52.2%16%
LMArena Coding14001292
LMArena WebDev1256—
SciCode41.9%—
BigCodeBench Instruct—45.8%
BigCodeBench Complete—55.9%
ALE-Bench797.73—

Agentic & Tool Use Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 30.2 (#79), Qwen2.5 72B Instruct: 22.1 (#133)

Agentic & Tool Use benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
TheAgentCompany—5.7%
DeepResearch Bench37.3%—
BALROG—16.2%
METR Time Horizons—35.8%

Reasoning Too close to call

Gemini 3.1 Flash Lite: 22.9 (#186), Qwen2.5 72B Instruct: 22.3 (#199)

Reasoning benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
LMArena Hard Prompts14071271
DTBench76.8%62.9%
LMCA35%13.4%
Epoch Capabilities Index144.47129
ForecastBench54.457.5
Kagi LLM Benchmark67.2%—
NYT Connections (extended)8.2%—
CritPt1.1%—
Chess Puzzles25%—
EnigmaEval3%—
Thematic Generalization63.3%—
BIG-Bench Hard—79.8%
HellaSwag—84.8%
PIQA—82.6%
WinoGrande—82.3%

Math Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 40.7 (#90), Qwen2.5 72B Instruct: 19.3 (#287)

Math benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
OTIS Mock AIME 2024-202580%8.1%
LMArena Math14281283
FrontierMath (Tiers 1-3)27.7%—
Omni-MATH—33%
MATH Level 5—63.2%

Knowledge Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 41.9 (#104), Qwen2.5 72B Instruct: 27.0 (#253)

Knowledge benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
GPQA Diamond81.8%49.1%
LMArena Expert13981245
Humanity's Last Exam8.6%—
MMLU-Pro—63.1%
Confabulations—19.1%
Vectara Hallucination Rate8.2%—
GPQA (HELM)—42.6%
ARC (AI2) Challenge—94.5%
MMLU—85.3%
TriviaQA—71.9%

Multimodal Not comparable

Gemini 3.1 Flash Lite: 39.4 (#60), Qwen2.5 72B Instruct: —

Multimodal benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
LMArena Vision1240—

Multilingual Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 52.3 (#86), Qwen2.5 72B Instruct: 41.0 (#213)

Multilingual benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
LMArena Non-English14111252
LMArena Chinese14611272
LMArena French14241280
LMArena German14291234
LMArena Japanese14131180
LMArena Korean13921188
LMArena Russian14201264
LMArena Spanish14211256

Instruction Following Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 72.7 (#131), Qwen2.5 72B Instruct: 65.5 (#221)

Instruction Following benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
LMArena Instruction Following13771254
IFEval—80.6%

Long Context Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 42.5 (#122), Qwen2.5 72B Instruct: 38.9 (#188)

Long Context benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
LMArena Longer Query13941282

Writing & Preference Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 60.9 (#94), Qwen2.5 72B Instruct: 46.7 (#215)

Writing & Preference benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5 72B Instruct
LMArena Text14161269
LMArena Creative Writing14011221
LMArena Multi-Turn14171272
WildBench—80.2%

Frequently asked questions

Is Gemini 3.1 Flash Lite better than Qwen2.5 72B Instruct?

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 31.9 on the Noometry Index.

Which is cheaper, Gemini 3.1 Flash Lite or Qwen2.5 72B Instruct?

Gemini 3.1 Flash Lite is cheaper. It lists at $0.25 per million input tokens and $1.50 per million output tokens; Qwen2.5 72B Instruct lists at $1.40 and $5.60.

Is Gemini 3.1 Flash Lite or Qwen2.5 72B Instruct better for coding?

Gemini 3.1 Flash Lite scores higher on coding benchmarks: 37.8 versus 33.2 in the Noometry coding category.

Which has the bigger context window?

Gemini 3.1 Flash Lite does, with 1.05M tokens against 131K.

How many benchmarks do Gemini 3.1 Flash Lite and Qwen2.5 72B Instruct share?

24 benchmarks have published results for both models. Gemini 3.1 Flash Lite has 38 scored results on Noometry and Qwen2.5 72B Instruct has 43.

Related comparisons

Go deeper