Model comparison

Gemini 3.1 Flash Lite vs Qwen2.5-VL 72B Instruct

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 29.9 on the Noometry Index.

Last verified . 2 shared benchmarks.

Gemini 3.1 Flash Lite Google

40.8

Rank #144 Confirmed

Summary

  • They share 2 benchmarks with published results for both. Gemini 3.1 Flash Lite scores higher in 3 categories and Qwen2.5-VL 72B Instruct in 0 categories; 3 gaps are clear of the uncertainty.
  • The widest gap is in agentic & tool use, where Gemini 3.1 Flash Lite leads 30.2 to 18.6.
  • The biggest single-benchmark swing is Kagi LLM Benchmark: 67.2% for Gemini 3.1 Flash Lite and 36% for Qwen2.5-VL 72B Instruct.
  • Gemini 3.1 Flash Lite is cheaper at $0.25 / $1.50 per million input/output tokens, against $2.80 / $8.40 for Qwen2.5-VL 72B Instruct.
  • Gemini 3.1 Flash Lite accepts more context: 1.05M tokens versus 131K.
  • Qwen2.5-VL 72B Instruct has downloadable open weights; the other is API-only.

Side by side

Gemini 3.1 Flash Lite and Qwen2.5-VL 72B Instruct specifications
Gemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
ProviderGoogleAlibaba (Qwen)
Noometry Index40.829.9
Released2026-03-032024-09
WeightsProprietaryOpen
Context window1.05M131K
Max output66K8K
Input $ / M tokens$0.25$2.80
Output $ / M tokens$1.50$8.40
Results tracked386

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Gemini 3.1 Flash Lite: 37.8 (#188), Qwen2.5-VL 72B Instruct: —

Coding benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
LMArena WebDev1256—
SciCode41.9%—
WeirdML52.2%—
LMArena Coding1400—
ALE-Bench797.73—

Agentic & Tool Use Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 30.2 (#79), Qwen2.5-VL 72B Instruct: 18.6 (#144)

Agentic & Tool Use benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
DeepResearch Bench37.3%—
OSWorld—5%

Reasoning Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 22.9 (#186), Qwen2.5-VL 72B Instruct: 20.7 (#233)

Reasoning benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
Kagi LLM Benchmark67.2%36%
NYT Connections (extended)8.2%—
CritPt1.1%—
Chess Puzzles25%—
EnigmaEval3%—
Thematic Generalization63.3%—
LMArena Hard Prompts1407—
DTBench76.8%—
LMCA35%—
Epoch Capabilities Index144.47—
ForecastBench54.4—

Math Not comparable

Gemini 3.1 Flash Lite: 40.7 (#90), Qwen2.5-VL 72B Instruct: —

Math benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
FrontierMath (Tiers 1-3)27.7%—
OTIS Mock AIME 2024-202580%—
LMArena Math1428—

Knowledge Not comparable

Gemini 3.1 Flash Lite: 41.9 (#104), Qwen2.5-VL 72B Instruct: —

Knowledge benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
GPQA Diamond81.8%—
Humanity's Last Exam8.6%—
Vectara Hallucination Rate8.2%—
LMArena Expert1398—

Multimodal Gemini 3.1 Flash Lite leads

Gemini 3.1 Flash Lite: 39.4 (#60), Qwen2.5-VL 72B Instruct: 33.5 (#97)

Multimodal benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
LMArena Vision12401107
Video-MME—73.5%
GeoBench—62%
SpatialViz-Bench—33.3%

Multilingual Not comparable

Gemini 3.1 Flash Lite: 52.3 (#86), Qwen2.5-VL 72B Instruct: —

Multilingual benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
LMArena Non-English1411—
LMArena Chinese1461—
LMArena French1424—
LMArena German1429—
LMArena Japanese1413—
LMArena Korean1392—
LMArena Russian1420—
LMArena Spanish1421—

Instruction Following Not comparable

Gemini 3.1 Flash Lite: 72.7 (#131), Qwen2.5-VL 72B Instruct: —

Instruction Following benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
LMArena Instruction Following1377—

Long Context Not comparable

Gemini 3.1 Flash Lite: 42.5 (#122), Qwen2.5-VL 72B Instruct: —

Long Context benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
LMArena Longer Query1394—

Writing & Preference Not comparable

Gemini 3.1 Flash Lite: 60.9 (#94), Qwen2.5-VL 72B Instruct: —

Writing & Preference benchmarks
BenchmarkGemini 3.1 Flash LiteQwen2.5-VL 72B Instruct
LMArena Text1416—
LMArena Creative Writing1401—
LMArena Multi-Turn1417—

Frequently asked questions

Is Gemini 3.1 Flash Lite better than Qwen2.5-VL 72B Instruct?

Gemini 3.1 Flash Lite is the stronger model overall, scoring 40.8 to 29.9 on the Noometry Index.

Which is cheaper, Gemini 3.1 Flash Lite or Qwen2.5-VL 72B Instruct?

Gemini 3.1 Flash Lite is cheaper. It lists at $0.25 per million input tokens and $1.50 per million output tokens; Qwen2.5-VL 72B Instruct lists at $2.80 and $8.40.

Which has the bigger context window?

Gemini 3.1 Flash Lite does, with 1.05M tokens against 131K.

How many benchmarks do Gemini 3.1 Flash Lite and Qwen2.5-VL 72B Instruct share?

2 benchmarks have published results for both models. Gemini 3.1 Flash Lite has 38 scored results on Noometry and Qwen2.5-VL 72B Instruct has 6.

Related comparisons

Go deeper