Model comparison

Gemini 3.5 Flash Lite vs Qwen1.5 4b Chat

Gemini 3.5 Flash Lite is the stronger model overall, scoring 41.5 to 28.8 on the Noometry Index.

Last verified . 13 shared benchmarks.

Gemini 3.5 Flash Lite Google

41.5

Rank #133 Confirmed

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Gemini 3.5 Flash Lite scores higher in 7 categories and Qwen1.5 4b Chat in 1 category; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Gemini 3.5 Flash Lite leads 64.2 to 23.8.
  • Qwen1.5 4b Chat has downloadable open weights; the other is API-only.

Side by side

Gemini 3.5 Flash Lite and Qwen1.5 4b Chat specifications
Gemini 3.5 Flash LiteQwen1.5 4b Chat
ProviderGoogleAlibaba (Qwen)
Noometry Index41.528.8
Released2026-07-21—
WeightsProprietaryOpen
Context window1.05M—
Max output66K—
Input $ / M tokens$0.30—
Output $ / M tokens$2.50—
Results tracked3913

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 42.4 (#104), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Coding1453999
LMArena WebDev1440—
SciCode41.3%—
WeirdML39%—
ALE-Bench765.27—

Agentic & Tool Use Not comparable

Gemini 3.5 Flash Lite: 25.7 (#107), Qwen1.5 4b Chat: —

Agentic & Tool Use benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
APEX-Agents29.3%—
GDP.pdf10%—

Reasoning Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 27.8 (#114), Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Hard Prompts1441976
ARC-AGI-210.3%—
NYT Connections (extended)60.4%—
ARC-AGI-153.5%—
CritPt0%—
Chess Puzzles22%—
Mystery Game Puzzles19%—
DTBench83.5%—
LMCA37.6%—
Epoch Capabilities Index145.13—

Math Qwen1.5 4b Chat leads

Gemini 3.5 Flash Lite: 25.9 (#264), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Math14331026
FrontierMath (Tiers 1-3)26%—
FrontierMath Tier 40%—
OTIS Mock AIME 2024-202571.1%—
ProofBench13%—

Knowledge Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 50.1 (#72), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Expert1435980
GPQA Diamond83.3%—

Multimodal Not comparable

Gemini 3.5 Flash Lite: 41.1 (#40), Qwen1.5 4b Chat: —

Multimodal benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Vision1268—

Multilingual Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 53.5 (#63), Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Non-English1427979
LMArena Chinese14691024
LMArena German1454902
LMArena Russian1443952
LMArena French1451—
LMArena Japanese1427—
LMArena Korean1407—
LMArena Spanish1442—

Instruction Following Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 74.8 (#85), Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Instruction Following1420978

Long Context Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 43.9 (#84), Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Longer Query1435988

Writing & Preference Gemini 3.5 Flash Lite leads

Gemini 3.5 Flash Lite: 64.2 (#57), Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkGemini 3.5 Flash LiteQwen1.5 4b Chat
LMArena Text1435997
LMArena Creative Writing1420969
LMArena Multi-Turn1445977
EQ-Bench Creative Writing1559—

Frequently asked questions

Is Gemini 3.5 Flash Lite better than Qwen1.5 4b Chat?

Gemini 3.5 Flash Lite is the stronger model overall, scoring 41.5 to 28.8 on the Noometry Index.

Is Gemini 3.5 Flash Lite or Qwen1.5 4b Chat better for coding?

Gemini 3.5 Flash Lite scores higher on coding benchmarks: 42.4 versus 29.1 in the Noometry coding category.

How many benchmarks do Gemini 3.5 Flash Lite and Qwen1.5 4b Chat share?

13 benchmarks have published results for both models. Gemini 3.5 Flash Lite has 39 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper