Model comparison

Gemini 1.5 Flash 8B vs Qwen3.7 Plus

Qwen3.7 Plus is the stronger model overall, scoring 45.3 to 29.9 on the Noometry Index.

Last verified . 21 shared benchmarks.

Gemini 1.5 Flash 8B Google

29.9

Rank #301 Confirmed

Qwen3.7 Plus Alibaba (Qwen)

45.3

Rank #72 Confirmed

Summary

  • They share 21 benchmarks with published results for both. Gemini 1.5 Flash 8B scores higher in 0 categories and Qwen3.7 Plus in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Qwen3.7 Plus leads 54.9 to 16.0.
  • The biggest single-benchmark swing is OTIS Mock AIME 2024-2025: 4.6% for Gemini 1.5 Flash 8B and 93.3% for Qwen3.7 Plus.

Side by side

Gemini 1.5 Flash 8B and Qwen3.7 Plus specifications
Gemini 1.5 Flash 8BQwen3.7 Plus
ProviderGoogleAlibaba (Qwen)
Noometry Index29.945.3
Released2024-10-032026-06-02
WeightsProprietaryProprietary
Context window—1M
Max output—131K
Input $ / M tokens—$0.40
Output $ / M tokens—$1.60
Results tracked2132

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 35.5 (#225), Qwen3.7 Plus: 36.6 (#206)

Coding benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Coding12181473
FrontierCode—10.2%
SciCode—45.5%

Agentic & Tool Use Not comparable

Gemini 1.5 Flash 8B: —, Qwen3.7 Plus: 21.4 (#138)

Agentic & Tool Use benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
OSWorld 2.0—2.8%

Reasoning Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 20.0 (#244), Qwen3.7 Plus: 39.3 (#59)

Reasoning benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Hard Prompts12091460
DTBench50%84%
NYT Connections (extended)—74.8%
CritPt—9.1%
Chess Puzzles—24%
Mystery Game Puzzles—17%
LMCA—37.6%
Epoch Capabilities Index—147.37

Math Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 14.2 (#302), Qwen3.7 Plus: 50.5 (#56)

Math benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
OTIS Mock AIME 2024-20254.6%93.3%
LMArena Math12071466
FrontierMath (Tiers 1-3)—34.4%

Knowledge Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 16.0 (#289), Qwen3.7 Plus: 54.9 (#51)

Knowledge benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
GPQA Diamond33%87.9%
LMArena Expert11851467

Multimodal Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 28.2 (#115), Qwen3.7 Plus: 41.8 (#33)

Multimodal benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Vision10441279
LMArena Document—1444

Multilingual Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 38.5 (#229), Qwen3.7 Plus: 54.8 (#38)

Multilingual benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Non-English12151445
LMArena Chinese12311510
LMArena French12341473
LMArena German12061471
LMArena Japanese11501413
LMArena Korean11401415
LMArena Russian12361457
LMArena Spanish12121457

Instruction Following Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 62.8 (#236), Qwen3.7 Plus: 75.8 (#52)

Instruction Following benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Instruction Following11991440

Long Context Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 37.0 (#225), Qwen3.7 Plus: 44.5 (#65)

Long Context benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Longer Query12191455

Writing & Preference Qwen3.7 Plus leads

Gemini 1.5 Flash 8B: 42.8 (#232), Qwen3.7 Plus: 64.3 (#56)

Writing & Preference benchmarks
BenchmarkGemini 1.5 Flash 8BQwen3.7 Plus
LMArena Text12261455
LMArena Creative Writing12181439
LMArena Multi-Turn11851460

Frequently asked questions

Is Gemini 1.5 Flash 8B better than Qwen3.7 Plus?

Qwen3.7 Plus is the stronger model overall, scoring 45.3 to 29.9 on the Noometry Index.

Is Gemini 1.5 Flash 8B or Qwen3.7 Plus better for coding?

Qwen3.7 Plus scores higher on coding benchmarks: 36.6 versus 35.5 in the Noometry coding category.

How many benchmarks do Gemini 1.5 Flash 8B and Qwen3.7 Plus share?

21 benchmarks have published results for both models. Gemini 1.5 Flash 8B has 21 scored results on Noometry and Qwen3.7 Plus has 32.

Related comparisons

Go deeper