Model comparison

Gemma 7B vs Qwen1.5 4b Chat

Gemma 7B is the stronger model overall, scoring 30.0 to 28.8 on the Noometry Index.

Last verified . 12 shared benchmarks.

Gemma 7B Google

30.0

Rank #299 Confirmed

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Gemma 7B scores higher in 8 categories and Qwen1.5 4b Chat in 0 categories; 5 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Gemma 7B leads 27.1 to 23.8.

Side by side

Gemma 7B and Qwen1.5 4b Chat specifications
Gemma 7BQwen1.5 4b Chat
ProviderGoogleAlibaba (Qwen)
Noometry Index30.028.8
Released2024-02-21—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2713

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 7B leads

Gemma 7B: 30.5 (#294), Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Coding1048999
HumanEval+28.7%—
MBPP+43.4%—

Reasoning Gemma 7B leads

Gemma 7B: 19.9 (#249), Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Hard Prompts1042976
Adversarial NLI48.7%—
BIG-Bench Hard55.1%—
Epoch Capabilities Index111.99—
HellaSwag82.2%—
PIQA81.2%—
WinoGrande79%—

Math Too close to call

Gemma 7B: 31.2 (#228), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Math10661026
GSM8K46.4%—

Knowledge Too close to call

Gemma 7B: 27.3 (#252), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Expert1001980
ARC (AI2) Challenge78.3%—
BoolQ83.2%—
MMLU66.1%—
OpenBookQA78.6%—
TriviaQA72.3%—

Multilingual Gemma 7B leads

Gemma 7B: 25.1 (#287), Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Non-English999979
LMArena Chinese10351024
LMArena Russian993952
LMArena French1025—
LMArena German—902

Instruction Following Gemma 7B leads

Gemma 7B: 51.5 (#295), Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Instruction Following1017978

Long Context Too close to call

Gemma 7B: 31.1 (#282), Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Longer Query1022988

Writing & Preference Gemma 7B leads

Gemma 7B: 27.1 (#302), Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkGemma 7BQwen1.5 4b Chat
LMArena Text1056997
LMArena Creative Writing1024969
LMArena Multi-Turn963977

Frequently asked questions

Is Gemma 7B better than Qwen1.5 4b Chat?

Gemma 7B is the stronger model overall, scoring 30.0 to 28.8 on the Noometry Index.

Is Gemma 7B or Qwen1.5 4b Chat better for coding?

Gemma 7B scores higher on coding benchmarks: 30.5 versus 29.1 in the Noometry coding category.

How many benchmarks do Gemma 7B and Qwen1.5 4b Chat share?

12 benchmarks have published results for both models. Gemma 7B has 27 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper