Model comparison

Gemma 3n E4b IT vs Qwen3.8 27B

Qwen3.8 27B is the stronger model overall, scoring 46.0 to 37.3 on the Noometry Index.

Last verified . 17 shared benchmarks.

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Qwen3.8 27B Alibaba (Qwen)

46.0

Rank #68 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Gemma 3n E4b IT scores higher in 0 categories and Qwen3.8 27B in 8 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Qwen3.8 27B leads 41.0 to 19.9.

Side by side

Gemma 3n E4b IT and Qwen3.8 27B specifications
Gemma 3n E4b ITQwen3.8 27B
ProviderGoogleAlibaba (Qwen)
Noometry Index37.346.0
Released—2026-08-14
WeightsOpenOpen
Context window—262K
Max output—33K
Input $ / M tokens—$0.99
Output $ / M tokens—$1.49
Results tracked1831

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Qwen3.8 27B leads

Gemma 3n E4b IT: 37.0 (#198), Qwen3.8 27B: 50.5 (#44)

Coding benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Coding12681482
LMArena WebDev—1593
SciCode—46.6%

Agentic & Tool Use Not comparable

Gemma 3n E4b IT: —, Qwen3.8 27B: 32.9 (#57)

Agentic & Tool Use benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
APEX-Agents—47.5%

Reasoning Qwen3.8 27B leads

Gemma 3n E4b IT: 19.9 (#247), Qwen3.8 27B: 41.0 (#54)

Reasoning benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Hard Prompts12841460
ARC-AGI-2—42.4%
Kagi LLM Benchmark31.5%—
NYT Connections (extended)—54.5%
ARC-AGI-1—87.5%
CritPt—5.4%
DTBench—88%
LMCA—41.4%
Surface Evolver Bench—45%
Epoch Capabilities Index—149.38

Math Qwen3.8 27B leads

Gemma 3n E4b IT: 35.1 (#188), Qwen3.8 27B: 37.1 (#161)

Math benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Math12511456
ProofBench—16%

Knowledge Qwen3.8 27B leads

Gemma 3n E4b IT: 34.2 (#198), Qwen3.8 27B: 41.6 (#109)

Knowledge benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Expert12461482

Multimodal Not comparable

Gemma 3n E4b IT: —, Qwen3.8 27B: 41.3 (#37)

Multimodal benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Vision—1271

Multilingual Qwen3.8 27B leads

Gemma 3n E4b IT: 43.4 (#183), Qwen3.8 27B: 53.7 (#60)

Multilingual benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Non-English12851430
LMArena Chinese13091504
LMArena French13301465
LMArena German13111438
LMArena Japanese12721384
LMArena Korean12591393
LMArena Russian12881415
LMArena Spanish13051448

Instruction Following Qwen3.8 27B leads

Gemma 3n E4b IT: 66.1 (#210), Qwen3.8 27B: 75.8 (#53)

Instruction Following benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Instruction Following12551439

Long Context Qwen3.8 27B leads

Gemma 3n E4b IT: 38.7 (#191), Qwen3.8 27B: 44.3 (#70)

Long Context benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Longer Query12761450

Writing & Preference Qwen3.8 27B leads

Gemma 3n E4b IT: 50.1 (#186), Qwen3.8 27B: 65.8 (#43)

Writing & Preference benchmarks
BenchmarkGemma 3n E4b ITQwen3.8 27B
LMArena Text13061441
LMArena Creative Writing12871384
LMArena Multi-Turn12761441
EQ-Bench Creative Writing—1671

Frequently asked questions

Is Gemma 3n E4b IT better than Qwen3.8 27B?

Qwen3.8 27B is the stronger model overall, scoring 46.0 to 37.3 on the Noometry Index.

Is Gemma 3n E4b IT or Qwen3.8 27B better for coding?

Qwen3.8 27B scores higher on coding benchmarks: 50.5 versus 37.0 in the Noometry coding category.

How many benchmarks do Gemma 3n E4b IT and Qwen3.8 27B share?

17 benchmarks have published results for both models. Gemma 3n E4b IT has 18 scored results on Noometry and Qwen3.8 27B has 31.

Related comparisons

Go deeper