Model comparison

Qwen Turbo vs Qwen1.5 4b Chat

Qwen1.5 4b Chat is the stronger model overall, scoring 28.8 to 27.1 on the Noometry Index.

Last verified . 0 shared benchmarks.

Qwen Turbo Alibaba (Qwen)

27.1

Rank #335 Reported

Qwen1.5 4b Chat Alibaba (Qwen)

28.8

Rank #322 Confirmed

Summary

  • The widest gap is in math, where Qwen1.5 4b Chat leads 30.4 to 15.3.
  • Qwen1.5 4b Chat has downloadable open weights; the other is API-only.

Side by side

Qwen Turbo and Qwen1.5 4b Chat specifications
Qwen TurboQwen1.5 4b Chat
ProviderAlibaba (Qwen)Alibaba (Qwen)
Noometry Index27.128.8
Released2024-11-01—
WeightsProprietaryOpen
Context window1M—
Max output16K—
Input $ / M tokens$0.05—
Output $ / M tokens$0.20—
Results tracked313

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Qwen Turbo: —, Qwen1.5 4b Chat: 29.1 (#308)

Coding benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
LMArena Coding—999

Reasoning Not comparable

Qwen Turbo: —, Qwen1.5 4b Chat: 18.5 (#279)

Reasoning benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
LMArena Hard Prompts—976

Math Qwen1.5 4b Chat leads

Qwen Turbo: 15.3 (#297), Qwen1.5 4b Chat: 30.4 (#234)

Math benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
OTIS Mock AIME 2024-20256.1%—
LMArena Math—1026
MATH Level 556.2%—

Knowledge Qwen1.5 4b Chat leads

Qwen Turbo: 22.2 (#272), Qwen1.5 4b Chat: 26.7 (#255)

Knowledge benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
GPQA Diamond41.8%—
LMArena Expert—980

Multilingual Not comparable

Qwen Turbo: —, Qwen1.5 4b Chat: 24.1 (#290)

Multilingual benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
LMArena Non-English—979
LMArena Chinese—1024
LMArena German—902
LMArena Russian—952

Instruction Following Not comparable

Qwen Turbo: —, Qwen1.5 4b Chat: 49.0 (#300)

Instruction Following benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
LMArena Instruction Following—978

Long Context Not comparable

Qwen Turbo: —, Qwen1.5 4b Chat: 30.1 (#290)

Long Context benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
LMArena Longer Query—988

Writing & Preference Not comparable

Qwen Turbo: —, Qwen1.5 4b Chat: 23.8 (#309)

Writing & Preference benchmarks
BenchmarkQwen TurboQwen1.5 4b Chat
LMArena Text—997
LMArena Creative Writing—969
LMArena Multi-Turn—977

Frequently asked questions

Is Qwen Turbo better than Qwen1.5 4b Chat?

Qwen1.5 4b Chat is the stronger model overall, scoring 28.8 to 27.1 on the Noometry Index.

How many benchmarks do Qwen Turbo and Qwen1.5 4b Chat share?

0 benchmarks have published results for both models. Qwen Turbo has 3 scored results on Noometry and Qwen1.5 4b Chat has 13.

Related comparisons

Go deeper