Model comparison

Granite 4.2 8B vs Qwen2.5 72B Instruct

Granite 4.2 8B is the stronger model overall, scoring 40.5 to 31.9 on the Noometry Index.

Last verified . 11 shared benchmarks.

Granite 4.2 8B IBM

40.5

Rank #148 Confirmed

Qwen2.5 72B Instruct Alibaba (Qwen)

31.9

Rank #267 Confirmed

Summary

  • They share 11 benchmarks with published results for both. Granite 4.2 8B scores higher in 7 categories and Qwen2.5 72B Instruct in 0 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Granite 4.2 8B leads 38.4 to 27.0.
  • Granite 4.2 8B is cheaper at $0.06 / $0.25 per million input/output tokens, against $1.40 / $5.60 for Qwen2.5 72B Instruct.

Side by side

Granite 4.2 8B and Qwen2.5 72B Instruct specifications
Granite 4.2 8BQwen2.5 72B Instruct
ProviderIBMAlibaba (Qwen)
Noometry Index40.531.9
Released—2024-09
WeightsOpenOpen
Context window131K131K
Max output118K8K
Input $ / M tokens$0.06$1.40
Output $ / M tokens$0.25$5.60
Results tracked1143

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Granite 4.2 8B leads

Granite 4.2 8B: 40.5 (#137), Qwen2.5 72B Instruct: 33.2 (#260)

Coding benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Coding13801292
WeirdML—16%
BigCodeBench Instruct—45.8%
BigCodeBench Complete—55.9%

Agentic & Tool Use Not comparable

Granite 4.2 8B: —, Qwen2.5 72B Instruct: 22.1 (#133)

Agentic & Tool Use benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
TheAgentCompany—5.7%
BALROG—16.2%
METR Time Horizons—35.8%

Reasoning Granite 4.2 8B leads

Granite 4.2 8B: 26.6 (#131), Qwen2.5 72B Instruct: 22.3 (#199)

Reasoning benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Hard Prompts13291271
DTBench—62.9%
LMCA—13.4%
BIG-Bench Hard—79.8%
Epoch Capabilities Index—129
ForecastBench—57.5
HellaSwag—84.8%
PIQA—82.6%
WinoGrande—82.3%

Math Not comparable

Granite 4.2 8B: —, Qwen2.5 72B Instruct: 19.3 (#287)

Math benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
OTIS Mock AIME 2024-2025—8.1%
Omni-MATH—33%
LMArena Math—1283
MATH Level 5—63.2%

Knowledge Granite 4.2 8B leads

Granite 4.2 8B: 38.4 (#145), Qwen2.5 72B Instruct: 27.0 (#253)

Knowledge benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Expert13841245
GPQA Diamond—49.1%
MMLU-Pro—63.1%
Confabulations—19.1%
GPQA (HELM)—42.6%
ARC (AI2) Challenge—94.5%
MMLU—85.3%
TriviaQA—71.9%

Multilingual Granite 4.2 8B leads

Granite 4.2 8B: 44.5 (#178), Qwen2.5 72B Instruct: 41.0 (#213)

Multilingual benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Non-English13021252
LMArena Chinese13661272
LMArena Russian12851264
LMArena French—1280
LMArena German—1234
LMArena Japanese—1180
LMArena Korean—1188
LMArena Spanish—1256

Instruction Following Granite 4.2 8B leads

Granite 4.2 8B: 68.7 (#184), Qwen2.5 72B Instruct: 65.5 (#221)

Instruction Following benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Instruction Following13011254
IFEval—80.6%

Long Context Granite 4.2 8B leads

Granite 4.2 8B: 40.3 (#159), Qwen2.5 72B Instruct: 38.9 (#188)

Long Context benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Longer Query13241282

Writing & Preference Granite 4.2 8B leads

Granite 4.2 8B: 49.6 (#189), Qwen2.5 72B Instruct: 46.7 (#215)

Writing & Preference benchmarks
BenchmarkGranite 4.2 8BQwen2.5 72B Instruct
LMArena Text13201269
LMArena Creative Writing12361221
LMArena Multi-Turn13011272
WildBench—80.2%

Frequently asked questions

Is Granite 4.2 8B better than Qwen2.5 72B Instruct?

Granite 4.2 8B is the stronger model overall, scoring 40.5 to 31.9 on the Noometry Index.

Which is cheaper, Granite 4.2 8B or Qwen2.5 72B Instruct?

Granite 4.2 8B is cheaper. It lists at $0.06 per million input tokens and $0.25 per million output tokens; Qwen2.5 72B Instruct lists at $1.40 and $5.60.

Is Granite 4.2 8B or Qwen2.5 72B Instruct better for coding?

Granite 4.2 8B scores higher on coding benchmarks: 40.5 versus 33.2 in the Noometry coding category.

Which has the bigger context window?

Both accept 131K tokens.

How many benchmarks do Granite 4.2 8B and Qwen2.5 72B Instruct share?

11 benchmarks have published results for both models. Granite 4.2 8B has 11 scored results on Noometry and Qwen2.5 72B Instruct has 43.

Related comparisons

Go deeper