Model comparison

Falcon-180B vs Granite 3.1 2b Instruct

Granite 3.1 2b Instruct is the stronger model overall, scoring 33.2 to 32.2 on the Noometry Index.

Last verified . 6 shared benchmarks.

Granite 3.1 2b Instruct IBM

33.2

Rank #247 Confirmed

Summary

  • They share 6 benchmarks with published results for both. Falcon-180B scores higher in 0 categories and Granite 3.1 2b Instruct in 4 categories; 4 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Granite 3.1 2b Instruct leads 34.1 to 29.1.

Side by side

Falcon-180B and Granite 3.1 2b Instruct specifications
Falcon-180BGranite 3.1 2b Instruct
ProviderTechnology Innovation InstituteIBM
Noometry Index32.233.2
Released2023-09-06—
WeightsOpenOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked1612

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Not comparable

Falcon-180B: —, Granite 3.1 2b Instruct: 33.4 (#257)

Coding benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Coding—1149

Reasoning Granite 3.1 2b Instruct leads

Falcon-180B: 19.1 (#269), Granite 3.1 2b Instruct: 22.0 (#209)

Reasoning benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Hard Prompts10071138
Epoch Capabilities Index112.13—
HellaSwag89%—
LAMBADA79.8%—
PIQA84.9%—
WinoGrande87.1%—

Math Not comparable

Falcon-180B: —, Granite 3.1 2b Instruct: 33.1 (#206)

Math benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Math—1159
GSM8K54.4%—

Knowledge Not comparable

Falcon-180B: —, Granite 3.1 2b Instruct: 30.8 (#224)

Knowledge benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Expert—1131
ARC (AI2) Challenge67.8%—
BoolQ89%—
MMLU70.6%—
OpenBookQA64.2%—

Multilingual Granite 3.1 2b Instruct leads

Falcon-180B: 25.2 (#286), Granite 3.1 2b Instruct: 29.1 (#269)

Multilingual benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Non-English10001068
LMArena Chinese—1139
LMArena Russian—1063

Instruction Following Granite 3.1 2b Instruct leads

Falcon-180B: 53.4 (#286), Granite 3.1 2b Instruct: 57.7 (#264)

Instruction Following benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Instruction Following10471116

Long Context Not comparable

Falcon-180B: —, Granite 3.1 2b Instruct: 35.0 (#244)

Long Context benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Longer Query—1155

Writing & Preference Granite 3.1 2b Instruct leads

Falcon-180B: 29.1 (#295), Granite 3.1 2b Instruct: 34.1 (#274)

Writing & Preference benchmarks
BenchmarkFalcon-180BGranite 3.1 2b Instruct
LMArena Text10541127
LMArena Creative Writing10891116
LMArena Multi-Turn10131099

Frequently asked questions

Is Falcon-180B better than Granite 3.1 2b Instruct?

Granite 3.1 2b Instruct is the stronger model overall, scoring 33.2 to 32.2 on the Noometry Index.

How many benchmarks do Falcon-180B and Granite 3.1 2b Instruct share?

6 benchmarks have published results for both models. Falcon-180B has 16 scored results on Noometry and Granite 3.1 2b Instruct has 12.

Related comparisons

Go deeper