Model comparison

Granite 3.0 2b Instruct vs Mistral Large

Mistral Large is the stronger model overall, scoring 31.9 to 30.8 on the Noometry Index.

Last verified . 13 shared benchmarks.

Granite 3.0 2b Instruct IBM

30.8

Rank #286 Confirmed

Mistral Large Mistral AI

31.9

Rank #263 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Granite 3.0 2b Instruct scores higher in 2 categories and Mistral Large in 6 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in math, where Granite 3.0 2b Instruct leads 32.2 to 18.2.
  • The biggest single-benchmark swing is BigCodeBench Instruct: 20.5% for Granite 3.0 2b Instruct and 30% for Mistral Large.

Side by side

Granite 3.0 2b Instruct and Mistral Large specifications
Granite 3.0 2b InstructMistral Large
ProviderIBMMistral AI
Noometry Index30.831.9
Released—2024-02-26
WeightsOpenOpen
Context window—131K
Max output—16K
Input $ / M tokens—$2
Output $ / M tokens—$6
Results tracked1351

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Mistral Large leads

Granite 3.0 2b Instruct: 28.3 (#316), Mistral Large: 34.3 (#240)

Coding benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
BigCodeBench Instruct20.5%30%
LMArena Coding10901277
SciCode—36.2%
LiveBench Coding—47.1%
BigCodeBench Complete—38.3%
ALE-Bench—264.7
HumanEval+—62.2%
MBPP+—59.5%

Agentic & Tool Use Not comparable

Granite 3.0 2b Instruct: —, Mistral Large: 28.6 (#89)

Agentic & Tool Use benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
Berkeley Function Calling Leaderboard—38.4%

Reasoning Granite 3.0 2b Instruct leads

Granite 3.0 2b Instruct: 20.5 (#235), Mistral Large: 15.8 (#310)

Reasoning benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Hard Prompts10731257
SimpleBench—22.5%
CritPt—0%
LiveBench Reasoning—43.5%
DTBench—65.1%
LiveBench Data Analysis—50.1%
LMCA—16.7%
Epoch Capabilities Index—128.52
ForecastBench—57.1
LiveBench—48.4%

Math Granite 3.0 2b Instruct leads

Granite 3.0 2b Instruct: 32.2 (#217), Mistral Large: 18.2 (#291)

Math benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Math11171262
OTIS Mock AIME 2024-2025—8.5%
Omni-MATH—28.1%
LiveBench Math—42.5%
MATH Level 5—50.3%
FrontierMath (Feb 2025 set)—0.3%

Knowledge Mistral Large leads

Granite 3.0 2b Instruct: 29.0 (#241), Mistral Large: 30.1 (#230)

Knowledge benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Expert10641232
GPQA Diamond—51.3%
MMLU-Pro—59.9%
Confabulations—21.4%
Vectara Hallucination Rate—4.5%
GPQA (HELM)—43.5%
MMLU—80%

Multilingual Mistral Large leads

Granite 3.0 2b Instruct: 27.0 (#278), Mistral Large: 40.0 (#219)

Multilingual benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Non-English10331237
LMArena Chinese10701240
LMArena Russian10451257
LMArena French—1325
LMArena German—1254
LMArena Japanese—1188
LMArena Korean—1202
LMArena Spanish—1268

Instruction Following Mistral Large leads

Granite 3.0 2b Instruct: 53.9 (#284), Mistral Large: 67.9 (#191)

Instruction Following benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Instruction Following10561249
LiveBench Instruction Following—67.9%
IFEval—87.7%

Long Context Mistral Large leads

Granite 3.0 2b Instruct: 32.5 (#268), Mistral Large: 38.3 (#199)

Long Context benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Longer Query10701261

Writing & Preference Mistral Large leads

Granite 3.0 2b Instruct: 29.6 (#292), Mistral Large: 40.7 (#242)

Writing & Preference benchmarks
BenchmarkGranite 3.0 2b InstructMistral Large
LMArena Text10801266
LMArena Creative Writing10461243
LMArena Multi-Turn10531260
Short-Story Creative Writing—69%
EQ-Bench Creative Writing—985
WildBench—80.1%
LiveBench Language—39.4%

Frequently asked questions

Is Granite 3.0 2b Instruct better than Mistral Large?

Mistral Large is the stronger model overall, scoring 31.9 to 30.8 on the Noometry Index.

Is Granite 3.0 2b Instruct or Mistral Large better for coding?

Mistral Large scores higher on coding benchmarks: 34.3 versus 28.3 in the Noometry coding category.

How many benchmarks do Granite 3.0 2b Instruct and Mistral Large share?

13 benchmarks have published results for both models. Granite 3.0 2b Instruct has 13 scored results on Noometry and Mistral Large has 51.

Related comparisons

Go deeper