Model comparison

Granite 3.1 2b Instruct vs Mistral Large

Granite 3.1 2b Instruct is the stronger model overall, scoring 33.2 to 31.9 on the Noometry Index.

Last verified . 12 shared benchmarks.

Granite 3.1 2b Instruct IBM

33.2

Rank #247 Confirmed

Mistral Large Mistral AI

31.9

Rank #263 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Granite 3.1 2b Instruct scores higher in 3 categories and Mistral Large in 5 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in math, where Granite 3.1 2b Instruct leads 33.1 to 18.2.

Side by side

Granite 3.1 2b Instruct and Mistral Large specifications
Granite 3.1 2b InstructMistral Large
ProviderIBMMistral AI
Noometry Index33.231.9
Released—2024-02-26
WeightsOpenOpen
Context window—131K
Max output—16K
Input $ / M tokens—$2
Output $ / M tokens—$6
Results tracked1251

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Granite 3.1 2b Instruct: 33.4 (#257), Mistral Large: 34.3 (#240)

Coding benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Coding11491277
SciCode—36.2%
BigCodeBench Instruct—30%
LiveBench Coding—47.1%
BigCodeBench Complete—38.3%
ALE-Bench—264.7
HumanEval+—62.2%
MBPP+—59.5%

Agentic & Tool Use Not comparable

Granite 3.1 2b Instruct: —, Mistral Large: 28.6 (#89)

Agentic & Tool Use benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
Berkeley Function Calling Leaderboard—38.4%

Reasoning Granite 3.1 2b Instruct leads

Granite 3.1 2b Instruct: 22.0 (#209), Mistral Large: 15.8 (#310)

Reasoning benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Hard Prompts11381257
SimpleBench—22.5%
CritPt—0%
LiveBench Reasoning—43.5%
DTBench—65.1%
LiveBench Data Analysis—50.1%
LMCA—16.7%
Epoch Capabilities Index—128.52
ForecastBench—57.1
LiveBench—48.4%

Math Granite 3.1 2b Instruct leads

Granite 3.1 2b Instruct: 33.1 (#206), Mistral Large: 18.2 (#291)

Math benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Math11591262
OTIS Mock AIME 2024-2025—8.5%
Omni-MATH—28.1%
LiveBench Math—42.5%
MATH Level 5—50.3%
FrontierMath (Feb 2025 set)—0.3%

Knowledge Too close to call

Granite 3.1 2b Instruct: 30.8 (#224), Mistral Large: 30.1 (#230)

Knowledge benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Expert11311232
GPQA Diamond—51.3%
MMLU-Pro—59.9%
Confabulations—21.4%
Vectara Hallucination Rate—4.5%
GPQA (HELM)—43.5%
MMLU—80%

Multilingual Mistral Large leads

Granite 3.1 2b Instruct: 29.1 (#269), Mistral Large: 40.0 (#219)

Multilingual benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Non-English10681237
LMArena Chinese11391240
LMArena Russian10631257
LMArena French—1325
LMArena German—1254
LMArena Japanese—1188
LMArena Korean—1202
LMArena Spanish—1268

Instruction Following Mistral Large leads

Granite 3.1 2b Instruct: 57.7 (#264), Mistral Large: 67.9 (#191)

Instruction Following benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Instruction Following11161249
LiveBench Instruction Following—67.9%
IFEval—87.7%

Long Context Mistral Large leads

Granite 3.1 2b Instruct: 35.0 (#244), Mistral Large: 38.3 (#199)

Long Context benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Longer Query11551261

Writing & Preference Mistral Large leads

Granite 3.1 2b Instruct: 34.1 (#274), Mistral Large: 40.7 (#242)

Writing & Preference benchmarks
BenchmarkGranite 3.1 2b InstructMistral Large
LMArena Text11271266
LMArena Creative Writing11161243
LMArena Multi-Turn10991260
Short-Story Creative Writing—69%
EQ-Bench Creative Writing—985
WildBench—80.1%
LiveBench Language—39.4%

Frequently asked questions

Is Granite 3.1 2b Instruct better than Mistral Large?

Granite 3.1 2b Instruct is the stronger model overall, scoring 33.2 to 31.9 on the Noometry Index.

Is Granite 3.1 2b Instruct or Mistral Large better for coding?

They score almost the same on coding (33.4 vs 34.3); test both on your own repository before choosing.

How many benchmarks do Granite 3.1 2b Instruct and Mistral Large share?

12 benchmarks have published results for both models. Granite 3.1 2b Instruct has 12 scored results on Noometry and Mistral Large has 51.

Related comparisons

Go deeper