Model comparison

Granite 3.0 2b Instruct vs Trinity Large Thinking

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 30.8 on the Noometry Index.

Last verified . 12 shared benchmarks.

Granite 3.0 2b Instruct IBM

30.8

Rank #286 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Granite 3.0 2b Instruct scores higher in 1 category and Trinity Large Thinking in 7 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Trinity Large Thinking leads 53.8 to 29.6.

Side by side

Granite 3.0 2b Instruct and Trinity Large Thinking specifications
Granite 3.0 2b InstructTrinity Large Thinking
ProviderIBMArcee AI
Noometry Index30.838.6
Released—2026-04-01
WeightsOpenOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked1324

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Trinity Large Thinking leads

Granite 3.0 2b Instruct: 28.3 (#316), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Coding10901381
LMArena WebDev—1238
SciCode—36.1%
BigCodeBench Instruct20.5%—

Reasoning Granite 3.0 2b Instruct leads

Granite 3.0 2b Instruct: 20.5 (#235), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Hard Prompts10731350
NYT Connections (extended)—16.5%
CritPt—0.9%
Thematic Generalization—41.6%
Surface Evolver Bench—15.6%

Math Trinity Large Thinking leads

Granite 3.0 2b Instruct: 32.2 (#217), Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Math11171366

Knowledge Trinity Large Thinking leads

Granite 3.0 2b Instruct: 29.0 (#241), Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Expert10641360
Vectara Hallucination Rate—6.9%

Multilingual Trinity Large Thinking leads

Granite 3.0 2b Instruct: 27.0 (#278), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Non-English10331325
LMArena Chinese10701373
LMArena Russian10451337
LMArena French—1374
LMArena German—1356
LMArena Japanese—1311
LMArena Korean—1306
LMArena Spanish—1357

Instruction Following Trinity Large Thinking leads

Granite 3.0 2b Instruct: 53.9 (#284), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Instruction Following10561334

Long Context Trinity Large Thinking leads

Granite 3.0 2b Instruct: 32.5 (#268), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Longer Query10701355

Writing & Preference Trinity Large Thinking leads

Granite 3.0 2b Instruct: 29.6 (#292), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkGranite 3.0 2b InstructTrinity Large Thinking
LMArena Text10801340
LMArena Creative Writing10461320
LMArena Multi-Turn10531342

Frequently asked questions

Is Granite 3.0 2b Instruct better than Trinity Large Thinking?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 30.8 on the Noometry Index.

Is Granite 3.0 2b Instruct or Trinity Large Thinking better for coding?

Trinity Large Thinking scores higher on coding benchmarks: 34.1 versus 28.3 in the Noometry coding category.

How many benchmarks do Granite 3.0 2b Instruct and Trinity Large Thinking share?

12 benchmarks have published results for both models. Granite 3.0 2b Instruct has 13 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper