Model comparison

Granite 3.1 8b Instruct vs Trinity Large Thinking

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 32.4 on the Noometry Index.

Last verified . 12 shared benchmarks.

Granite 3.1 8b Instruct IBM

32.4

Rank #258 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 12 benchmarks with published results for both. Granite 3.1 8b Instruct scores higher in 2 categories and Trinity Large Thinking in 6 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Trinity Large Thinking leads 53.8 to 35.5.

Side by side

Granite 3.1 8b Instruct and Trinity Large Thinking specifications
Granite 3.1 8b InstructTrinity Large Thinking
ProviderIBMArcee AI
Noometry Index32.438.6
Released—2026-04-01
WeightsOpenOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked1324

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Too close to call

Granite 3.1 8b Instruct: 34.5 (#233), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Coding11861381
LMArena WebDev—1238
SciCode—36.1%

Agentic & Tool Use Not comparable

Granite 3.1 8b Instruct: 24.1 (#120), Trinity Large Thinking: —

Agentic & Tool Use benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
Berkeley Function Calling Leaderboard27.1%—

Reasoning Granite 3.1 8b Instruct leads

Granite 3.1 8b Instruct: 22.1 (#207), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Hard Prompts11451350
NYT Connections (extended)—16.5%
CritPt—0.9%
Thematic Generalization—41.6%
Surface Evolver Bench—15.6%

Math Trinity Large Thinking leads

Granite 3.1 8b Instruct: 33.0 (#209), Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Math11521366

Knowledge Trinity Large Thinking leads

Granite 3.1 8b Instruct: 31.1 (#220), Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Expert11421360
Vectara Hallucination Rate—6.9%

Multilingual Trinity Large Thinking leads

Granite 3.1 8b Instruct: 30.9 (#260), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Non-English10991325
LMArena Chinese11451373
LMArena Russian10921337
LMArena French—1374
LMArena German—1356
LMArena Japanese—1311
LMArena Korean—1306
LMArena Spanish—1357

Instruction Following Trinity Large Thinking leads

Granite 3.1 8b Instruct: 58.6 (#259), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Instruction Following11311334

Long Context Trinity Large Thinking leads

Granite 3.1 8b Instruct: 35.2 (#241), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Longer Query11621355

Writing & Preference Trinity Large Thinking leads

Granite 3.1 8b Instruct: 35.5 (#266), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkGranite 3.1 8b InstructTrinity Large Thinking
LMArena Text11501340
LMArena Creative Writing11291320
LMArena Multi-Turn11081342

Frequently asked questions

Is Granite 3.1 8b Instruct better than Trinity Large Thinking?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 32.4 on the Noometry Index.

Is Granite 3.1 8b Instruct or Trinity Large Thinking better for coding?

They score almost the same on coding (34.5 vs 34.1); test both on your own repository before choosing.

How many benchmarks do Granite 3.1 8b Instruct and Trinity Large Thinking share?

12 benchmarks have published results for both models. Granite 3.1 8b Instruct has 13 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper