Model comparison

Gemma 1.1 2b IT vs Trinity Large Thinking

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 29.3 on the Noometry Index.

Last verified . 14 shared benchmarks.

Gemma 1.1 2b IT Google

29.3

Rank #313 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 14 benchmarks with published results for both. Gemma 1.1 2b IT scores higher in 1 category and Trinity Large Thinking in 7 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Trinity Large Thinking leads 53.8 to 25.1.

Side by side

Gemma 1.1 2b IT and Trinity Large Thinking specifications
Gemma 1.1 2b ITTrinity Large Thinking
ProviderGoogleArcee AI
Noometry Index29.338.6
Released—2026-04-01
WeightsOpenOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked1624

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Trinity Large Thinking leads

Gemma 1.1 2b IT: 30.1 (#299), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Coding10341381
LMArena WebDev—1238
SciCode—36.1%
HumanEval+17.7%—
MBPP+23.3%—

Reasoning Gemma 1.1 2b IT leads

Gemma 1.1 2b IT: 19.1 (#270), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Hard Prompts10051350
NYT Connections (extended)—16.5%
CritPt—0.9%
Thematic Generalization—41.6%
Surface Evolver Bench—15.6%

Math Trinity Large Thinking leads

Gemma 1.1 2b IT: 30.8 (#232), Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Math10471366

Knowledge Trinity Large Thinking leads

Gemma 1.1 2b IT: 26.5 (#258), Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Expert9701360
Vectara Hallucination Rate—6.9%

Multilingual Trinity Large Thinking leads

Gemma 1.1 2b IT: 24.6 (#289), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Non-English9881325
LMArena Chinese10121373
LMArena German9441356
LMArena Korean8991306
LMArena Russian9901337
LMArena French—1374
LMArena Japanese—1311
LMArena Spanish—1357

Instruction Following Trinity Large Thinking leads

Gemma 1.1 2b IT: 49.9 (#299), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Instruction Following9921334

Long Context Trinity Large Thinking leads

Gemma 1.1 2b IT: 30.6 (#286), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Longer Query10031355

Writing & Preference Trinity Large Thinking leads

Gemma 1.1 2b IT: 25.1 (#306), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkGemma 1.1 2b ITTrinity Large Thinking
LMArena Text10221340
LMArena Creative Writing9981320
LMArena Multi-Turn9591342

Frequently asked questions

Is Gemma 1.1 2b IT better than Trinity Large Thinking?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 29.3 on the Noometry Index.

Is Gemma 1.1 2b IT or Trinity Large Thinking better for coding?

Trinity Large Thinking scores higher on coding benchmarks: 34.1 versus 30.1 in the Noometry coding category.

How many benchmarks do Gemma 1.1 2b IT and Trinity Large Thinking share?

14 benchmarks have published results for both models. Gemma 1.1 2b IT has 16 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper