Model comparison

Gemma 3n E4b IT vs Trinity Large Thinking

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 37.3 on the Noometry Index.

Last verified . 17 shared benchmarks.

Gemma 3n E4b IT Google

37.3

Rank #206 Confirmed

Trinity Large Thinking Arcee AI

38.6

Rank #185 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Gemma 3n E4b IT scores higher in 2 categories and Trinity Large Thinking in 6 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in knowledge, where Trinity Large Thinking leads 40.9 to 34.2.

Side by side

Gemma 3n E4b IT and Trinity Large Thinking specifications
Gemma 3n E4b ITTrinity Large Thinking
ProviderGoogleArcee AI
Noometry Index37.338.6
Released—2026-04-01
WeightsOpenOpen
Context window—262K
Max output—80K
Input $ / M tokens—$0.25
Output $ / M tokens—$0.80
Results tracked1824

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemma 3n E4b IT leads

Gemma 3n E4b IT: 37.0 (#198), Trinity Large Thinking: 34.1 (#244)

Coding benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Coding12681381
LMArena WebDev—1238
SciCode—36.1%

Reasoning Gemma 3n E4b IT leads

Gemma 3n E4b IT: 19.9 (#247), Trinity Large Thinking: 16.9 (#298)

Reasoning benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Hard Prompts12841350
Kagi LLM Benchmark31.5%—
NYT Connections (extended)—16.5%
CritPt—0.9%
Thematic Generalization—41.6%
Surface Evolver Bench—15.6%

Math Trinity Large Thinking leads

Gemma 3n E4b IT: 35.1 (#188), Trinity Large Thinking: 37.6 (#149)

Math benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Math12511366

Knowledge Trinity Large Thinking leads

Gemma 3n E4b IT: 34.2 (#198), Trinity Large Thinking: 40.9 (#113)

Knowledge benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Expert12461360
Vectara Hallucination Rate—6.9%

Multilingual Trinity Large Thinking leads

Gemma 3n E4b IT: 43.4 (#183), Trinity Large Thinking: 46.2 (#160)

Multilingual benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Non-English12851325
LMArena Chinese13091373
LMArena French13301374
LMArena German13111356
LMArena Japanese12721311
LMArena Korean12591306
LMArena Russian12881337
LMArena Spanish13051357

Instruction Following Trinity Large Thinking leads

Gemma 3n E4b IT: 66.1 (#210), Trinity Large Thinking: 70.5 (#162)

Instruction Following benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Instruction Following12551334

Long Context Trinity Large Thinking leads

Gemma 3n E4b IT: 38.7 (#191), Trinity Large Thinking: 41.3 (#144)

Long Context benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Longer Query12761355

Writing & Preference Trinity Large Thinking leads

Gemma 3n E4b IT: 50.1 (#186), Trinity Large Thinking: 53.8 (#158)

Writing & Preference benchmarks
BenchmarkGemma 3n E4b ITTrinity Large Thinking
LMArena Text13061340
LMArena Creative Writing12871320
LMArena Multi-Turn12761342

Frequently asked questions

Is Gemma 3n E4b IT better than Trinity Large Thinking?

Trinity Large Thinking is the stronger model overall, scoring 38.6 to 37.3 on the Noometry Index.

Is Gemma 3n E4b IT or Trinity Large Thinking better for coding?

Gemma 3n E4b IT scores higher on coding benchmarks: 37.0 versus 34.1 in the Noometry coding category.

How many benchmarks do Gemma 3n E4b IT and Trinity Large Thinking share?

17 benchmarks have published results for both models. Gemma 3n E4b IT has 18 scored results on Noometry and Trinity Large Thinking has 24.

Related comparisons

Go deeper