Model comparison

Chatgpt 4o Latest 20250326 vs Gemma 7B

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 30.0 on the Noometry Index.

Last verified . 13 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Gemma 7B Google

30.0

Rank #299 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 8 categories and Gemma 7B in 0 categories; 8 gaps are clear of the uncertainty.
  • The widest gap is in writing & preference, where Chatgpt 4o Latest 20250326 leads 62.6 to 27.1.
  • Gemma 7B has downloadable open weights; the other is API-only.

Side by side

Chatgpt 4o Latest 20250326 and Gemma 7B specifications
Chatgpt 4o Latest 20250326Gemma 7B
ProviderOpenAIGoogle
Noometry Index43.830.0
Released—2024-02-21
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2127

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Gemma 7B: 30.5 (#294)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Coding14131048
HumanEval+—28.7%
MBPP+—43.4%

Reasoning Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Gemma 7B: 19.9 (#249)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Hard Prompts14241042
Kagi LLM Benchmark75%—
Adversarial NLI—48.7%
BIG-Bench Hard—55.1%
Epoch Capabilities Index—111.99
HellaSwag—82.2%
PIQA—81.2%
WinoGrande—79%

Math Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Gemma 7B: 31.2 (#228)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Math14071066
GSM8K—46.4%

Knowledge Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Gemma 7B: 27.3 (#252)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Expert14011001
Confabulations16.6%—
ARC (AI2) Challenge—78.3%
BoolQ—83.2%
MMLU—66.1%
OpenBookQA—78.6%
TriviaQA—72.3%

Multimodal Not comparable

Chatgpt 4o Latest 20250326: 39.6 (#58), Gemma 7B: —

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Vision1243—

Multilingual Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 52.9 (#76), Gemma 7B: 25.1 (#287)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Non-English1419999
LMArena Chinese14571035
LMArena French14461025
LMArena Russian1429993
LMArena German1423—
LMArena Japanese1405—
LMArena Korean1396—
LMArena Spanish1434—

Instruction Following Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Gemma 7B: 51.5 (#295)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Instruction Following14031017

Long Context Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 43.1 (#107), Gemma 7B: 31.1 (#282)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Longer Query14131022

Writing & Preference Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Gemma 7B: 27.1 (#302)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemma 7B
LMArena Text14291056
LMArena Creative Writing14051024
LMArena Multi-Turn1454963
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Gemma 7B?

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 30.0 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Gemma 7B better for coding?

Chatgpt 4o Latest 20250326 scores higher on coding benchmarks: 41.6 versus 30.5 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Gemma 7B share?

13 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Gemma 7B has 27.

Related comparisons

Go deeper