Model comparison

Chatgpt 4o Latest 20250326 vs Gemini 3.1 Flash Lite

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 40.8 on the Noometry Index.

Last verified . 19 shared benchmarks.

Chatgpt 4o Latest 20250326 OpenAI

43.8

Rank #82 Confirmed

Gemini 3.1 Flash Lite Google

40.8

Rank #144 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Chatgpt 4o Latest 20250326 scores higher in 7 categories and Gemini 3.1 Flash Lite in 2 categories; 6 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Chatgpt 4o Latest 20250326 leads 33.8 to 22.9.
  • The biggest single-benchmark swing is Kagi LLM Benchmark: 75% for Chatgpt 4o Latest 20250326 and 67.2% for Gemini 3.1 Flash Lite.

Side by side

Chatgpt 4o Latest 20250326 and Gemini 3.1 Flash Lite specifications
Chatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
ProviderOpenAIGoogle
Noometry Index43.840.8
Released—2026-03-03
WeightsProprietaryProprietary
Context window—1.05M
Max output—66K
Input $ / M tokens—$0.25
Output $ / M tokens—$1.50
Results tracked2138

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 41.6 (#122), Gemini 3.1 Flash Lite: 37.8 (#188)

Coding benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Coding14131400
LMArena WebDev—1256
SciCode—41.9%
WeirdML—52.2%
ALE-Bench—797.73

Agentic & Tool Use Not comparable

Chatgpt 4o Latest 20250326: —, Gemini 3.1 Flash Lite: 30.2 (#79)

Agentic & Tool Use benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
DeepResearch Bench—37.3%

Reasoning Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 33.8 (#71), Gemini 3.1 Flash Lite: 22.9 (#186)

Reasoning benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
Kagi LLM Benchmark75%67.2%
LMArena Hard Prompts14241407
NYT Connections (extended)—8.2%
CritPt—1.1%
Chess Puzzles—25%
EnigmaEval—3%
Thematic Generalization—63.3%
DTBench—76.8%
LMCA—35%
Epoch Capabilities Index—144.47
ForecastBench—54.4

Math Gemini 3.1 Flash Lite leads

Chatgpt 4o Latest 20250326: 38.6 (#134), Gemini 3.1 Flash Lite: 40.7 (#90)

Math benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Math14071428
FrontierMath (Tiers 1-3)—27.7%
OTIS Mock AIME 2024-2025—80%

Knowledge Gemini 3.1 Flash Lite leads

Chatgpt 4o Latest 20250326: 39.2 (#137), Gemini 3.1 Flash Lite: 41.9 (#104)

Knowledge benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Expert14011398
GPQA Diamond—81.8%
Humanity's Last Exam—8.6%
Confabulations16.6%—
Vectara Hallucination Rate—8.2%

Multimodal Too close to call

Chatgpt 4o Latest 20250326: 39.6 (#58), Gemini 3.1 Flash Lite: 39.4 (#60)

Multimodal benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Vision12431240

Multilingual Too close to call

Chatgpt 4o Latest 20250326: 52.9 (#76), Gemini 3.1 Flash Lite: 52.3 (#86)

Multilingual benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Non-English14191411
LMArena Chinese14571461
LMArena French14461424
LMArena German14231429
LMArena Japanese14051413
LMArena Korean13961392
LMArena Russian14291420
LMArena Spanish14341421

Instruction Following Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 74.0 (#107), Gemini 3.1 Flash Lite: 72.7 (#131)

Instruction Following benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Instruction Following14031377

Long Context Too close to call

Chatgpt 4o Latest 20250326: 43.1 (#107), Gemini 3.1 Flash Lite: 42.5 (#122)

Long Context benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Longer Query14131394

Writing & Preference Chatgpt 4o Latest 20250326 leads

Chatgpt 4o Latest 20250326: 62.6 (#72), Gemini 3.1 Flash Lite: 60.9 (#94)

Writing & Preference benchmarks
BenchmarkChatgpt 4o Latest 20250326Gemini 3.1 Flash Lite
LMArena Text14291416
LMArena Creative Writing14051401
LMArena Multi-Turn14541417
EQ-Bench Creative Writing1501—

Frequently asked questions

Is Chatgpt 4o Latest 20250326 better than Gemini 3.1 Flash Lite?

Chatgpt 4o Latest 20250326 is the stronger model overall, scoring 43.8 to 40.8 on the Noometry Index.

Is Chatgpt 4o Latest 20250326 or Gemini 3.1 Flash Lite better for coding?

Chatgpt 4o Latest 20250326 scores higher on coding benchmarks: 41.6 versus 37.8 in the Noometry coding category.

How many benchmarks do Chatgpt 4o Latest 20250326 and Gemini 3.1 Flash Lite share?

19 benchmarks have published results for both models. Chatgpt 4o Latest 20250326 has 21 scored results on Noometry and Gemini 3.1 Flash Lite has 38.

Related comparisons

Go deeper