Model comparison

Gemini 2.5 Flash vs Grok 4.20 Multi-Agent

Grok 4.20 Multi-Agent is the stronger model overall, scoring 46.2 to 39.3 on the Noometry Index. Gemini 2.5 Flash costs 1.8× less per token, which makes it the better buy when Grok 4.20 Multi-Agent's lead doesn't matter for your workload.

Last verified . 18 shared benchmarks.

Gemini 2.5 Flash Google

39.3

Rank #170 Confirmed

Grok 4.20 Multi-Agent xAI

46.2

Rank #65 Confirmed

Summary

  • They share 18 benchmarks with published results for both. Gemini 2.5 Flash scores higher in 4 categories and Grok 4.20 Multi-Agent in 5 categories; 7 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Grok 4.20 Multi-Agent leads 43.9 to 18.1.
  • Gemini 2.5 Flash is cheaper at $0.30 / $2.50 per million input/output tokens, against $1.25 / $2.50 for Grok 4.20 Multi-Agent.
  • Gemini 2.5 Flash accepts more context: 1.05M tokens versus 1M.

Side by side

Gemini 2.5 Flash and Grok 4.20 Multi-Agent specifications
Gemini 2.5 FlashGrok 4.20 Multi-Agent
ProviderGooglexAI
Noometry Index39.346.2
Released2025-04-172026-03-09
WeightsProprietaryProprietary
Context window1.05M1M
Max output66K30K
Input $ / M tokens$0.30$1.25
Output $ / M tokens$2.50$2.50
Results tracked5420

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Grok 4.20 Multi-Agent leads

Gemini 2.5 Flash: 35.8 (#220), Grok 4.20 Multi-Agent: 43.0 (#92)

Coding benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Coding14241457
SWE-bench Verified (bash only)28.7%—
Aider Polyglot55.1%—
WeirdML41.9%—
ALE-Bench661.88—

Agentic & Tool Use Not comparable

Gemini 2.5 Flash: 30.8 (#74), Grok 4.20 Multi-Agent: —

Agentic & Tool Use benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
Terminal-Bench17.1%—
Berkeley Function Calling Leaderboard56.2%—
TheAgentCompany41.1%—
BALROG33.5%—
LMArena Search—1204
Vending-Bench 2548.84—

Reasoning Grok 4.20 Multi-Agent leads

Gemini 2.5 Flash: 18.1 (#286), Grok 4.20 Multi-Agent: 43.9 (#48)

Reasoning benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Hard Prompts14221448
ARC-AGI-22.5%—
SimpleBench41.2%—
Kagi LLM Benchmark56.8%—
NYT Connections (extended)—89.6%
ARC-AGI-133.3%—
CritPt1.1%—
EnigmaEval2.7%—
DTBench76.5%—
LMCA27.5%—
Epoch Capabilities Index143.03—
ForecastBench60.6—

Math Too close to call

Gemini 2.5 Flash: 39.9 (#98), Grok 4.20 Multi-Agent: 39.4 (#104)

Math benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Math14151442
OTIS Mock AIME 2024-202573.1%—
Omni-MATH38.5%—
FrontierMath (Feb 2025 set)4.8%—
FrontierMath Tier 4 (v1)4.2%—

Knowledge Grok 4.20 Multi-Agent leads

Gemini 2.5 Flash: 36.4 (#168), Grok 4.20 Multi-Agent: 40.4 (#119)

Knowledge benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Expert14261445
Humanity's Last Exam12.1%—
MMLU-Pro63.9%—
Confabulations16.8%—
Vectara Hallucination Rate7.8%—
GPQA (HELM)39%—

Multimodal Gemini 2.5 Flash leads

Gemini 2.5 Flash: 41.8 (#32), Grok 4.20 Multi-Agent: 40.5 (#48)

Multimodal benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Vision12531259
GeoBench76%—
VPCT46.2%—
SpatialViz-Bench36.9%—

Multilingual Grok 4.20 Multi-Agent leads

Gemini 2.5 Flash: 52.3 (#88), Grok 4.20 Multi-Agent: 54.4 (#43)

Multilingual benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Non-English14091440
LMArena Chinese14501475
LMArena French14331466
LMArena German14181456
LMArena Japanese14051405
LMArena Korean13851416
LMArena Russian14151457
LMArena Spanish14211447

Instruction Following Too close to call

Gemini 2.5 Flash: 75.7 (#54), Grok 4.20 Multi-Agent: 74.8 (#84)

Instruction Following benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Instruction Following14051420
IFEval89.8%—

Long Context Gemini 2.5 Flash leads

Gemini 2.5 Flash: 47.5 (#17), Grok 4.20 Multi-Agent: 43.7 (#88)

Long Context benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Longer Query14191431
Fiction.LiveBench77.8%—

Writing & Preference Grok 4.20 Multi-Agent leads

Gemini 2.5 Flash: 53.8 (#157), Grok 4.20 Multi-Agent: 64.0 (#59)

Writing & Preference benchmarks
BenchmarkGemini 2.5 FlashGrok 4.20 Multi-Agent
LMArena Text14171450
LMArena Creative Writing14001436
LMArena Multi-Turn14081452
Short-Story Creative Writing76.5%—
EQ-Bench Creative Writing1137—
WildBench81.7%—

Frequently asked questions

Is Gemini 2.5 Flash better than Grok 4.20 Multi-Agent?

Grok 4.20 Multi-Agent is the stronger model overall, scoring 46.2 to 39.3 on the Noometry Index. Gemini 2.5 Flash costs 1.8× less per token, which makes it the better buy when Grok 4.20 Multi-Agent's lead doesn't matter for your workload.

Which is cheaper, Gemini 2.5 Flash or Grok 4.20 Multi-Agent?

Gemini 2.5 Flash is cheaper. It lists at $0.30 per million input tokens and $2.50 per million output tokens; Grok 4.20 Multi-Agent lists at $1.25 and $2.50.

Is Gemini 2.5 Flash or Grok 4.20 Multi-Agent better for coding?

Grok 4.20 Multi-Agent scores higher on coding benchmarks: 43.0 versus 35.8 in the Noometry coding category.

Which has the bigger context window?

Gemini 2.5 Flash does, with 1.05M tokens against 1M.

How many benchmarks do Gemini 2.5 Flash and Grok 4.20 Multi-Agent share?

18 benchmarks have published results for both models. Gemini 2.5 Flash has 54 scored results on Noometry and Grok 4.20 Multi-Agent has 20.

Related comparisons

Go deeper