Model comparison

Gemini 4 Argon vs Qwen2-72B

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 30.0 on the Noometry Index.

Last verified . 13 shared benchmarks.

Gemini 4 Argon Google

56.5

Rank #24 Confirmed

Qwen2-72B Alibaba (Qwen)

30.0

Rank #300 Confirmed

Summary

  • They share 13 benchmarks with published results for both. Gemini 4 Argon scores higher in 9 categories and Qwen2-72B in 0 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 4 Argon leads 73.9 to 30.2.
  • Qwen2-72B has downloadable open weights; the other is API-only.

Side by side

Gemini 4 Argon and Qwen2-72B specifications
Gemini 4 ArgonQwen2-72B
ProviderGoogleAlibaba (Qwen)
Noometry Index56.530.0
Released2026-09-302024-06-07
WeightsProprietaryOpen
Context window——
Max output——
Input $ / M tokens——
Output $ / M tokens——
Results tracked2126

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 4 Argon leads

Gemini 4 Argon: 62.0 (#9), Qwen2-72B: 29.1 (#310)

Coding benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Coding15501196
LMArena WebDev1678—
FrontierSWE55%—
SciCode61.8%—
WeirdML—11.3%
BigCodeBench Instruct—38.5%
BigCodeBench Complete—54%

Agentic & Tool Use Gemini 4 Argon leads

Gemini 4 Argon: 49.2 (#8), Qwen2-72B: 17.0 (#146)

Agentic & Tool Use benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
APEX-Agents82.2%—
TheAgentCompany—1.1%
METR Time Horizons—29.9%
Vending-Bench 213,718—

Reasoning Gemini 4 Argon leads

Gemini 4 Argon: 44.2 (#47), Qwen2-72B: 23.2 (#181)

Reasoning benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Hard Prompts15481191
CritPt27.1%—
Epoch Capabilities Index—125.28

Math Gemini 4 Argon leads

Gemini 4 Argon: 73.9 (#17), Qwen2-72B: 30.2 (#236)

Math benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Math15361235
ProofBench99%—
MATH Level 5—39.1%

Knowledge Gemini 4 Argon leads

Gemini 4 Argon: 43.9 (#89), Qwen2-72B: 21.2 (#275)

Knowledge benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Expert15531171
GPQA Diamond—40.8%
MMLU—82.4%

Multimodal Not comparable

Gemini 4 Argon: 46.5 (#14), Qwen2-72B: —

Multimodal benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
Blueprint-Bench 254.4%—

Multilingual Gemini 4 Argon leads

Gemini 4 Argon: 60.3 (#1), Qwen2-72B: 35.9 (#244)

Multilingual benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Non-English15231176
LMArena Chinese16101240
LMArena Russian15371169
LMArena Spanish14971169
LMArena French—1170
LMArena German—1151
LMArena Japanese—1111
LMArena Korean—1083

Instruction Following Gemini 4 Argon leads

Gemini 4 Argon: 80.1 (#2), Qwen2-72B: 61.7 (#241)

Instruction Following benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Instruction Following15381181

Long Context Gemini 4 Argon leads

Gemini 4 Argon: 47.6 (#15), Qwen2-72B: 36.1 (#235)

Long Context benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Longer Query15491192

Writing & Preference Gemini 4 Argon leads

Gemini 4 Argon: 71.4 (#19), Qwen2-72B: 40.8 (#241)

Writing & Preference benchmarks
BenchmarkGemini 4 ArgonQwen2-72B
LMArena Text15341203
LMArena Creative Writing15311181
LMArena Multi-Turn15571196

Frequently asked questions

Is Gemini 4 Argon better than Qwen2-72B?

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 30.0 on the Noometry Index.

Is Gemini 4 Argon or Qwen2-72B better for coding?

Gemini 4 Argon scores higher on coding benchmarks: 62.0 versus 29.1 in the Noometry coding category.

How many benchmarks do Gemini 4 Argon and Qwen2-72B share?

13 benchmarks have published results for both models. Gemini 4 Argon has 21 scored results on Noometry and Qwen2-72B has 26.

Related comparisons

Go deeper