Model comparison

Gemini 4 Argon vs GPT-6.1 Sol

GPT-6.1 Sol is the stronger model overall, scoring 65.6 to 56.5 on the Noometry Index.

Last verified . 17 shared benchmarks.

Gemini 4 Argon Google

56.5

Rank #24 Confirmed

GPT-6.1 Sol OpenAI

65.6

Rank #6 Confirmed

Summary

  • They share 17 benchmarks with published results for both. Gemini 4 Argon scores higher in 5 categories and GPT-6.1 Sol in 5 categories; 10 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where GPT-6.1 Sol leads 81.9 to 44.2.
  • The biggest single-benchmark swing is APEX-Agents: 82.2% for Gemini 4 Argon and 60% for GPT-6.1 Sol.

Side by side

Gemini 4 Argon and GPT-6.1 Sol specifications
Gemini 4 ArgonGPT-6.1 Sol
ProviderGoogleOpenAI
Noometry Index56.565.6
Released2026-09-302026-09-29
WeightsProprietaryProprietary
Context window—1.05M
Max output—128K
Input $ / M tokens—$2
Output $ / M tokens—$10
Results tracked2134

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding GPT-6.1 Sol leads

Gemini 4 Argon: 62.0 (#9), GPT-6.1 Sol: 63.2 (#8)

Coding benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena WebDev16781755
SciCode61.8%55.8%
LMArena Coding15501487
DeepSWE—75.2%
FrontierCode—50.2%
FrontierSWE55%—

Agentic & Tool Use Gemini 4 Argon leads

Gemini 4 Argon: 49.2 (#8), GPT-6.1 Sol: 39.6 (#26)

Agentic & Tool Use benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
APEX-Agents82.2%60%
GDP.pdf—32%
Vending-Bench 213,718—

Reasoning GPT-6.1 Sol leads

Gemini 4 Argon: 44.2 (#47), GPT-6.1 Sol: 81.9 (#2)

Reasoning benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
CritPt27.1%31.7%
LMArena Hard Prompts15481466
ARC-AGI-2—94.2%
NYT Connections (extended)—95.5%
ARC-AGI-1—98.5%
Chess Puzzles—61%
EBR-Bench—54.3%
Mystery Game Puzzles—80%
Epoch Capabilities Index—166.09

Math GPT-6.1 Sol leads

Gemini 4 Argon: 73.9 (#17), GPT-6.1 Sol: 93.7 (#1)

Math benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
ProofBench99%99%
LMArena Math15361464
FrontierMath (Tiers 1-3)—93.7%
FrontierMath Tier 4—100%
OTIS Mock AIME 2024-2025—100%

Knowledge GPT-6.1 Sol leads

Gemini 4 Argon: 43.9 (#89), GPT-6.1 Sol: 71.8 (#4)

Knowledge benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena Expert15531502
GPQA Diamond—95.4%
SimpleQA Verified—73.9%

Multimodal GPT-6.1 Sol leads

Gemini 4 Argon: 46.5 (#14), GPT-6.1 Sol: 52.7 (#5)

Multimodal benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena Vision—1288
Blueprint-Bench 254.4%—
Furniture Assembly—80%

Multilingual Gemini 4 Argon leads

Gemini 4 Argon: 60.3 (#1), GPT-6.1 Sol: 54.3 (#46)

Multilingual benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena Non-English15231438
LMArena Chinese16101477
LMArena Russian15371455
LMArena Spanish1497—

Instruction Following Gemini 4 Argon leads

Gemini 4 Argon: 80.1 (#2), GPT-6.1 Sol: 77.0 (#29)

Instruction Following benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena Instruction Following15381468

Long Context Gemini 4 Argon leads

Gemini 4 Argon: 47.6 (#15), GPT-6.1 Sol: 44.9 (#54)

Long Context benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena Longer Query15491465

Writing & Preference Gemini 4 Argon leads

Gemini 4 Argon: 71.4 (#19), GPT-6.1 Sol: 63.6 (#63)

Writing & Preference benchmarks
BenchmarkGemini 4 ArgonGPT-6.1 Sol
LMArena Text15341447
LMArena Creative Writing15311432
LMArena Multi-Turn15571449

Frequently asked questions

Is Gemini 4 Argon better than GPT-6.1 Sol?

GPT-6.1 Sol is the stronger model overall, scoring 65.6 to 56.5 on the Noometry Index.

Is Gemini 4 Argon or GPT-6.1 Sol better for coding?

GPT-6.1 Sol scores higher on coding benchmarks: 63.2 versus 62.0 in the Noometry coding category.

How many benchmarks do Gemini 4 Argon and GPT-6.1 Sol share?

17 benchmarks have published results for both models. Gemini 4 Argon has 21 scored results on Noometry and GPT-6.1 Sol has 34.

Related comparisons

Go deeper