Model comparison

Gemini 4 Argon vs Inkling

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 44.1 on the Noometry Index.

Last verified . 19 shared benchmarks.

Gemini 4 Argon Google

56.5

Rank #24 Confirmed

Inkling Thinking Machines Lab

44.1

Rank #80 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Gemini 4 Argon scores higher in 8 categories and Inkling in 1 category; 9 gaps are clear of the uncertainty.
  • The widest gap is in math, where Gemini 4 Argon leads 73.9 to 31.3.
  • The biggest single-benchmark swing is ProofBench: 99% for Gemini 4 Argon and 0% for Inkling.
  • Inkling has downloadable open weights; the other is API-only.

Side by side

Gemini 4 Argon and Inkling specifications
Gemini 4 ArgonInkling
ProviderGoogleThinking Machines Lab
Noometry Index56.544.1
Released2026-09-302026-07-15
WeightsProprietaryOpen
Context window—66K
Max output—66K
Input $ / M tokens—$1.87
Output $ / M tokens—$4.68
Results tracked2141

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Gemini 4 Argon leads

Gemini 4 Argon: 62.0 (#9), Inkling: 34.5 (#234)

Coding benchmarks
BenchmarkGemini 4 ArgonInkling
LMArena WebDev16781413
FrontierSWE55%4.1%
SciCode61.8%47%
LMArena Coding15501464
FrontierCode—14%
WeirdML—32.3%
ALE-Bench—946

Agentic & Tool Use Gemini 4 Argon leads

Gemini 4 Argon: 49.2 (#8), Inkling: 29.6 (#85)

Agentic & Tool Use benchmarks
BenchmarkGemini 4 ArgonInkling
APEX-Agents82.2%33.8%
τ²-bench Banking—25%
Vending-Bench 213,718—

Reasoning Gemini 4 Argon leads

Gemini 4 Argon: 44.2 (#47), Inkling: 40.4 (#56)

Reasoning benchmarks
BenchmarkGemini 4 ArgonInkling
CritPt27.1%5.4%
LMArena Hard Prompts15481451
ARC-AGI-2—36.5%
SimpleBench—50%
ARC-AGI-1—79.5%
Chess Puzzles—21%
DTBench—87.5%
LMCA—37.6%
Epoch Capabilities Index—148.54

Math Gemini 4 Argon leads

Gemini 4 Argon: 73.9 (#17), Inkling: 31.3 (#225)

Math benchmarks
BenchmarkGemini 4 ArgonInkling
ProofBench99%0%
LMArena Math15361479
FrontierMath (Tiers 1-3)—33.3%
FrontierMath Tier 4—4.9%
OTIS Mock AIME 2024-2025—88.9%

Knowledge Inkling leads

Gemini 4 Argon: 43.9 (#89), Inkling: 55.1 (#49)

Knowledge benchmarks
BenchmarkGemini 4 ArgonInkling
LMArena Expert15531465
GPQA Diamond—88.3%
SimpleQA Verified—40.3%

Multimodal Not comparable

Gemini 4 Argon: 46.5 (#14), Inkling: —

Multimodal benchmarks
BenchmarkGemini 4 ArgonInkling
Blueprint-Bench 254.4%—

Multilingual Gemini 4 Argon leads

Gemini 4 Argon: 60.3 (#1), Inkling: 54.0 (#52)

Multilingual benchmarks
BenchmarkGemini 4 ArgonInkling
LMArena Non-English15231434
LMArena Chinese16101490
LMArena Russian15371429
LMArena Spanish14971448
LMArena French—1458
LMArena German—1446
LMArena Japanese—1429
LMArena Korean—1404

Instruction Following Gemini 4 Argon leads

Gemini 4 Argon: 80.1 (#2), Inkling: 75.1 (#71)

Instruction Following benchmarks
BenchmarkGemini 4 ArgonInkling
LMArena Instruction Following15381426

Long Context Gemini 4 Argon leads

Gemini 4 Argon: 47.6 (#15), Inkling: 43.8 (#86)

Long Context benchmarks
BenchmarkGemini 4 ArgonInkling
LMArena Longer Query15491434

Writing & Preference Gemini 4 Argon leads

Gemini 4 Argon: 71.4 (#19), Inkling: 65.2 (#51)

Writing & Preference benchmarks
BenchmarkGemini 4 ArgonInkling
LMArena Text15341441
LMArena Creative Writing15311387
LMArena Multi-Turn15571436
EQ-Bench Creative Writing—1611
EQ-Bench 4—1226

Frequently asked questions

Is Gemini 4 Argon better than Inkling?

Gemini 4 Argon is the stronger model overall, scoring 56.5 to 44.1 on the Noometry Index.

Is Gemini 4 Argon or Inkling better for coding?

Gemini 4 Argon scores higher on coding benchmarks: 62.0 versus 34.5 in the Noometry coding category.

How many benchmarks do Gemini 4 Argon and Inkling share?

19 benchmarks have published results for both models. Gemini 4 Argon has 21 scored results on Noometry and Inkling has 41.

Related comparisons

Go deeper