Model comparison

Claude 3 Sonnet vs Grok 4.1 Fast

Grok 4.1 Fast is the stronger model overall, scoring 41.4 to 29.0 on the Noometry Index.

Last verified . 19 shared benchmarks.

Claude 3 Sonnet Anthropic

29.0

Rank #319 Confirmed

Grok 4.1 Fast xAI

41.4

Rank #136 Confirmed

Summary

  • They share 19 benchmarks with published results for both. Claude 3 Sonnet scores higher in 0 categories and Grok 4.1 Fast in 9 categories; 9 gaps are clear of the uncertainty.
  • The widest gap is in reasoning, where Grok 4.1 Fast leads 43.4 to 20.5.
  • The biggest single-benchmark swing is DTBench: 53.6% for Claude 3 Sonnet and 87.7% for Grok 4.1 Fast.

Side by side

Claude 3 Sonnet and Grok 4.1 Fast specifications
Claude 3 SonnetGrok 4.1 Fast
ProviderAnthropicxAI
Noometry Index29.041.4
Released2024-02-292025-06-27
WeightsProprietaryProprietary
Context window—128K
Max output—30K
Input $ / M tokens—$0.20
Output $ / M tokens—$0.50
Results tracked3032

Sponsored placements are available on pages like this one. Advertise on Noometry

Category by category

Coding Grok 4.1 Fast leads

Claude 3 Sonnet: 29.6 (#302), Grok 4.1 Fast: 34.1 (#245)

Coding benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Coding12231411
LMArena WebDev—1242
WeirdML10.2%—
BigCodeBench Instruct42.7%—
BigCodeBench Complete53.8%—
ALE-Bench—394.93
HumanEval+64%—
MBPP+69.3%—

Agentic & Tool Use Not comparable

Claude 3 Sonnet: —, Grok 4.1 Fast: 36.3 (#39)

Agentic & Tool Use benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
Berkeley Function Calling Leaderboard—69.6%
τ²-bench Banking—13.1%
LMArena Search—1171
Vending-Bench 2—1,107

Reasoning Grok 4.1 Fast leads

Claude 3 Sonnet: 20.5 (#237), Grok 4.1 Fast: 43.4 (#49)

Reasoning benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Hard Prompts11971407
DTBench53.6%87.7%
SimpleBench—56%
NYT Connections (extended)—87.4%
Epoch Capabilities Index120.7—
ForecastBench—61
WinoGrande75.1%—

Math Grok 4.1 Fast leads

Claude 3 Sonnet: 10.7 (#310), Grok 4.1 Fast: 31.9 (#221)

Math benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Math12131408
MathArena Final-Answer Competitions—60.9%
OTIS Mock AIME 2024-20252.5%—
ProofBench—4%
MATH Level 518.2%—

Knowledge Grok 4.1 Fast leads

Claude 3 Sonnet: 21.1 (#276), Grok 4.1 Fast: 33.1 (#207)

Knowledge benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Expert11731399
GPQA Diamond40.6%—
Vectara Hallucination Rate—17.8%
MMLU75.9%—

Multimodal Grok 4.1 Fast leads

Claude 3 Sonnet: 25.2 (#125), Grok 4.1 Fast: 37.0 (#76)

Multimodal benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Vision9841201

Multilingual Grok 4.1 Fast leads

Claude 3 Sonnet: 37.8 (#234), Grok 4.1 Fast: 51.0 (#114)

Multilingual benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Non-English12051391
LMArena Chinese11891441
LMArena French12291415
LMArena German12041404
LMArena Japanese11311349
LMArena Korean11281361
LMArena Russian12271387
LMArena Spanish12041413

Instruction Following Grok 4.1 Fast leads

Claude 3 Sonnet: 62.8 (#235), Grok 4.1 Fast: 72.7 (#133)

Instruction Following benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Instruction Following11991376

Long Context Grok 4.1 Fast leads

Claude 3 Sonnet: 36.7 (#228), Grok 4.1 Fast: 42.4 (#126)

Long Context benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Longer Query12111390

Writing & Preference Grok 4.1 Fast leads

Claude 3 Sonnet: 42.1 (#238), Grok 4.1 Fast: 57.2 (#131)

Writing & Preference benchmarks
BenchmarkClaude 3 SonnetGrok 4.1 Fast
LMArena Text12181408
LMArena Creative Writing11861394
LMArena Multi-Turn12271389
EQ-Bench Creative Writing—1327

Frequently asked questions

Is Claude 3 Sonnet better than Grok 4.1 Fast?

Grok 4.1 Fast is the stronger model overall, scoring 41.4 to 29.0 on the Noometry Index.

Is Claude 3 Sonnet or Grok 4.1 Fast better for coding?

Grok 4.1 Fast scores higher on coding benchmarks: 34.1 versus 29.6 in the Noometry coding category.

How many benchmarks do Claude 3 Sonnet and Grok 4.1 Fast share?

19 benchmarks have published results for both models. Claude 3 Sonnet has 30 scored results on Noometry and Grok 4.1 Fast has 32.

Related comparisons

Go deeper