xAI, proprietary

Grok-3 mini

Grok-3 mini by xAI ranks 141st of 354 ranked models on the Noometry Index as of October 2026, with a score of 41.2. Its strongest category is instruction following, where it ranks 9th.

Last verified

Specifications

Noometry rank
#141 of 354
Index score
41.2
Evidence
Confirmed 35 results
Provider
xAI
Released
April 9, 2025
Weights
Proprietary
Reasoning
Unknown
Context window
—
Max output
—
Input price
Not listed
Output price
Not listed
Blended price
Not listed
Output speed
10 tokens/s Kagi
Value
Not ranked
Knowledge cutoff
Unknown

Category scores

Each category score combines every public result we have in that category.

Grok-3 mini category scores
  1. Coding 40.8
  2. Reasoning 13.6
  3. Math 42.1
  4. Knowledge 46.4
  5. Multilingual 48.1
  6. Instruction Following 78.5
  7. Long Context 41.0
  8. Writing & Preference 52.5
Grok-3 mini category ranks
CategoryScoreRankResults
Coding40.8#1313
Reasoning13.6#3344
Math42.1#854
Knowledge46.4#815
Multilingual48.1#1451
Instruction Following78.5#92
Long Context41.0#1472
Writing & Preference52.5#1695

Strengths and weaknesses

Categories where Grok-3 mini places highest and lowest among the models ranked in each, with its score against that category's median.

Strongest categories

Grok-3 mini: strongest categories
CategoryScorevs medianRank
Instruction Following78.5+7.3#9 of 305, top 3%
Knowledge46.4+9.1#81 of 314, top 26%
Math42.1+5.5#85 of 327, top 26%

Weakest categories

Grok-3 mini: weakest categories
CategoryScorevs medianRank
Reasoning13.6−10.0#334 of 350, top 96%
Writing & Preference52.5−1.3#169 of 312, top 55%
Long Context41.0+0.1#147 of 296, top 50%

Closest competitors

The models ranked just above and below Grok-3 mini. When scores are this close, price and speed are often the better way to choose.

Models ranked closest to Grok-3 mini
ModelRankScoreBlended $/MSpeed
GLM-4.6V#13741.3$0.45—Compare
MiMo-V2-Flash#13841.3$0.18—Compare
Hunyuan Turbos 20250226#13941.3——Compare
Kimi K2 (Jul 2025)#14041.2$1201Compare
Claude Opus 4.1#14241.0$30—Compare
o1#14340.9$26.25—Compare
Gemini 3.1 Flash Lite#14440.8$0.5610Compare
Claude Sonnet 4#14540.8$631Compare

Sponsored placements are available on pages like this one. Advertise on Noometry

Benchmark results

Every published result we track, with its source. Bold rows are the ones used for ranking; where several exist we prefer independent runs over self-reported numbers.

Coding

Grok-3 mini Coding benchmark results
BenchmarkScorePositionSettingSourceDate
Aider Polyglot49.3%#23 of 44, top 53%highEpoch AI
Aider Polyglot34.7%lowEpoch AI
WeirdML42.6%#69 of 119, top 58%highEpoch AI
WeirdML42.6%#69 of 119, top 58%highEpoch AI
LMArena Coding1367LMArena2026-10-08
LMArena Coding1379#151 of 294, top 52%highLMArena2026-10-08

Reasoning

Grok-3 mini Reasoning benchmark results
BenchmarkScorePositionSettingSourceDate
ARC-AGI-20.4%#74 of 83, top 90%lowEpoch AI
Kagi LLM Benchmark61.3%#41 of 99, top 42%Kagi LLM Benchmark
ARC-AGI-116.5%#70 of 83, top 85%lowEpoch AI
ARC-AGI-116.5%#70 of 83, top 85%lowEpoch AI
LMArena Hard Prompts1364LMArena2026-10-08
LMArena Hard Prompts1375#141 of 297, top 48%highLMArena2026-10-08
Epoch Capabilities Index140.35#106 of 213, top 50%Epoch AI2025-06-24

Math

Grok-3 mini Math benchmark results
BenchmarkScorePositionSettingSourceDate
OTIS Mock AIME 2024-202577.8%#83 of 173, top 48%highEpoch AI2025-04-10
OTIS Mock AIME 2024-202562.2%lowEpoch AI2025-04-10
Omni-MATH31.8%#36 of 57, top 64%HELM Capabilities
LMArena Math1372LMArena2026-10-08
LMArena Math1386#142 of 285, top 50%highLMArena2026-10-08
MATH Level 588.1%highEpoch AI2025-04-10
MATH Level 590.9%#14 of 79, top 18%lowEpoch AI2025-04-10
FrontierMath (Feb 2025 set)5.9%#44 of 68, top 65%highEpoch AI2025-04-10
FrontierMath (Feb 2025 set)2.8%lowEpoch AI2025-04-10

Knowledge

Grok-3 mini Knowledge benchmark results
BenchmarkScorePositionSettingSourceDate
GPQA Diamond75.5%highEpoch AI2025-05-26
GPQA Diamond76.3%#90 of 186, top 49%lowEpoch AI2025-04-10
MMLU-Pro79.9%#16 of 58, top 28%HELM Capabilities
Confabulations (lower is better)10.8%#3 of 51, top 6%highLech Mazur benchmarks
GPQA (HELM)67.5%#14 of 57, top 25%HELM Capabilities
LMArena Expert1366LMArena2026-10-08
LMArena Expert1395#129 of 273, top 48%highLMArena2026-10-08

Multilingual

Grok-3 mini Multilingual benchmark results
BenchmarkScorePositionSettingSourceDate
LMArena Non-English1349LMArena2026-10-08
LMArena Non-English1352#145 of 297, top 49%highLMArena2026-10-08
LMArena Chinese1377LMArena2026-10-08
LMArena Chinese1387#144 of 285, top 51%highLMArena2026-10-08
LMArena French1357#143 of 223, top 65%LMArena2026-10-08
LMArena French1347highLMArena2026-10-08
LMArena German1347LMArena2026-10-08
LMArena German1349#132 of 231, top 58%highLMArena2026-10-08
LMArena Japanese1342#103 of 211, top 49%LMArena2026-10-08
LMArena Japanese1317highLMArena2026-10-08
LMArena Korean1306LMArena2026-10-08
LMArena Korean1335#112 of 213, top 53%highLMArena2026-10-08
LMArena Russian1353#145 of 283, top 52%LMArena2026-10-08
LMArena Russian1351highLMArena2026-10-08
LMArena Spanish1381#126 of 226, top 56%LMArena2026-10-08
LMArena Spanish1359highLMArena2026-10-08

Instruction Following

Grok-3 mini Instruction Following benchmark results
BenchmarkScorePositionSettingSourceDate
IFEval95.1%Best of 57HELM Capabilities
LMArena Instruction Following1346LMArena2026-10-08
LMArena Instruction Following1357#140 of 298, top 47%highLMArena2026-10-08

Long Context

Grok-3 mini Long Context benchmark results
BenchmarkScorePositionSettingSourceDate
Fiction.LiveBench66.7%#20 of 47, top 43%mediumEpoch AI
LMArena Longer Query1357LMArena2026-10-08
LMArena Longer Query1372#138 of 291, top 48%highLMArena2026-10-08

Writing & Preference

Grok-3 mini Writing & Preference benchmark results
BenchmarkScorePositionSettingSourceDate
LMArena Text1364LMArena2026-10-08
LMArena Text1370#144 of 297, top 49%highLMArena2026-10-08
LMArena Creative Writing1342#137 of 295, top 47%LMArena2026-10-08
LMArena Creative Writing1335highLMArena2026-10-08
Short-Story Creative Writing73.5%#28 of 39, top 72%lowEpoch AI
WildBench65.1%#57 of 57, top 100%HELM Capabilities
LMArena Multi-Turn1351LMArena2026-10-08
LMArena Multi-Turn1355#151 of 295, top 52%highLMArena2026-10-08

Compare Grok-3 mini

Other xAI models

Frequently asked questions

How good is Grok-3 mini?

Grok-3 mini by xAI ranks 141st of 354 ranked models on the Noometry Index as of October 2026, with a score of 41.2. Its strongest category is instruction following, where it ranks 9th.

Is Grok-3 mini open source?

No. Grok-3 mini is proprietary and available only through xAI's API and partner platforms.

How fast is Grok-3 mini?

Grok-3 mini generated about 10 output tokens per second in the Kagi LLM Benchmark's timed runs. Speed varies by provider, load and reasoning effort.

What are Grok-3 mini's strengths and weaknesses?

Relative to other ranked models, Grok-3 mini places best in instruction following, knowledge, math and lowest in reasoning, writing & preference, long context.

What is Grok-3 mini best at?

Its best category is instruction following, where it ranks 9th on Noometry.