Instruction Following benchmark

IFEval leaderboard

As of October 2026, Grok-3 mini has the highest published IFEval score on Noometry at 95.1%, out of 57 models with results.

Last verified

About IFEval

Prompts with checkable instructions such as word counts, required keywords or output format, scored by strict automatic checks. HELM Capabilities run.

Category
Instruction Following
Introduced
2023
Size
541 prompts
Format
Verifiable constraints
Unit
Percent (random guessing ≈ 0%)
Official site
crfm.stanford.edu

Top 15 models

Top models on IFEval
  1. Grok-3 mini 95.1%
  2. Grok 4 94.9%
  3. GPT-5.1 93.5%
  4. GPT-5 Nano 93.2%
  5. o4-mini 92.8%
  6. GPT-5 Mini 92.7%
  7. Claude Opus 4 91.8%
  8. Llama 4 Maverick 90.8%
  9. GPT-4.1 mini 90.4%
  10. Gemini 2.5 Flash 89.8%
  11. Granite 4.0 H Small 89%
  12. Grok 3 88.4%
  13. Gemini 3 Pro 87.7%
  14. Mistral Large 87.7%
  15. GPT-5 87.5%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

IFEval results by model
#ModelProviderScoreSettingSourceDate
1Grok-3 mini xAI95.1%HELM Capabilities
2Grok 4 xAI94.9%HELM Capabilities
3GPT-5.1 OpenAI93.5%HELM Capabilities
4GPT-5 Nano OpenAI93.2%HELM Capabilities
5o4-mini OpenAI92.8%HELM Capabilities
6GPT-5 Mini OpenAI92.7%HELM Capabilities
7Claude Opus 4 Anthropic91.8%HELM Capabilities
8Llama 4 Maverick Meta90.8%HELM Capabilities
9GPT-4.1 mini OpenAI90.4%HELM Capabilities
10Gemini 2.5 Flash Google89.8%HELM Capabilities
11Granite 4.0 H Small IBM89%HELM Capabilities
12Grok 3 xAI88.4%HELM Capabilities
13Gemini 3 Pro Google87.7%HELM Capabilities
14Mistral Large Mistral AI87.7%HELM Capabilities
15GPT-5 OpenAI87.5%HELM Capabilities
16o3 OpenAI86.9%HELM Capabilities
17Claude 3.5 Sonnet Anthropic85.5%HELM Capabilities
18Kimi K2 (Jul 2025) Moonshot AI85%HELM Capabilities
19Claude Sonnet 4.5 Anthropic85%HELM Capabilities
20Granite 4.0 Micro IBM84.9%HELM Capabilities
21GPT-4.1 nano OpenAI84.3%HELM Capabilities
22Gemini 2.0 Flash (Feb 2025) Google84.1%HELM Capabilities
23Claude Sonnet 4 Anthropic84%HELM Capabilities
24Gemini 2.5 Pro Google84%HELM Capabilities
25GPT-4.1 OpenAI83.8%HELM Capabilities
26Gemini 1.5 Pro (May 2024) Google83.7%HELM Capabilities
27gpt-oss-120b OpenAI83.6%HELM Capabilities
28Qwen3 235B-A22B Alibaba (Qwen)83.5%HELM Capabilities
29Claude 3.7 Sonnet Anthropic83.4%HELM Capabilities
30DeepSeek-V3 DeepSeek83.2%HELM Capabilities
31Gemini 1.5 Flash (May 2024) Google83.1%HELM Capabilities
32Gemini 2.0 Flash-Lite Google82.4%HELM Capabilities
33Llama 3.1-70B Meta82.1%HELM Capabilities
34Llama 4 Scout Meta81.8%HELM Capabilities
35GPT-4o OpenAI81.7%HELM Capabilities
36Amazon Nova Pro Amazon81.5%HELM Capabilities
37GLM-4.5-Air Z.ai (Zhipu)81.2%HELM Capabilities
38Llama 3.1-405B Meta81.1%HELM Capabilities
39Gemini 2.5 Flash-Lite Google81%HELM Capabilities
40Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)81%HELM Capabilities
41Qwen2.5 72B Instruct Alibaba (Qwen)80.6%HELM Capabilities
42Nova Premier 1.0 Amazon80.3%HELM Capabilities
43Claude Haiku 4.5 Anthropic80.1%HELM Capabilities
44Claude 3.5 Haiku Anthropic79.2%HELM Capabilities
45DeepSeek-R1 DeepSeek78.4%HELM Capabilities
46GPT-4o mini OpenAI78.2%HELM Capabilities
47Olmo 2 0325 32b Instruct Allen Institute for AI (Ai2)78%HELM Capabilities
48Amazon Nova Lite Amazon77.6%HELM Capabilities
49Amazon Nova Micro Amazon76%HELM Capabilities
50Mistral Small 3.1 Mistral AI75%HELM Capabilities
51Llama 3.1-8B Meta74.3%HELM Capabilities
52Qwen2.5 7B Instruct Alibaba (Qwen)74.1%HELM Capabilities
53gpt-oss-20b OpenAI73.2%HELM Capabilities
54OLMo 2 Furious 13B Allen Institute for AI (Ai2)73%HELM Capabilities
55Mixtral 8x22B Mistral AI72.4%HELM Capabilities
56Mixtral 8x7B Mistral AI57.5%HELM Capabilities
57Mistral Mistral AI56.8%HELM Capabilities

Compare the leaders

Other instruction following benchmarks

Frequently asked questions

What does IFEval measure?

Prompts with checkable instructions such as word counts, required keywords or output format, scored by strict automatic checks. HELM Capabilities run.

Which model has the highest IFEval score?

As of October 2026, Grok-3 mini has the highest published IFEval score on Noometry at 95.1%, out of 57 models with results.

What is the best open-weight model on IFEval?

Llama 4 Maverick has the highest IFEval accuracy among open-weight models at 90.8%, ranking 8 of 57 overall.