Knowledge benchmark

ARC (AI2) Challenge leaderboard

As of October 2026, DeepSeek-V3 has the highest published ARC (AI2) Challenge score on Noometry at 95.3%, out of 39 models with results.

Last verified

About ARC (AI2) Challenge

Grade-school science multiple-choice questions that retrieval alone cannot answer.

Category
Knowledge
Introduced
2018
Format
Multiple choice
Unit
Percent (random guessing ≈ 25%)
Official site
allenai.org

Top 15 models

Top models on ARC (AI2) Challenge
  1. DeepSeek-V3 95.3%
  2. Llama 3.1-405B 95.3%
  3. Qwen2.5 72B Instruct 94.5%
  4. DeepSeek-V2 (MoE-236B, May 2024) 92.2%
  5. phi-3-medium 14B 91.6%
  6. Phi 3 Small 8k Instruct 90.7%
  7. GPT-3.5-turbo 87.4%
  8. Mixtral 8x7B 87.3%
  9. Claude Instant 86.3%
  10. Phi 3 Mini 4k Instruct 84.9%
  11. Qwen-14B 84.4%
  12. Llama 3-8B 82.8%
  13. Mistral 7B 78.6%
  14. Gemma 7B 78.3%
  15. Llama 2-70B 78.3%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

ARC (AI2) Challenge results by model
#ModelProviderScoreSettingSourceDate
1DeepSeek-V3 DeepSeek95.3%Epoch AI
2Llama 3.1-405B Meta95.3%Epoch AI
3Qwen2.5 72B Instruct Alibaba (Qwen)94.5%Epoch AI
4DeepSeek-V2 (MoE-236B, May 2024) DeepSeek92.2%Epoch AI
5phi-3-medium 14B Microsoft91.6%Epoch AI
6Phi 3 Small 8k Instruct Microsoft90.7%Epoch AI
7GPT-3.5-turbo OpenAI87.4%Epoch AI
8Mixtral 8x7B Mistral AI87.3%Epoch AI
9Claude Instant Anthropic86.3%Epoch AI
10Phi 3 Mini 4k Instruct Microsoft84.9%Epoch AI
11Qwen-14B Alibaba (Qwen)84.4%Epoch AI
12Llama 3-8B Meta82.8%Epoch AI
13Mistral 7B Mistral AI78.6%Epoch AI
14Gemma 7B Google78.3%Epoch AI
15Llama 2-70B Meta78.3%Epoch AI
16Phi-2 Microsoft75.9%Epoch AI
17Qwen-7B Alibaba (Qwen)75.3%Epoch AI
18Qwen2.5-Coder-32B Alibaba (Qwen)70.5%Epoch AI
19Falcon-180B Technology Innovation Institute67.8%Epoch AI
20Deepseek Coder v2 DeepSeek64.3%Epoch AI
21Falcon-40B Technology Innovation Institute61.9%Epoch AI
22Qwen2.5-Coder (1.5B) Alibaba (Qwen)60.9%Epoch AI
23Llama 2-13B Meta60.3%Epoch AI
24Nemotron-4 15B NVIDIA55.5%Epoch AI
25INTELLECT-1 Hugging Face54.5%Epoch AI
26Llama 2-34B Meta54.5%Epoch AI
27Llama 13b Meta52.7%Epoch AI
28Yi 6B 01.AI50.3%Epoch AI
29Falcon-7B Technology Innovation Institute47.9%Epoch AI
30StarCoder 2 15B NVIDIA47.2%Epoch AI
31Llama 2-7B Meta45.9%Epoch AI
32Phi-1.5 Microsoft44.4%5Epoch AI
33DeepSeek Coder 33B DeepSeek42.2%Epoch AI
34Gemma 2B Google42.1%Epoch AI
35Dolly 2.0-12b Databricks39.6%Epoch AI
36StarCoder 2 7B NVIDIA38.7%Epoch AI
37DeepSeek Coder 6.7B DeepSeek36.4%Epoch AI
38StarCoder 2 3B NVIDIA34.2%Epoch AI
39DeepSeek Coder 1.3B DeepSeek25.4%Epoch AI

Compare the leaders

Other knowledge benchmarks

Frequently asked questions

What does ARC (AI2) Challenge measure?

Grade-school science multiple-choice questions that retrieval alone cannot answer.

Which model has the highest ARC (AI2) Challenge score?

As of October 2026, DeepSeek-V3 has the highest published ARC (AI2) Challenge score on Noometry at 95.3%, out of 39 models with results.

What is the best open-weight model on ARC (AI2) Challenge?

DeepSeek-V3 has the highest ARC (AI2) Challenge accuracy among open-weight models at 95.3%, ranking 1 of 39 overall.