Reasoning benchmark

Kagi LLM Benchmark leaderboard

As of October 2026, Claude Fable 5 has the highest published Kagi LLM Benchmark score on Noometry at 91.4%, out of 99 models with results.

Last verified

About Kagi LLM Benchmark

A private, frequently rotated set of reasoning, coding and instruction-following tasks from Kagi, designed so models cannot be trained on it.

Category
Reasoning
Introduced
2024
Format
Mixed private tasks
Unit
Percent (random guessing ≈ 0%)
Official site
help.kagi.com

Top 15 models

Top models on Kagi LLM Benchmark
  1. Claude Fable 5 91.4%
  2. Claude Opus 4.8 88.8%
  3. GPT-5.5 88.8%
  4. Claude Opus 4.6 83.6%
  5. Grok 4.5 83.5%
  6. Claude Opus 4.7 80.7%
  7. Claude Opus 4.5 80.2%
  8. Gemini 3 Pro 80.1%
  9. Kimi K2.5 78.5%
  10. GPT-5 Pro 76.8%
  11. Chatgpt 4o Latest 20250326 75%
  12. GLM-5 75%
  13. Grok 4.20 (Non-Reasoning) 75%
  14. Claude Opus 4 74.3%
  15. Qwen3.5 397B-A17B 73.7%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

Kagi LLM Benchmark results by model
#ModelProviderScoreSettingSourceDate
1Claude Fable 5 Anthropic91.4%Kagi LLM Benchmark
2Claude Opus 4.8 Anthropic88.8%Kagi LLM Benchmark
3GPT-5.5 OpenAI88.8%Kagi LLM Benchmark
4Claude Opus 4.6 Anthropic83.6%Kagi LLM Benchmark
5Grok 4.5 xAI83.5%Kagi LLM Benchmark
6Claude Opus 4.7 Anthropic80.7%Kagi LLM Benchmark
7Claude Opus 4.5 Anthropic80.2%Kagi LLM Benchmark
8Gemini 3 Pro Google80.1%Kagi LLM Benchmark
9Kimi K2.5 Moonshot AI78.5%Kagi LLM Benchmark
10GPT-5 Pro OpenAI76.8%Kagi LLM Benchmark
11Chatgpt 4o Latest 20250326 OpenAI75%Kagi LLM Benchmark
12GLM-5 Z.ai (Zhipu)75%Kagi LLM Benchmark
13Grok 4.20 (Non-Reasoning) xAI75%Kagi LLM Benchmark
14Claude Opus 4 Anthropic74.3%Kagi LLM Benchmark
15Qwen3.5 397B-A17B Alibaba (Qwen)73.7%Kagi LLM Benchmark
16Grok 4 xAI73.6%Kagi LLM Benchmark
17GPT-5.2 OpenAI73.3%Kagi LLM Benchmark
18Claude Sonnet 4 Anthropic73%Kagi LLM Benchmark
19GPT-5 OpenAI72.7%Kagi LLM Benchmark
20Qwen3 Max Alibaba (Qwen)72.5%Kagi LLM Benchmark
21o3-pro OpenAI72.1%Kagi LLM Benchmark
22Gemini 2.5 Pro Google70.3%Kagi LLM Benchmark
23GPT-5-Codex OpenAI70.3%Kagi LLM Benchmark
24GPT-5 Mini OpenAI70.3%Kagi LLM Benchmark
25DeepSeek-R1 DeepSeek69.4%Kagi LLM Benchmark
26Qwen3 235B-A22B Alibaba (Qwen)69.4%Kagi LLM Benchmark
27o3 OpenAI67.6%Kagi LLM Benchmark
28o4-mini OpenAI67.6%Kagi LLM Benchmark
29Gemini 3.1 Flash Lite Google67.2%Kagi LLM Benchmark
30GPT-5.6 Sol OpenAI67%Kagi LLM Benchmark
31Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)66.7%Kagi LLM Benchmark
32Grok 4 Fast xAI66.1%Kagi LLM Benchmark
33Kimi K2 (Jul 2025) Moonshot AI64.4%Kagi LLM Benchmark
34GPT-5.4 OpenAI63.8%Kagi LLM Benchmark
35Gemma 4 31B IT Google63.5%Kagi LLM Benchmark
36Qwen Plus Alibaba (Qwen)63.3%Kagi LLM Benchmark
37GLM-5.2 Z.ai (Zhipu)62.6%Kagi LLM Benchmark
38Step 3 StepFun62.3%Kagi LLM Benchmark
39GPT-5 Nano OpenAI62.2%Kagi LLM Benchmark
40Grok 3 xAI61.3%Kagi LLM Benchmark
41Grok-3 mini xAI61.3%Kagi LLM Benchmark
42GLM-4.5V Z.ai (Zhipu)59.8%Kagi LLM Benchmark
43gpt-oss-120b OpenAI58.6%Kagi LLM Benchmark
44Claude Sonnet 4.5 Anthropic57.9%Kagi LLM Benchmark
45GLM-4.5 Z.ai (Zhipu)57.9%Kagi LLM Benchmark
46MiniMax-M2 MiniMax57.8%Kagi LLM Benchmark
47DeepSeek-V3.1-Terminus DeepSeek57.4%Kagi LLM Benchmark
48Gemini 2.5 Flash Google56.8%Kagi LLM Benchmark
49Llama 4 Maverick Meta55.9%Kagi LLM Benchmark
50Hermes 4 405B Nous Research55.8%Kagi LLM Benchmark
51MiniMax-M2.5 MiniMax55.2%Kagi LLM Benchmark
52Qwen3-30B-A3B Alibaba (Qwen)54.9%Kagi LLM Benchmark
53Qwen3 32B Alibaba (Qwen)54.9%Kagi LLM Benchmark
54DeepSeek V4 Pro DeepSeek53.5%Kagi LLM Benchmark
55DeepSeek-V3.1 DeepSeek53.2%Kagi LLM Benchmark
56gpt-oss-20b OpenAI53.2%Kagi LLM Benchmark
57DeepSeek-R1-Distill-Llama-70B DeepSeek52.3%Kagi LLM Benchmark
58DeepSeek-V3 DeepSeek52.3%Kagi LLM Benchmark
59GPT-4.1 OpenAI52.3%Kagi LLM Benchmark
60DeepSeek-V3.2-Exp DeepSeek52.2%Kagi LLM Benchmark
61DeepSeek V4 Flash DeepSeek52.2%Kagi LLM Benchmark
62GPT-5.6 Terra OpenAI51.3%Kagi LLM Benchmark
63Mistral Large 3 Mistral AI50.9%Kagi LLM Benchmark
64Mistral Medium Mistral AI50%Kagi LLM Benchmark
65Qwen3-Coder 480B-A35B Instruct Alibaba (Qwen)49.5%Kagi LLM Benchmark
66GPT-5.6 Luna OpenAI49.1%Kagi LLM Benchmark
67Qwen3 14B Alibaba (Qwen)49.1%Kagi LLM Benchmark
68GPT-4.1 mini OpenAI48.6%Kagi LLM Benchmark
69GLM-4.6 Z.ai (Zhipu)47.4%Kagi LLM Benchmark
70Llama 3.1-405B Meta45%Kagi LLM Benchmark
71Nova Premier 1.0 Amazon44.8%Kagi LLM Benchmark
72Longcat Flash Chat Meituan43.9%Kagi LLM Benchmark
73GLM-4.5-Air Z.ai (Zhipu)43%Kagi LLM Benchmark
74MiniMax-01 MiniMax42.5%Kagi LLM Benchmark
75Mistral Medium 3.5 Mistral AI41.4%Kagi LLM Benchmark
76Gemini 2.5 Flash-Lite Google40.5%Kagi LLM Benchmark
77Mistral Small 4 Mistral AI40.5%Kagi LLM Benchmark
78Gemma 3 27B Google40.4%Kagi LLM Benchmark
79Mistral Small 3.2 Mistral AI40.4%Kagi LLM Benchmark
80GPT-5.4 nano OpenAI39.7%Kagi LLM Benchmark
81GPT-5.4 mini OpenAI37.9%Kagi LLM Benchmark
82Gemini 2.0 Flash (Feb 2025) Google37.8%Kagi LLM Benchmark
83Mistral Small Mistral AI37.8%Kagi LLM Benchmark
84Devstral Medium Mistral AI37.7%Kagi LLM Benchmark
85Devstral Small 2505 Mistral AI37.7%Kagi LLM Benchmark
86Llama 4 Scout Meta36.9%Kagi LLM Benchmark
87Qwen2.5-VL 72B Instruct Alibaba (Qwen)36%Kagi LLM Benchmark
88Llama 3-70B Meta35.1%Kagi LLM Benchmark
89Claude 3 Haiku Anthropic34.2%Kagi LLM Benchmark
90GPT-4.1 nano OpenAI33.3%Kagi LLM Benchmark
91Codestral Mistral AI32.5%Kagi LLM Benchmark
92Gemma 3n E4b IT Google31.5%Kagi LLM Benchmark
93Command A Cohere28.8%Kagi LLM Benchmark
94GPT-4o mini OpenAI28.8%Kagi LLM Benchmark
95Jamba Large AI21 Labs26.1%Kagi LLM Benchmark
96Gemma 3 4B Google25.2%Kagi LLM Benchmark
97Mercury Inception21.6%Kagi LLM Benchmark
98Magistral Medium Mistral AI16.2%Kagi LLM Benchmark
99Magistral Small Mistral AI6.3%Kagi LLM Benchmark

Compare the leaders

Other reasoning benchmarks

Frequently asked questions

What does Kagi LLM Benchmark measure?

A private, frequently rotated set of reasoning, coding and instruction-following tasks from Kagi, designed so models cannot be trained on it.

Which model has the highest Kagi LLM Benchmark score?

As of October 2026, Claude Fable 5 has the highest published Kagi LLM Benchmark score on Noometry at 91.4%, out of 99 models with results.

What is the best open-weight model on Kagi LLM Benchmark?

Kimi K2.5 has the highest Kagi LLM Benchmark accuracy among open-weight models at 78.5%, ranking 9 of 99 overall.