Long Context benchmark

Fiction.LiveBench leaderboard

As of October 2026, GPT-5 has the highest published Fiction.LiveBench score on Noometry at 97.2%, out of 47 models with results.

Last verified

About Fiction.LiveBench

Comprehension questions about long fiction stories that require tracking plot and characters across the text. Scores here are at 16k tokens.

Category
Long Context
Introduced
2025
Format
Long-context QA
Unit
Percent (random guessing ≈ 0%)
Official site
fiction.live

Top 15 models

Top models on Fiction.LiveBench
  1. GPT-5 97.2%
  2. o3-pro 97.2%
  3. Grok 4 94.4%
  4. Grok 4 Fast 94.4%
  5. Gemini 2.5 Pro 91.7%
  6. o3 88.9%
  7. Kimi K2.5 86.1%
  8. Claude 3.7 Sonnet 83.3%
  9. DeepSeek-V3.2-Exp 83.3%
  10. o1 83.3%
  11. QwQ-32B 83.3%
  12. Gemini 2.5 Flash 77.8%
  13. o4-mini 77.8%
  14. DeepSeek-R1 75%
  15. Qwen3 235B-A22B 75%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

Fiction.LiveBench results by model
#ModelProviderScoreSettingSourceDate
1GPT-5 OpenAI97.2%mediumEpoch AI
2o3-pro OpenAI97.2%mediumEpoch AI
3Grok 4 xAI94.4%Epoch AI
4Grok 4 Fast xAI94.4%Epoch AI
5Gemini 2.5 Pro Google91.7%Epoch AI
6o3 OpenAI88.9%mediumEpoch AI
7Kimi K2.5 Moonshot AI86.1%Epoch AI
8Claude 3.7 Sonnet Anthropic83.3%8KEpoch AI
9DeepSeek-V3.2-Exp DeepSeek83.3%highEpoch AI
10o1 OpenAI83.3%mediumEpoch AI
11QwQ-32B Alibaba (Qwen)83.3%Epoch AI
12Gemini 2.5 Flash Google77.8%Epoch AI
13o4-mini OpenAI77.8%mediumEpoch AI
14DeepSeek-R1 DeepSeek75%Epoch AI
15Qwen3 235B-A22B Alibaba (Qwen)75%Epoch AI
16Qwen3 32B Alibaba (Qwen)74.2%Epoch AI
17GPT-5 Mini OpenAI69.4%mediumEpoch AI
18MiniMax M1 MiniMax69.4%Epoch AI
19GPT-4o OpenAI66.7%Epoch AI
20Grok-3 mini xAI66.7%mediumEpoch AI
21Kimi K2 (Jul 2025) Moonshot AI66.7%Epoch AI
22Qwen Max Alibaba (Qwen)66.7%Epoch AI
23Qwen3 Max Alibaba (Qwen)66.7%Epoch AI
24GPT-4.1 OpenAI63.9%Epoch AI
25GPT-4.5 OpenAI63.9%Epoch AI
26Qwen3 14B Alibaba (Qwen)62.5%Epoch AI
27Qwen3 8B Alibaba (Qwen)62.1%Epoch AI
28Claude Opus 4 Anthropic61.1%Epoch AI
29Gemini 2.0 Flash (Feb 2025) Google61.1%Epoch AI
30GLM-4.5 Z.ai (Zhipu)58.3%Epoch AI
31Grok 3 xAI58.3%Epoch AI
32Qwen3-Next 80B-A3B Instruct Alibaba (Qwen)55.6%Epoch AI
33DeepSeek-V3.1 DeepSeek52.8%Epoch AI
34DeepSeek-V3 DeepSeek50%Epoch AI
35o3-mini OpenAI50%mediumEpoch AI
36Gemini 2.5 Flash-Lite Google47.2%Epoch AI
37Claude Sonnet 4 Anthropic46.9%Epoch AI
38Llama 4 Maverick Meta46.2%Epoch AI
39GPT-4.1 mini OpenAI44.4%Epoch AI
40GPT-5 Nano OpenAI44.4%mediumEpoch AI
41gpt-oss-120b OpenAI44.4%highEpoch AI
42Gemini 2.0 Pro Google41.7%Epoch AI
43Qwen3-30B-A3B Alibaba (Qwen)40.6%Epoch AI
44Llama 4 Scout Meta36%Epoch AI
45Gemma 3 27B Google33.3%Epoch AI
46Llama-3.3-70B-Instruct Meta33.3%Epoch AI
47GPT-4.1 nano OpenAI25%Epoch AI

Compare the leaders

Other long context benchmarks

Frequently asked questions

What does Fiction.LiveBench measure?

Comprehension questions about long fiction stories that require tracking plot and characters across the text. Scores here are at 16k tokens.

Which model has the highest Fiction.LiveBench score?

As of October 2026, GPT-5 has the highest published Fiction.LiveBench score on Noometry at 97.2%, out of 47 models with results.

What is the best open-weight model on Fiction.LiveBench?

Kimi K2.5 has the highest Fiction.LiveBench accuracy among open-weight models at 86.1%, ranking 7 of 47 overall.