Writing & Preference benchmark

LiveBench Language leaderboard

As of October 2026, GPT-5.1 has the highest published LiveBench Language score on Noometry at 80.2%, out of 39 models with results.

Last verified

About LiveBench Language

LiveBench language tasks such as typo fixing and plot unscrambling.

Category
Writing & Preference
Introduced
2024
Unit
Percent (random guessing ≈ 0%)
Official site
livebench.ai

Top 15 models

Top models on LiveBench Language
  1. GPT-5.1 80.2%
  2. Gemini 2.5 Pro 67.8%
  3. o1 65.4%
  4. GPT-4.5 61.5%
  5. Claude 3.7 Sonnet 59.9%
  6. Qwen2.5-Max 56.3%
  7. Claude 3.5 Sonnet 53.8%
  8. QwQ-32B 51.4%
  9. Gemini 2.0 Flash (Feb 2025) 51.3%
  10. o3-mini 50.7%
  11. Claude 3 Opus 50.4%
  12. DeepSeek-V3 49.1%
  13. DeepSeek-R1 48.5%
  14. GPT-4o 47.6%
  15. Grok-2 (Dec 2024) 45.6%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

LiveBench Language results by model
#ModelProviderScoreSettingSourceDate
1GPT-5.1 OpenAI80.2%highEpoch AI
2Gemini 2.5 Pro Google67.8%Epoch AI
3o1 OpenAI65.4%highEpoch AI
4GPT-4.5 OpenAI61.5%Epoch AI
5Claude 3.7 Sonnet Anthropic59.9%Epoch AI
6Qwen2.5-Max Alibaba (Qwen)56.3%Epoch AI
7Claude 3.5 Sonnet Anthropic53.8%Epoch AI
8QwQ-32B Alibaba (Qwen)51.4%Epoch AI
9Gemini 2.0 Flash (Feb 2025) Google51.3%Epoch AI
10o3-mini OpenAI50.7%highEpoch AI
11Claude 3 Opus Anthropic50.4%Epoch AI
12DeepSeek-V3 DeepSeek49.1%Epoch AI
13DeepSeek-R1 DeepSeek48.5%Epoch AI
14GPT-4o OpenAI47.6%Epoch AI
15Grok-2 (Dec 2024) xAI45.6%Epoch AI
16Gemini 2.0 Pro Google44.9%Epoch AI
17Sonar Perplexity44.1%Epoch AI
18o1-mini OpenAI40.9%mediumEpoch AI
19Mistral Large Mistral AI39.4%Epoch AI
20Llama-3.3-70B-Instruct Meta39.2%Epoch AI
21Amazon Nova Pro Amazon37%Epoch AI
22Claude 3.5 Haiku Anthropic35.4%Epoch AI
23Gemma 3 27B Google34.6%Epoch AI
24Gemini 2.0 Flash-Lite Google34.3%Epoch AI
25Gemma 2 27B Google32.6%Epoch AI
26Mistral Small Mistral AI30.5%Epoch AI
27Command R+ Cohere29.7%Epoch AI
28GPT-4o mini OpenAI28.6%Epoch AI
29DeepSeek-R1-Distill-Qwen-32B DeepSeek26.8%Epoch AI
30Amazon Nova Lite Amazon25.9%Epoch AI
31Phi-4 Microsoft25.6%Epoch AI
32Gemma 2 9B Google25.5%Epoch AI
33DeepSeek-R1-Distill-Llama-70B DeepSeek23.8%Epoch AI
34Qwen2.5-Coder-32B Alibaba (Qwen)23.3%Epoch AI
35Command R Cohere16.7%Epoch AI
36Amazon Nova Micro Amazon15.8%Epoch AI
37Phi 3 Small 8k Instruct Microsoft12.9%Epoch AI
38OLMo 2 Furious 13B Allen Institute for AI (Ai2)11.2%Epoch AI
39Phi 3 Mini 4k Instruct Microsoft9.2%Epoch AI

Compare the leaders

Other writing & preference benchmarks

Frequently asked questions

What does LiveBench Language measure?

LiveBench language tasks such as typo fixing and plot unscrambling.

Which model has the highest LiveBench Language score?

As of October 2026, GPT-5.1 has the highest published LiveBench Language score on Noometry at 80.2%, out of 39 models with results.

What is the best open-weight model on LiveBench Language?

QwQ-32B has the highest LiveBench Language accuracy among open-weight models at 51.4%, ranking 8 of 39 overall.