Reasoning benchmark

NYT Connections (extended) leaderboard

As of October 2026, GPT-6 Astra has the highest published NYT Connections (extended) score on Noometry at 98.1%, out of 91 models with results.

Last verified

About NYT Connections (extended)

New York Times Connections puzzles made harder with extra distractor words: sort 16 or more words into groups of four by a hidden theme.

Category
Reasoning
Introduced
2024
Size
940 puzzles
Format
Word grouping
Unit
Percent (random guessing ≈ 0%)
Official site
github.com

Top 15 models

Top models on NYT Connections (extended)
  1. GPT-6 Astra 98.1%
  2. Gemini 3.1 Pro Preview 97.4%
  3. Gemini 3.8 Flash 97.4%
  4. GPT-5.5 96.2%
  5. GPT-6.1 Sol 95.5%
  6. Gemini 3 Pro 94.4%
  7. Claude Opus 5 94.3%
  8. Gemini 3.7 Flash 94%
  9. GPT-5.6 Sol 93.8%
  10. Kimi K3 93.6%
  11. Claude Fable 5 92.7%
  12. Gemini 3.5 Flash 92.6%
  13. Claude Opus 4.6 92.1%
  14. DeepSeek V4 Pro 91.3%
  15. GPT-5.4 91.3%

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

NYT Connections (extended) results by model
#ModelProviderScoreSettingSourceDate
1GPT-6 Astra OpenAI98.1%xhigh reasoningLech Mazur benchmarks
2Gemini 3.1 Pro Preview Google97.4%Lech Mazur benchmarks
3Gemini 3.8 Flash Google97.4%high reasoningLech Mazur benchmarks
4GPT-5.5 OpenAI96.2%xhigh reasoningLech Mazur benchmarks
5GPT-6.1 Sol OpenAI95.5%high reasoningLech Mazur benchmarks
6Gemini 3 Pro Google94.4%Lech Mazur benchmarks
7Claude Opus 5 Anthropic94.3%xhigh reasoningLech Mazur benchmarks
8Gemini 3.7 Flash Google94%Lech Mazur benchmarks
9GPT-5.6 Sol OpenAI93.8%xhigh reasoningLech Mazur benchmarks
10Kimi K3 Moonshot AI93.6%Lech Mazur benchmarks
11Claude Fable 5 Anthropic92.7%high reasoningLech Mazur benchmarks
12Gemini 3.5 Flash Google92.6%Lech Mazur benchmarks
13Claude Opus 4.6 Anthropic92.1%high reasoningLech Mazur benchmarks
14DeepSeek V4 Pro DeepSeek91.3%high reasoningLech Mazur benchmarks
15GPT-5.4 OpenAI91.3%xhigh reasoningLech Mazur benchmarks
16Claude Opus 4.8 Anthropic91.1%xhigh reasoningLech Mazur benchmarks
17GPT-6 Sol OpenAI90.1%high reasoningLech Mazur benchmarks
18Claude Fable 5.1 Anthropic90%high reasoningLech Mazur benchmarks
19DeepSeek V4.1 Flash DeepSeek89.6%high reasoningLech Mazur benchmarks
20DeepSeek V4 Flash DeepSeek89.6%Lech Mazur benchmarks
21Grok 4.20 Multi-Agent xAI89.6%Lech Mazur benchmarks
22Gemini 3.6 Flash Google89%Lech Mazur benchmarks
23Claude Opus 5.5 Anthropic88.5%high reasoningLech Mazur benchmarks
24Qwen3.8 Max Alibaba (Qwen)88.3%Lech Mazur benchmarks
25Grok 4.1 Fast xAI87.4%Lech Mazur benchmarks
26Kimi K2.6 Moonshot AI87.2%Lech Mazur benchmarks
27Grok 4.20 (Non-Reasoning) xAI85.4%reasoningLech Mazur benchmarks
28Muse Spark 1.3 Meta85.1%high reasoningLech Mazur benchmarks
29Qwen3.7 Max Alibaba (Qwen)85.1%Lech Mazur benchmarks
30Muse Spark 1.1 Meta84.9%high reasoningLech Mazur benchmarks
31GPT-5.2 OpenAI83.6%xhigh reasoningLech Mazur benchmarks
32Gemini 3 Flash Preview Google83.1%Lech Mazur benchmarks
33Claude Sonnet 4.6 Anthropic80.9%high reasoningLech Mazur benchmarks
34Claude Sonnet 5.5 Anthropic80.5%high reasoningLech Mazur benchmarks
35Grok 4.6 xAI80%xhigh reasoningLech Mazur benchmarks
36Grok 4.5 xAI79.9%high reasoningLech Mazur benchmarks
37GPT-5.2 Pro OpenAI79.3%Lech Mazur benchmarks
38Muse Spark 1.2 Meta79.2%high reasoningLech Mazur benchmarks
39GPT-5.6 Terra OpenAI78.4%high reasoningLech Mazur benchmarks
40GLM-5.1 Z.ai (Zhipu)77.7%Lech Mazur benchmarks
41Grok 4.7 xAI76.8%high reasoningLech Mazur benchmarks
42Claude Sonnet 5 Anthropic75.1%high reasoningLech Mazur benchmarks
43GLM-5 Z.ai (Zhipu)74.8%Lech Mazur benchmarks
44Qwen3.7 Plus Alibaba (Qwen)74.8%Lech Mazur benchmarks
45GLM-5.2 Z.ai (Zhipu)74.3%high reasoningLech Mazur benchmarks
46GLM-5.3 Z.ai (Zhipu)74.2%high reasoningLech Mazur benchmarks
47Qwen3.6 Max Preview Alibaba (Qwen)74.1%Lech Mazur benchmarks
48Gemma 4 31B IT Google70.6%Lech Mazur benchmarks
49Kimi K2.5 Moonshot AI69.9%Lech Mazur benchmarks
50GPT-5.6 Luna OpenAI69.4%high reasoningLech Mazur benchmarks
51GPT-6 Luna OpenAI68.7%high reasoningLech Mazur benchmarks
52Hy4 preview Tencent68.2%Lech Mazur benchmarks
53Claude Haiku 5.5 Anthropic65.7%high reasoningLech Mazur benchmarks
54MiniMax-M3 MiniMax65.1%Lech Mazur benchmarks
55GPT-5.4 mini OpenAI61.8%xhigh reasoningLech Mazur benchmarks
56Gemini 3.5 Flash Lite Google60.4%high reasoningLech Mazur benchmarks
57Qwen3.6 Plus Alibaba (Qwen)60.3%Lech Mazur benchmarks
58Qwen3.5 397B-A17B Alibaba (Qwen)58.9%Lech Mazur benchmarks
59Grok 4.3 xAI55.2%Lech Mazur benchmarks
60Qwen3.8 27B Alibaba (Qwen)54.5%Lech Mazur benchmarks
61Claude Opus 4.5 Anthropic52.5%Lech Mazur benchmarks
62Qwen3.5 122B-A10B Alibaba (Qwen)51.7%Lech Mazur benchmarks
63Qwen3.5 27B Alibaba (Qwen)47.9%Lech Mazur benchmarks
64Qwen3.7 Flash Alibaba (Qwen)43.8%Lech Mazur benchmarks
65Qwen3.6 35B-A3B Alibaba (Qwen)41.6%Lech Mazur benchmarks
66Hy3 Tencent41.2%highLech Mazur benchmarks
67Step 3.7 Flash StepFun39.7%high reasoningLech Mazur benchmarks
68Claude Opus 4.7 Anthropic39%high reasoningLech Mazur benchmarks
69Claude Sonnet 4.5 Anthropic37.3%Lech Mazur benchmarks
70DeepSeek-V3.2-Exp DeepSeek36.7%Lech Mazur benchmarks
71MiMo-V2.5-Pro Xiaomi34.4%Lech Mazur benchmarks
72Qwen3 Max Alibaba (Qwen)30.1%2026-01-23Lech Mazur benchmarks
73Seed 2.0 Pro ByteDance Seed28.4%Lech Mazur benchmarks
74Step 3.5 Flash StepFun28.4%Lech Mazur benchmarks
75Mistral Large 4 Mistral AI27.4%highLech Mazur benchmarks
76MiMo-V2-Pro Xiaomi25.8%Lech Mazur benchmarks
77MiniMax-M2.7 MiniMax24.7%Lech Mazur benchmarks
78ERNIE 5.1 Baidu23.4%Lech Mazur benchmarks
79Longcat Flash Chat Meituan17.7%Lech Mazur benchmarks
80MiniMax-M2.5 MiniMax16.8%Lech Mazur benchmarks
81Trinity Large Thinking Arcee AI16.5%Lech Mazur benchmarks
82Nemotron 3 Super NVIDIA15.4%Lech Mazur benchmarks
83MiniMax-M2 MiniMax14.8%Lech Mazur benchmarks
84Claude Haiku 4.5 Anthropic14.3%Lech Mazur benchmarks
85Mistral Medium 3.5 Mistral AI12.9%highLech Mazur benchmarks
86MiniMax-M2.1 MiniMax11.2%Lech Mazur benchmarks
87ERNIE 5.0 0110 Baidu10.3%Lech Mazur benchmarks
88Gemini 3.1 Flash Lite Google8.2%Lech Mazur benchmarks
89Llama 4 Maverick Meta8%Lech Mazur benchmarks
90Mistral Large 3 Mistral AI7.5%Lech Mazur benchmarks
91Mistral Medium 3.1 Mistral AI6.5%Lech Mazur benchmarks

Compare the leaders

Other reasoning benchmarks

Frequently asked questions

What does NYT Connections (extended) measure?

New York Times Connections puzzles made harder with extra distractor words: sort 16 or more words into groups of four by a hidden theme.

Which model has the highest NYT Connections (extended) score?

As of October 2026, GPT-6 Astra has the highest published NYT Connections (extended) score on Noometry at 98.1%, out of 91 models with results.

What is the best open-weight model on NYT Connections (extended)?

Kimi K3 has the highest NYT Connections (extended) accuracy among open-weight models at 93.6%, ranking 10 of 91 overall.