Agentic & Tool Use benchmark

LMArena Search leaderboard

As of October 2026, GPT-5.6 Sol has the highest published LMArena Search score on Noometry at 1257, out of 32 models with results.

Last verified

About LMArena Search

Blind votes on answers from search-grounded models.

Category
Agentic & Tool Use
Introduced
2025
Format
Pairwise human votes
Unit
Arena rating (Bradley–Terry)
Official site
lmarena.ai

Top 15 models

Top models on LMArena Search
  1. GPT-5.6 Sol 1257
  2. Claude Opus 4.6 1253
  3. GPT-5.5 1242
  4. Claude Opus 4.7 1233
  5. Claude Fable 5 1230
  6. ERNIE 5.1 1227
  7. Claude Sonnet 4.6 1221
  8. Grok 4.5 1213
  9. Gemini 3.1 Pro Preview 1211
  10. Gemini 3 Pro 1207
  11. GPT-5.2 1207
  12. Claude Opus 4.8 1204
  13. Grok 4.20 Multi-Agent 1204
  14. GPT-5.1 1199
  15. Gemini 3 Flash Preview 1198

Sponsored placements are available on pages like this one. Advertise on Noometry

All results

LMArena Search results by model
#ModelProviderRatingSettingSourceDate
1GPT-5.6 Sol OpenAI1257xhighLMArena2026-08-24
2Claude Opus 4.6 Anthropic1253LMArena2026-08-24
3GPT-5.5 OpenAI1242LMArena2026-08-24
4Claude Opus 4.7 Anthropic1233LMArena2026-08-24
5Claude Fable 5 Anthropic1230LMArena2026-08-24
6ERNIE 5.1 Baidu1227LMArena2026-08-24
7Claude Sonnet 4.6 Anthropic1221LMArena2026-08-24
8Grok 4.5 xAI1213LMArena2026-08-24
9Gemini 3.1 Pro Preview Google1211LMArena2026-08-24
10Gemini 3 Pro Google1207LMArena2026-08-24
11GPT-5.2 OpenAI1207LMArena2026-08-24
12Claude Opus 4.8 Anthropic1204LMArena2026-08-24
13Grok 4.20 Multi-Agent xAI1204LMArena2026-08-24
14GPT-5.1 OpenAI1199LMArena2026-08-24
15Gemini 3 Flash Preview Google1198LMArena2026-08-24
16GPT-5.4 OpenAI1197LMArena2026-08-24
17Claude Sonnet 5 Anthropic1194LMArena2026-08-24
18Grok 4.20 (Non-Reasoning) xAI1189LMArena2026-08-24
19Claude Opus 4.5 Anthropic1180LMArena2026-08-24
20Grok 4.1 Fast xAI1171LMArena2026-08-24
21Grok 4 Fast xAI1171LMArena2026-08-24
22Grok 4.3 xAI1165LMArena2026-08-24
23Claude Sonnet 4.5 Anthropic1159LMArena2026-08-24
24Claude Opus 4.1 Anthropic1148LMArena2026-08-24
25o3 OpenAI1144LMArena2026-08-24
26Gemini 2.5 Pro Google1142LMArena2026-08-24
27Grok 4 xAI1142LMArena2026-08-24
28Sonar Reasoning Pro Perplexity1139highLMArena2026-08-24
29GPT-5 OpenAI1133LMArena2026-08-24
30Sonar Pro Perplexity1130highLMArena2026-08-24
31Claude Opus 4 Anthropic1127LMArena2026-08-24
32GPT-4o OpenAI1006LMArena2026-08-24

Compare the leaders

Other agentic & tool use benchmarks

Frequently asked questions

What does LMArena Search measure?

Blind votes on answers from search-grounded models.

Which model has the highest LMArena Search score?

As of October 2026, GPT-5.6 Sol has the highest published LMArena Search score on Noometry at 1257, out of 32 models with results.