Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on answers that used live web search.

Results dated
24 Aug 2026
Models
34
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International

Full results

Arena Search: overall, Arena rating, higher is better
#ModelArena Search: overall · 95% range
Arena rating, higher is better
1 GPT-5.6 Sol (xhigh)OpenAI
1,256
1,248–1,263
2 Claude Fable 5Anthropic
1,229
1,221–1,237
2 GPT-5.5OpenAI
1,224
1,218–1,229
2 Claude Opus 4.6Anthropic
1,223
1,218–1,228
5 Claude Opus 4.7Anthropic
1,212
1,207–1,218
5 Gemini 3.1 Pro PreviewGoogle
1,208
1,202–1,213
5 grok-4.20-multi-agent-beta-0309 (arena search)xAI
1,205
1,199–1,210
5 Grok 4.5xAI
1,202
1,195–1,209
5 gemini-3-pro (arena search)Google
1,201
1,196–1,207
6 Claude Sonnet 4.6Anthropic
1,201
1,196–1,206
6 grok-4.20-beta1 (arena search)xAI
1,197
1,191–1,203
6 Claude Sonnet 5Anthropic
1,196
1,189–1,203
6 ernie-5.1 (arena search)Baidu
1,193
1,184–1,203
7 Claude Opus 4.8Anthropic
1,195
1,189–1,201
7 GPT-5.4OpenAI
1,195
1,189–1,200
8 grok-4-1-fast (arena search)xAI
1,194
1,189–1,199
8 Grok 4.3xAI
1,193
1,188–1,199
8 o3OpenAI
1,192
1,185–1,199
8 gemini-3-flash (arena search)Google
1,191
1,187–1,196
11 Claude Opus 4.5Anthropic
1,187
1,181–1,193
12 GPT-5OpenAI
1,183
1,175–1,190
15 GPT-5.1OpenAI
1,183
1,178–1,189
21 Claude Sonnet 4.5Anthropic
1,175
1,170–1,180
23 Claude Opus 4.1Anthropic
1,167
1,162–1,172
24 GPT-5.2OpenAI
1,162
1,156–1,167
24 grok-4-fast (arena search)xAI
1,160
1,155–1,165
25 claude-opus-4 (arena search)Anthropic
1,151
1,145–1,156
27 ppl-sonar-pro-high (arena search)Perplexity
1,143
1,137–1,149
27 Gemini 2.5 ProGoogle
1,142
1,137–1,147
28 ppl-sonar-reasoning-pro-high (arena search)Perplexity
1,138
1,132–1,144
28 GPT-5.2OpenAI
1,137
1,131–1,143
32 grok-4 (arena search)xAI
1,121
1,115–1,128
33 api-gpt-4o-search (arena search)OpenAI
1,081
1,070–1,092
33 diffbot-small-xl (arena search)Diffbot
1,062
1,053–1,071

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on answers that used live web search.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.