Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on prompts Arena classes as expert-level.

Results dated
25 Sep 2026
Models
359
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International

Full results

Arena Text: expert prompts, Arena rating, higher is better
#ModelArena Text: expert prompts · 95% range
Arena rating, higher is better
1 Claude Opus 5.5 (high)Anthropic
1,556
1,522–1,591
1 Claude Fable 5 (high)Anthropic
1,550
1,540–1,560
1 Claude Opus 4.6 (high)Anthropic
1,547
1,539–1,555
1 Claude Opus 5 (high)Anthropic
1,543
1,534–1,551
1 MiMo-V2.6-ProXiaomi
1,535
1,508–1,563
1 Claude Opus 4.7Anthropic
1,535
1,527–1,543
1 Claude Opus 4.7 (high)Anthropic
1,534
1,526–1,542
1 GPT-5.6 Sol (xhigh)OpenAI
1,534
1,524–1,544
1 Claude Opus 4.6Anthropic
1,533
1,526–1,541
1 Kimi K3 (max)Moonshot AI
1,533
1,521–1,545
1 Gemini 3.8 Flash (high)Google
1,529
1,517–1,541
1 Muse Spark 1.3 (max)Meta
1,527
1,510–1,544
2 Claude Opus 5 (max)Anthropic
1,527
1,516–1,539
3 DeepSeek V4.1 Flash (max)DeepSeek
1,518
1,497–1,538
3 Claude Fable 5.1 (max)Anthropic
1,516
1,495–1,536
3 MiMo-V2.6-FlashXiaomi
1,510
1,483–1,538
3 qwen3.7-max-previewAlibaba
1,506
1,475–1,537
4 Claude Opus 4.8 (high)Anthropic
1,525
1,517–1,533
4 GLM 5.3 (max)Z.ai
1,516
1,501–1,531
4 GPT-6 Astra (max)OpenAI
1,510
1,488–1,532
4 GPT-6 Sol (max)OpenAI
1,507
1,482–1,531
4 GPT-6 Luna (max)OpenAI
1,505
1,480–1,529
4 Muse Spark 1.2Meta
1,502
1,472–1,531
7 Gemini 3.7 Flash (high)Google
1,512
1,499–1,524
7 amazon-nova-experimental-chat-26-02-10Amazon
1,494
1,462–1,525
8 Claude Opus 4.8Anthropic
1,515
1,507–1,523
8 GPT-5.4 (high)OpenAI
1,515
1,506–1,523
8 GLM 5.3 FlashZ.ai
1,510
1,497–1,524
8 Qwen3.8 Max (0902)Alibaba
1,510
1,498–1,522
8 Gemma 4 31BGoogle
1,499
1,474–1,523
8 Qwen3.6 Max PreviewAlibaba
1,499
1,474–1,523
9 Claude Sonnet 5 (high)Anthropic
1,512
1,503–1,521
10 GPT-5.5 (high)OpenAI
1,513
1,505–1,520
10 GPT-5.5OpenAI
1,511
1,503–1,519
12 Gemini 3.1 Pro PreviewGoogle
1,509
1,503–1,516
13 Claude Sonnet 4.6Anthropic
1,506
1,498–1,514
13 MiMo-V2.5-ProXiaomi
1,506
1,498–1,514
13 Muse Spark 1.1Meta
1,504
1,495–1,514
13 GPT-5.6 Terra (xhigh)OpenAI
1,504
1,494–1,514
13 Claude Opus 4.5Anthropic
1,503
1,491–1,515
13 Kimi K2.6Moonshot AI
1,503
1,493–1,513
13 Claude Opus 4.5Anthropic
1,503
1,494–1,511
13 qwen3.5-max-previewAlibaba
1,499
1,486–1,512
14 GLM 5.2 (max)Z.ai
1,500
1,491–1,509
14 Gemini 3.6 Flash (high)Google
1,500
1,490–1,510
14 gemini-3-proGoogle
1,498
1,487–1,510
14 gemini-3-flashGoogle
1,496
1,484–1,509
14 Hy3Tencent
1,490
1,472–1,508
15 muse-sparkMeta
1,491
1,475–1,508
17 Claude Sonnet 4.5Anthropic
1,498
1,490–1,506
17 mimo-v2-proXiaomi
1,493
1,480–1,506
17 amazon-nova-experimental-chat-26-01-10Amazon
1,472
1,438–1,506
18 ernie-5.1Baidu
1,494
1,484–1,504
19 GLM 5.1Z.ai
1,495
1,487–1,503
20 DeepSeek V4 Pro 0813DeepSeek
1,485
1,466–1,503
21 gpt-5.2-chat-latest-20260210OpenAI
1,491
1,480–1,502
21 Grok 4.6 (high)xAI
1,490
1,477–1,502
22 GPT-5.4OpenAI
1,492
1,484–1,500
22 GPT-5.6 Luna (xhigh)OpenAI
1,491
1,481–1,501
22 Gemini 3.5 Flash (high)Google
1,491
1,482–1,500
22 Gemma 4 26B A4BGoogle
1,475
1,450–1,501
26 Grok 4.5xAI
1,488
1,479–1,498
28 Gemini 3.5 Flash (medium)Google
1,487
1,478–1,496
31 Qwen3 235B A22B Thinking 2507Alibaba
1,466
1,437–1,494
32 Qwen3.7 PlusAlibaba
1,485
1,476–1,494
32 Claude Opus 4.1Anthropic
1,482
1,470–1,494
32 GPT-5.1 (high)OpenAI
1,482
1,470–1,494
33 GLM 5Z.ai
1,481
1,469–1,493
33 Qwen3.8 27BAlibaba
1,477
1,463–1,491
35 Claude Sonnet 4.5Anthropic
1,483
1,475–1,491
35 Kimi K2.5Moonshot AI
1,483
1,475–1,490
37 GPT-5.4 Mini (high)OpenAI
1,480
1,472–1,488
37 grok-4.20-multi-agent-beta-0309xAI
1,480
1,472–1,488
37 DeepSeek V4 Pro 0423DeepSeek
1,480
1,471–1,488
37 grok-4.20-beta1xAI
1,476
1,463–1,488
41 grok-4.20-beta-0309-reasoningxAI
1,478
1,470–1,486
41 dola-seed-2.0-proBytedance
1,478
1,470–1,485
41 Qwen3.6 PlusAlibaba
1,476
1,467–1,485
41 deepseek-v4-pro-preview (high reasoning)DeepSeek
1,475
1,467–1,484
41 GPT-5.2 (high)OpenAI
1,475
1,465–1,485
41 gpt-5.5-instantOpenAI
1,473
1,461–1,486
42 InklingThinkingmachines
1,474
1,464–1,484
44 nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA
1,467
1,450–1,484
45 Qwen3.5 397B A17BAlibaba
1,476
1,469–1,483
47 gpt-5.3-chat-latestOpenAI
1,471
1,459–1,482
47 Grok 4.7 (xhigh)xAI
1,454
1,426–1,482
49 qwen3-max-previewAlibaba
1,464
1,448–1,480
51 MiniMax M3MiniMax
1,471
1,462–1,479
51 MiMo-V2.5Xiaomi
1,470
1,461–1,480
51 longcat-flash-chat-2602-expMeituan
1,468
1,456–1,479
51 GLM 5V TurboZ.ai
1,462
1,445–1,479
53 DeepSeek V3.2 ExpDeepSeek
1,449
1,420–1,478
54 Gemini 3.5 Flash LiteGoogle
1,467
1,457–1,477
56 Claude Opus 4.1Anthropic
1,466
1,457–1,475
57 deepseek-v4-flash-preview (high reasoning)DeepSeek
1,466
1,457–1,475
59 grok-4.1-thinkingxAI
1,466
1,457–1,475
59 mimo-v2-omniXiaomi
1,461
1,448–1,474
59 GPT-5 (high)OpenAI
1,460
1,444–1,475
60 Kimi K2.5Moonshot AI
1,451
1,428–1,474
61 ernie-5.0-preview-1203Baidu
1,451
1,429–1,472
66 gemini-3-flash (minimal reasoning)Google
1,463
1,456–1,470
67 muse-glimmerMeta
1,442
1,414–1,470
70 kimi-k2-thinking-turboMoonshot AI
1,460
1,452–1,469
70 GLM 4.7Z.ai
1,449
1,429–1,469
72 Hy3 previewTencent
1,446
1,424–1,468
72 Qwen3 VL 235B A22B ThinkingAlibaba
1,439
1,409–1,468
73 GPT-5.2OpenAI
1,459
1,452–1,467
75 DeepSeek V4 Flash 0423DeepSeek
1,457
1,448–1,466
75 GPT-5.1OpenAI
1,455
1,444–1,466
75 ernie-5.0-preview-1022Baidu
1,432
1,399–1,466
76 Gemini 2.5 ProGoogle
1,458
1,451–1,465
76 Qwen3 VL 235B A22B InstructAlibaba
1,440
1,416–1,465
77 DeepSeek V3.2DeepSeek
1,453
1,442–1,464
79 claude-opus-4 (thinking-16k reasoning)Anthropic
1,448
1,434–1,462
81 GLM 4.5Z.ai
1,444
1,427–1,461
82 grok-4.1xAI
1,452
1,444–1,461
83 Grok 4.3xAI
1,452
1,444–1,460
83 MiniMax M2.7MiniMax
1,452
1,445–1,460
83 o3OpenAI
1,449
1,437–1,460
84 Claude Haiku 4.5Anthropic
1,452
1,446–1,458
84 DeepSeek V3.2DeepSeek
1,448
1,438–1,458
84 ernie-5.0-0110Baidu
1,447
1,436–1,458
84 gpt-5-chatOpenAI
1,443
1,428–1,458
86 DeepSeek V3.1DeepSeek
1,432
1,407–1,457
89 Inkling SmallThinkingmachines
1,445
1,433–1,456
90 Qwen3 235B A22B Instruct 2507Alibaba
1,448
1,440–1,455
90 Qwen3.5-122B-A10BAlibaba
1,442
1,430–1,453
90 Qwen3.5-27BAlibaba
1,441
1,429–1,453
90 gpt-4.5-preview-2025-02-27OpenAI
1,429
1,405–1,453
90 longcat-flash-chatMeituan
1,428
1,402–1,454
91 GLM 4.6Z.ai
1,439
1,426–1,452
92 Gemini 3.1 Flash Lite PreviewGoogle
1,443
1,435–1,451
93 Mistral Medium 3.5Mistral
1,434
1,416–1,451
93 grok-4-fast-chatxAI
1,416
1,382–1,451
98 grok-4-1-fast-reasoningxAI
1,438
1,429–1,447
98 GPT-5.4 Nano (high)OpenAI
1,438
1,429–1,446
98 claude-opus-4Anthropic
1,434
1,421–1,446
98 Claude Sonnet 4Anthropic
1,433
1,418–1,447
98 Solar Pro 4Upstage
1,433
1,418–1,448
98 DeepSeek V3.1DeepSeek
1,426
1,404–1,448
98 DeepSeek V3.2 ExpDeepSeek
1,425
1,402–1,447
99 gemini-2.5-flash-preview-09-2025Google
1,432
1,418–1,446
99 hunyuan-t1-20250711Tencent
1,407
1,369–1,445
100 grok-4-0709xAI
1,431
1,418–1,445
102 Qwen3 MaxAlibaba
1,418
1,392–1,444
106 grok-4-fast-reasoningxAI
1,421
1,402–1,441
106 Kimi K2 0905Moonshot AI
1,417
1,393–1,441
106 GLM 4.5VZ.ai
1,399
1,358–1,441
107 chatgpt-4o-latest-20250326OpenAI
1,429
1,420–1,438
107 minimax-m2.1-previewMiniMax
1,421
1,404–1,438
107 R1 0528DeepSeek
1,418
1,399–1,438
109 Step 3.5 FlashStepfun
1,429
1,420–1,438
111 GLM 4.6VZ.ai
1,394
1,352–1,437
112 Mistral Large 3 2512Mistral
1,428
1,420–1,435
112 mimo-v2-flash (thinking reasoning)Xiaomi
1,414
1,394–1,435
112 Qwen3 32BAlibaba
1,398
1,361–1,435
113 MiniMax M2.5MiniMax
1,425
1,414–1,435
115 Gemini 2.5 FlashGoogle
1,424
1,417–1,431
115 Qwen3.5-35B-A3BAlibaba
1,420
1,408–1,431
115 Kimi K2 0711Moonshot AI
1,417
1,401–1,432
115 amazon-nova-experimental-chat-12-10Amazon
1,397
1,362–1,431
122 Qwen3.5-FlashAlibaba
1,420
1,411–1,428
123 granite-4.2-30bIBM
1,396
1,365–1,427
124 mimo-v2-flash (no reasoning)Xiaomi
1,417
1,407–1,426
126 claude-3-7-sonnet-20250219 (thinking-32k reasoning)Anthropic
1,412
1,398–1,426
126 grok-3-mini (high reasoning)xAI
1,407
1,388–1,426
127 R1DeepSeek
1,402
1,382–1,422
130 o4 MiniOpenAI
1,408
1,395–1,420
132 amazon-nova-experimental-chat-11-10Amazon
1,405
1,391–1,419
132 grok-3-preview-02-24xAI
1,403
1,388–1,419
132 o1OpenAI
1,402
1,385–1,419
132 o3 Mini HighOpenAI
1,399
1,378–1,419
133 GPT-5 Mini (high)OpenAI
1,400
1,383–1,418
134 Mistral Medium 3.1Mistral
1,410
1,403–1,418
136 GPT-4.1OpenAI
1,405
1,394–1,417
136 Qwen3 Next 80B A3B InstructAlibaba
1,399
1,382–1,417
137 Qwen3 Next 80B A3B ThinkingAlibaba
1,394
1,371–1,417
139 trinity-large-previewArcee Ai
1,403
1,392–1,415
139 Claude Sonnet 4Anthropic
1,402
1,388–1,415
139 Nemotron 3 SuperNVIDIA
1,393
1,371–1,415
141 Trinity Large ThinkingArcee Ai
1,401
1,389–1,413
141 Qwen3 30B A3B Instruct 2507Alibaba
1,395
1,378–1,412
141 nvidia-llama-3.3-nemotron-super-49b-v1.5NVIDIA
1,371
1,330–1,413
142 DeepSeek V3 0324DeepSeek
1,398
1,386–1,411
143 Qwen3 235B A22BAlibaba
1,395
1,382–1,409
146 GLM 4.7 FlashZ.ai
1,386
1,367–1,406
147 GLM 4.5 AirZ.ai
1,390
1,374–1,405
147 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA
1,389
1,373–1,405
149 claude-3-7-sonnet-20250219Anthropic
1,390
1,377–1,404
149 Granite 4.2 8BIBM
1,369
1,335–1,403
153 Qwen3 235B A22BAlibaba
1,386
1,370–1,402
154 Qwen-PlusAlibaba
1,370
1,341–1,400
154 ring-flash-2.0Ant Group
1,367
1,335–1,399
155 step-3Stepfun
1,364
1,328–1,399
156 grok-3-mini-betaxAI
1,380
1,363–1,398
157 gemini-2.5-flash-lite-preview-09-2025 (no reasoning)Google
1,386
1,375–1,397
157 GPT-4.1 MiniOpenAI
1,384
1,370–1,397
157 o1-previewOpenAI
1,383
1,368–1,397
157 Qwen3 Coder 480B A35BAlibaba
1,379
1,363–1,396
161 Mistral Medium 3Mistral
1,379
1,365–1,393
163 ling-flash-2.0Ant Group
1,361
1,330–1,391
168 amazon-nova-experimental-chat-10-20Amazon
1,365
1,344–1,387
168 intellect-3Primeintellect
1,355
1,323–1,387
168 GPT-5 Nano (high)OpenAI
1,354
1,321–1,386
169 gemini-2.5-flash-lite-preview-06-17 (thinking reasoning)Google
1,371
1,356–1,386
170 Mercury 2Inception
1,348
1,312–1,384
171 MiniMax M2MiniMax
1,350
1,317–1,383
172 qwen2.5-maxAlibaba
1,368
1,354–1,382
175 claude-3-5-sonnet-20241022Anthropic
1,372
1,362–1,381
175 MiniMax M1MiniMax
1,366
1,351–1,380
177 o3 MiniOpenAI
1,366
1,355–1,377
177 qwq-32bAlibaba
1,361
1,344–1,378
179 Nova 2 LiteAmazon
1,354
1,333–1,374
180 gpt-oss-120bOpenAI
1,357
1,341–1,373
180 hunyuan-turbos-20250416Tencent
1,349
1,325–1,373
184 granite-4.1-8bIBM
1,338
1,307–1,370
185 gemini-2.0-flash-001Google
1,356
1,343–1,369
190 o1-miniOpenAI
1,352
1,340–1,363
190 DeepSeek V3DeepSeek
1,348
1,331–1,365
190 granite-4.2-3bIBM
1,328
1,292–1,364
194 olmo-3.1-32b-thinkAi2
1,336
1,310–1,361
195 Qwen3 30B A3BAlibaba
1,343
1,326–1,359
195 hunyuan-large-2025-02-10Tencent
1,323
1,287–1,359
196 step-2-16k-exp-202412Stepfun
1,326
1,295–1,357
197 Command ACohere
1,344
1,332–1,355
197 claude-3-5-sonnet-20240620Anthropic
1,344
1,332–1,355
198 Mistral Small 3.2 24BMistral
1,335
1,315–1,354
201 gemini-1.5-pro-002Google
1,339
1,328–1,350
201 Gemma 3 27BGoogle
1,337
1,325–1,350
201 gemini-2.0-flash-lite-preview-02-05Google
1,332
1,315–1,348
201 Nemotron 3 Nano 30B A3BNVIDIA
1,331
1,312–1,350
201 yi-lightning01 Ai
1,331
1,316–1,346
201 olmo-3.1-32b-instructAi2
1,325
1,303–1,348
201 ibm-granite-h-smallIBM
1,312
1,276–1,348
202 GPT-4.1 NanoOpenAI
1,313
1,283–1,344
204 qwen2.5-plus-1127Alibaba
1,322
1,300–1,343
204 gpt-oss-20bOpenAI
1,314
1,287–1,342
205 glm-4-plus-0111Z.ai
1,312
1,282–1,341
207 Llama 4 MaverickMeta
1,326
1,312–1,339
207 llama-3.1-405b-instruct-fp8Meta
1,325
1,313–1,336
207 olmo-3-32b-thinkAi2
1,303
1,268–1,339
210 deepseek-v2.5-1210DeepSeek
1,306
1,280–1,333
212 gemini-1.5-pro-001Google
1,320
1,308–1,332
213 hunyuan-large-visionTencent
1,297
1,264–1,331
215 hunyuan-standard-2025-02-10Tencent
1,290
1,251–1,329
217 claude-3-opus-20240229Anthropic
1,318
1,309–1,328
217 claude-3-5-haiku-20241022Anthropic
1,316
1,305–1,327
217 grok-2-2024-08-13xAI
1,316
1,305–1,327
218 llama-3.1-405b-instruct-bf16Meta
1,312
1,299–1,325
218 athene-v2-chatNexusflow
1,311
1,296–1,326
220 GPT-4o (2024-08-06)OpenAI
1,312
1,299–1,324
220 Llama 4 ScoutMeta
1,309
1,293–1,324
220 step-1o-turbo-202506Stepfun
1,297
1,270–1,324
220 llama-3.1-nemotron-70b-instructNVIDIA
1,296
1,269–1,323
221 GPT-4o (2024-05-13)OpenAI
1,311
1,301–1,322
222 glm-4-plusZ.ai
1,303
1,288–1,318
222 Mistral Small 3.1 24BMistral
1,302
1,287–1,318
222 athene-70b-0725Nexusflow
1,301
1,282–1,320
222 qwen-max-0919Alibaba
1,300
1,282–1,318
222 magistral-medium-2506Mistral
1,292
1,265–1,319
224 reka-core-20240904Rekaai
1,291
1,267–1,316
225 Gemma 3 12BGoogle
1,274
1,233–1,315
226 Mistral Large 2407Mistral
1,302
1,289–1,314
226 jamba-1.5-largeAI21 Labs
1,285
1,256–1,314
227 gemini-advanced-0514Google
1,299
1,284–1,313
230 deepseek-v2.5DeepSeek
1,296
1,281–1,311
231 Llama 3.3 70B InstructMeta
1,298
1,286–1,309
231 Qwen2.5 Coder 32B InstructAlibaba
1,277
1,244–1,309
232 GPT-4 TurboOpenAI
1,297
1,286–1,308
233 grok-2-mini-2024-08-13xAI
1,295
1,283–1,307
233 Qwen2.5 72B InstructAlibaba
1,295
1,283–1,307
237 gpt-4-1106-previewOpenAI
1,290
1,278–1,302
238 Gemma 3 4BGoogle
1,260
1,219–1,301
239 reka-flash-20240904Rekaai
1,277
1,254–1,300
241 gemini-1.5-flash-002Google
1,285
1,272–1,298
241 gemma-3n-e4b-itGoogle
1,279
1,261–1,298
242 GPT-4o-mini (2024-07-18)OpenAI
1,285
1,274–1,296
244 gpt-4-0125-previewOpenAI
1,280
1,268–1,292
245 Nova Pro 1.0Amazon
1,273
1,257–1,289
247 deepseek-coder-v2DeepSeek
1,267
1,245–1,288
248 Llama 3.1 70B InstructMeta
1,275
1,264–1,287
251 llama-3.1-nemotron-51b-instructNVIDIA
1,253
1,220–1,286
252 claude-3-sonnet-20240229Anthropic
1,273
1,261–1,285
252 mistral-large-2411Mistral
1,271
1,256–1,286
252 Phi 4Microsoft
1,268
1,251–1,286
260 gemini-1.5-flash-001Google
1,268
1,256–1,281
260 c4ai-aya-expanse-32bCohere
1,267
1,253–1,281
261 gpt-4-0314OpenAI
1,264
1,249–1,280
261 Nova Lite 1.0Amazon
1,262
1,245–1,279
261 nemotron-4-340b-instructNVIDIA
1,261
1,242–1,279
261 Mistral Small 3Mistral
1,259
1,238–1,280
262 glm-4-0520Z.ai
1,252
1,227–1,278
263 qwen2-72b-instructAlibaba
1,261
1,246–1,275
263 Command R+ (08-2024)Cohere
1,250
1,225–1,274
265 Gemma 2 27BGoogle
1,260
1,250–1,271
265 granite-3.1-8b-instructIBM
1,236
1,200–1,271
268 ministral-8b-2410Mistral
1,238
1,208–1,268
270 gpt-4-0613OpenAI
1,253
1,241–1,266
271 gemma-2-9b-it-simpoPrinceton Nlp
1,235
1,206–1,265
272 claude-3-haiku-20240307Anthropic
1,253
1,242–1,264
273 Nova Micro 1.0Amazon
1,244
1,227–1,261
277 llama-3-70b-instructMeta
1,245
1,234–1,256
277 c4ai-aya-expanse-8bCohere
1,232
1,209–1,256
278 gemini-1.5-flash-8b-001Google
1,243
1,230–1,256
279 command-r-plusCohere
1,242
1,229–1,254
280 Command R (08-2024)Cohere
1,231
1,209–1,253
280 granite-3.1-2b-instructIBM
1,218
1,183–1,254
283 qwen1.5-72b-chatAlibaba
1,236
1,220–1,251
284 gemma-2-9b-itGoogle
1,238
1,226–1,250
285 reka-flash-21b-20240226-onlineRekaai
1,226
1,205–1,247
286 qwen1.5-110b-chatAlibaba
1,229
1,212–1,246
288 jamba-1.5-miniAI21 Labs
1,213
1,182–1,244
289 mistral-large-2402Mistral
1,229
1,216–1,243
289 mistral-mediumMistral
1,226
1,209–1,243
289 gpt-3.5-turbo-1106OpenAI
1,215
1,187–1,243
290 internlm2_5-20b-chatShanghai Ai Lab
1,220
1,198–1,242
291 qwen1.5-32b-chatAlibaba
1,223
1,205–1,242
292 yi-1.5-34b-chat01 Ai
1,221
1,202–1,239
293 granite-3.0-8b-instructIBM
1,205
1,174–1,236
294 reka-flash-21b-20240226Rekaai
1,216
1,199–1,234
295 Mixtral 8x22B InstructMistral
1,218
1,204–1,232
297 command-rCohere
1,215
1,201–1,228
301 llama-3-8b-instructMeta
1,211
1,199–1,223
301 phi-3-medium-4k-instructMicrosoft
1,205
1,188–1,223
305 qwen1.5-14b-chatAlibaba
1,194
1,174–1,214
306 Llama 3.1 8B InstructMeta
1,198
1,185–1,210
306 gpt-3.5-turbo-0125OpenAI
1,198
1,185–1,210
306 mixtral-8x7b-instruct-v0.1Mistral
1,197
1,184–1,210
306 zephyr-orpo-141b-A35b-v0.1Huggingface
1,172
1,133–1,212
310 dbrx-instruct-previewDatabricks
1,191
1,174–1,207
310 granite-3.0-2b-instructIBM
1,177
1,149–1,206
312 openchat-3.5Openchat
1,164
1,123–1,205
314 gemini-pro-dev-apiGoogle
1,180
1,156–1,204
314 Llama 3.2 3B InstructMeta
1,179
1,154–1,204
320 gemma-1.1-7b-itGoogle
1,175
1,157–1,193
320 starling-lm-7b-betaNexusflow
1,174
1,154–1,194
320 qwq-32b-previewAlibaba
1,153
1,118–1,189
322 phi-3-small-8k-instructMicrosoft
1,167
1,148–1,186
322 openchat-3.5-0106Openchat
1,164
1,141–1,187
323 gemma-2-2b-itGoogle
1,172
1,160–1,185
324 qwen1.5-7b-chatAlibaba
1,148
1,112–1,185
327 snowflake-arctic-instructSnowflake
1,165
1,148–1,182
327 yi-34b-chat01 Ai
1,156
1,131–1,181
327 phi-3-mini-4k-instruct-june-2024Microsoft
1,149
1,123–1,175
330 vicuna-33bLmsys
1,146
1,120–1,173
330 phi-3-mini-4k-instructMicrosoft
1,140
1,121–1,160
330 mistral-7b-instruct-v0.2Mistral
1,140
1,120–1,161
330 starling-lm-7b-alphaBerkeley
1,138
1,107–1,168
330 llama-2-7b-chatMeta
1,134
1,106–1,162
333 llama-2-70b-chatMeta
1,137
1,120–1,155
333 llama-2-13b-chatMeta
1,130
1,104–1,155
335 gemma-7b-itGoogle
1,122
1,090–1,153
335 zephyr-7b-betaHuggingface
1,113
1,075–1,151
336 vicuna-13bLmsys
1,117
1,086–1,148
338 gemma-1.1-2b-itGoogle
1,118
1,092–1,143
339 qwen1.5-4b-chatAlibaba
1,108
1,077–1,139
341 mistral-7b-instructMistral
1,085
1,046–1,124
347 phi-3-mini-128k-instructMicrosoft
1,098
1,078–1,119
349 Llama 3.2 1B InstructMeta
1,082
1,054–1,110

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on prompts Arena classes as expert-level.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.