Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on writing and language prompts.

Results dated
25 Sep 2026
Models
408
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International

Full results

Arena Text: writing, literature and language, Arena rating, higher is better
#ModelArena Text: writing, literature and language · 95% range
Arena rating, higher is better
1 Claude Opus 5.5 (high)Anthropic
1,520
1,496–1,544
1 Claude Fable 5 (high)Anthropic
1,508
1,501–1,515
1 Claude Opus 4.6 (high)Anthropic
1,500
1,495–1,506
1 Claude Opus 4.7 (high)Anthropic
1,496
1,490–1,502
1 Claude Fable 5.1 (max)Anthropic
1,496
1,484–1,508
1 Gemini 3.7 Flash (high)Google
1,496
1,487–1,505
2 Claude Opus 4.6Anthropic
1,490
1,485–1,496
4 Gemini 3.8 Flash (high)Google
1,486
1,477–1,495
4 Claude Opus 4.7Anthropic
1,485
1,478–1,491
4 Muse Spark 1.2Meta
1,472
1,452–1,492
5 GPT-5.6 Sol (xhigh)OpenAI
1,483
1,475–1,490
5 Claude Opus 5 (high)Anthropic
1,482
1,476–1,489
5 gemini-3-proGoogle
1,481
1,474–1,488
5 Claude Opus 5 (max)Anthropic
1,480
1,473–1,488
6 Gemini 3.1 Pro PreviewGoogle
1,480
1,475–1,485
8 Kimi K3 (max)Moonshot AI
1,475
1,467–1,483
8 Claude Opus 4.8 (high)Anthropic
1,474
1,468–1,480
8 Gemini 3.6 Flash (high)Google
1,472
1,465–1,480
8 Gemini 3.5 Flash (high)Google
1,472
1,466–1,479
8 Qwen3.8 Max (0902)Alibaba
1,472
1,463–1,480
8 GLM 5.3 (max)Z.ai
1,470
1,460–1,480
8 GPT-6 Astra (max)OpenAI
1,469
1,455–1,483
9 Muse Spark 1.3 (max)Meta
1,466
1,454–1,478
9 qwen3.7-max-previewAlibaba
1,458
1,438–1,478
11 GPT-5.5 (high)OpenAI
1,470
1,464–1,475
13 Gemini 3.5 Flash (medium)Google
1,468
1,462–1,475
13 MiMo-V2.6-ProXiaomi
1,456
1,437–1,475
14 Claude Opus 4.8Anthropic
1,467
1,461–1,473
14 Claude Opus 4.5Anthropic
1,466
1,459–1,473
14 muse-sparkMeta
1,463
1,452–1,473
15 GPT-5.5OpenAI
1,467
1,461–1,472
15 Claude Opus 4.5Anthropic
1,467
1,461–1,472
15 GPT-5.4 (high)OpenAI
1,465
1,459–1,471
15 gemini-3-flashGoogle
1,461
1,453–1,469
15 gpt-5.5-instantOpenAI
1,461
1,453–1,469
15 DeepSeek V4.1 Flash (max)DeepSeek
1,455
1,440–1,470
16 Muse Spark 1.1Meta
1,460
1,453–1,467
17 Grok 4.5xAI
1,459
1,452–1,466
17 DeepSeek V4 Pro 0813DeepSeek
1,454
1,442–1,466
18 GLM 5.2 (max)Z.ai
1,459
1,452–1,466
19 GPT-5.4OpenAI
1,458
1,452–1,464
19 qwen3.5-max-previewAlibaba
1,455
1,447–1,464
19 Qwen3.6 Max PreviewAlibaba
1,446
1,429–1,464
25 Claude Sonnet 4.6Anthropic
1,455
1,449–1,461
25 grok-4.20-beta1xAI
1,453
1,445–1,461
26 gpt-5.2-chat-latest-20260210OpenAI
1,453
1,446–1,460
26 GLM 5.1Z.ai
1,453
1,447–1,459
27 Claude Sonnet 4.5Anthropic
1,454
1,449–1,459
27 Claude Sonnet 5 (high)Anthropic
1,452
1,446–1,459
28 Claude Sonnet 4.5Anthropic
1,452
1,447–1,457
28 DeepSeek V4 Pro 0423DeepSeek
1,451
1,445–1,457
28 MiMo-V2.5-ProXiaomi
1,450
1,444–1,456
28 GLM 5.3 FlashZ.ai
1,450
1,441–1,459
28 grok-4.20-beta-0309-reasoningxAI
1,449
1,443–1,455
28 gpt-4.5-preview-2025-02-27OpenAI
1,448
1,438–1,457
28 GLM 5Z.ai
1,447
1,440–1,455
28 GPT-6 Sol (max)OpenAI
1,440
1,423–1,458
30 gemini-3-flash (minimal reasoning)Google
1,448
1,443–1,453
30 Grok 4.6 (high)xAI
1,446
1,437–1,454
35 GPT-5.6 Terra (xhigh)OpenAI
1,445
1,438–1,452
36 Claude Opus 4.1Anthropic
1,446
1,440–1,452
38 deepseek-v4-pro-preview (high reasoning)DeepSeek
1,443
1,437–1,449
38 Gemini 3.5 Flash LiteGoogle
1,442
1,435–1,450
38 Gemma 4 31BGoogle
1,435
1,420–1,450
39 Gemini 2.5 ProGoogle
1,445
1,440–1,449
39 Claude Opus 4.1Anthropic
1,444
1,439–1,449
39 ernie-5.1Baidu
1,442
1,435–1,449
40 grok-4.20-multi-agent-beta-0309xAI
1,443
1,437–1,449
40 Kimi K2.6Moonshot AI
1,441
1,434–1,448
48 GPT-5.1 (high)OpenAI
1,437
1,430–1,444
48 Qwen3.7 PlusAlibaba
1,437
1,430–1,443
48 Grok 4.7 (xhigh)xAI
1,426
1,407–1,444
51 GPT-5.6 Luna (xhigh)OpenAI
1,435
1,428–1,442
51 Hy3Tencent
1,429
1,417–1,441
56 mimo-v2-proXiaomi
1,431
1,423–1,439
57 claude-opus-4 (thinking-16k reasoning)Anthropic
1,431
1,424–1,438
60 MiMo-V2.6-FlashXiaomi
1,418
1,400–1,437
64 chatgpt-4o-latest-20250326OpenAI
1,431
1,426–1,436
64 gpt-5.3-chat-latestOpenAI
1,428
1,420–1,435
67 Kimi K2.5Moonshot AI
1,428
1,423–1,433
67 grok-4.1-thinkingxAI
1,427
1,422–1,433
67 grok-4.1xAI
1,427
1,421–1,433
67 GPT-5.1OpenAI
1,424
1,418–1,431
67 GPT-6 Luna (max)OpenAI
1,415
1,398–1,433
67 DeepSeek V3.1 TerminusDeepSeek
1,411
1,390–1,433
69 Grok 4.3xAI
1,424
1,418–1,430
69 GPT-5.4 Mini (high)OpenAI
1,424
1,418–1,430
69 Qwen3.6 PlusAlibaba
1,423
1,416–1,430
69 deepseek-v4-flash-preview (high reasoning)DeepSeek
1,422
1,416–1,429
70 MiniMax M3MiniMax
1,422
1,416–1,428
70 DeepSeek V3.1 TerminusDeepSeek
1,408
1,387–1,428
71 claude-opus-4Anthropic
1,420
1,413–1,426
71 GLM 4.7Z.ai
1,416
1,405–1,427
71 ernie-5.0-preview-1203Baidu
1,415
1,403–1,427
72 Qwen3.5 397B A17BAlibaba
1,421
1,416–1,426
72 Gemini 3.1 Flash Lite PreviewGoogle
1,420
1,414–1,426
72 ernie-5.0-0110Baidu
1,419
1,412–1,426
72 GLM 5V TurboZ.ai
1,412
1,400–1,424
76 DeepSeek V4 Flash 0423DeepSeek
1,416
1,409–1,422
77 DeepSeek V3.2 ExpDeepSeek
1,410
1,399–1,422
78 Gemma 4 26B A4BGoogle
1,406
1,391–1,421
80 MiMo-V2.5Xiaomi
1,412
1,405–1,418
80 DeepSeek V3.1DeepSeek
1,407
1,396–1,419
80 ernie-5.0-preview-1022Baidu
1,402
1,385–1,419
82 Qwen3 MaxAlibaba
1,405
1,392–1,418
83 Kimi K2.5Moonshot AI
1,404
1,391–1,417
84 GPT-5.2OpenAI
1,411
1,406–1,417
86 DeepSeek V3.2DeepSeek
1,410
1,403–1,416
88 dola-seed-2.0-proBytedance
1,409
1,403–1,415
88 GPT-5.2 (high)OpenAI
1,408
1,402–1,414
88 Mistral Medium 3.5Mistral
1,404
1,392–1,415
89 grok-4-1-fast-reasoningxAI
1,407
1,402–1,413
89 gpt-5-chatOpenAI
1,407
1,399–1,414
89 grok-3-preview-02-24xAI
1,406
1,399–1,413
89 qwen3-max-previewAlibaba
1,405
1,398–1,413
91 GPT-4.1OpenAI
1,405
1,399–1,412
91 GLM 4.6Z.ai
1,405
1,398–1,412
91 DeepSeek V3.2DeepSeek
1,403
1,397–1,410
91 InklingThinkingmachines
1,403
1,396–1,411
91 mimo-v2-omniXiaomi
1,403
1,393–1,412
91 DeepSeek V3.2 ExpDeepSeek
1,398
1,385–1,411
91 grok-4-fast-chatxAI
1,394
1,378–1,409
92 DeepSeek V3.1DeepSeek
1,398
1,388–1,408
93 hunyuan-vision-1.5-thinkingTencent
1,380
1,354–1,407
94 Gemini 2.5 FlashGoogle
1,402
1,398–1,406
94 grok-4-0709xAI
1,399
1,392–1,405
94 o1OpenAI
1,398
1,391–1,405
94 Claude Sonnet 4Anthropic
1,398
1,391–1,405
94 Qwen3.8 27BAlibaba
1,396
1,386–1,406
96 Claude Haiku 4.5Anthropic
1,399
1,395–1,404
96 kimi-k2-thinking-turboMoonshot AI
1,399
1,393–1,404
96 GPT-5 (high)OpenAI
1,397
1,389–1,404
96 muse-glimmerMeta
1,385
1,365–1,404
99 o3OpenAI
1,396
1,390–1,402
101 Qwen3 235B A22B Instruct 2507Alibaba
1,396
1,392–1,401
101 gemini-2.5-flash-preview-09-2025Google
1,394
1,387–1,402
101 claude-3-7-sonnet-20250219 (thinking-32k reasoning)Anthropic
1,394
1,387–1,401
101 nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA
1,389
1,377–1,400
101 Qwen3 VL 235B A22B InstructAlibaba
1,388
1,375–1,401
102 longcat-flash-chat-2602-expMeituan
1,392
1,384–1,400
108 R1 0528DeepSeek
1,388
1,379–1,398
111 Claude Sonnet 4Anthropic
1,390
1,383–1,397
111 grok-4-fast-reasoningxAI
1,388
1,379–1,397
115 Qwen3.5-122B-A10BAlibaba
1,387
1,380–1,395
115 Kimi K2 0905Moonshot AI
1,382
1,370–1,394
115 amazon-nova-experimental-chat-26-02-10Amazon
1,374
1,353–1,394
116 Mistral Large 3 2512Mistral
1,388
1,383–1,393
117 DeepSeek V3 0324DeepSeek
1,386
1,380–1,393
117 Hy3 previewTencent
1,378
1,363–1,393
121 MiniMax M2.7MiniMax
1,386
1,380–1,391
124 Mistral Medium 3.1Mistral
1,386
1,382–1,391
124 Qwen3 235B A22B Thinking 2507Alibaba
1,377
1,363–1,391
125 R1DeepSeek
1,382
1,374–1,390
125 GLM 4.5Z.ai
1,382
1,374–1,391
126 amazon-nova-experimental-chat-12-10Amazon
1,371
1,351–1,390
127 o1-previewOpenAI
1,382
1,374–1,390
128 Qwen3.5-27BAlibaba
1,380
1,372–1,388
128 amazon-nova-experimental-chat-26-01-10Amazon
1,368
1,348–1,389
131 gemini-2.5-flash-lite-preview-06-17 (thinking reasoning)Google
1,379
1,372–1,387
131 hunyuan-t1-20250711Tencent
1,368
1,350–1,387
133 claude-3-7-sonnet-20250219Anthropic
1,379
1,373–1,386
133 Qwen3 235B A22BAlibaba
1,378
1,370–1,385
138 claude-3-5-sonnet-20241022Anthropic
1,378
1,373–1,383
138 Kimi K2 0711Moonshot AI
1,375
1,367–1,383
140 GLM 4.6VZ.ai
1,357
1,333–1,380
142 Qwen3 VL 235B A22B ThinkingAlibaba
1,365
1,351–1,380
145 gemini-2.5-flash-lite-preview-09-2025 (no reasoning)Google
1,371
1,365–1,378
145 Mistral Medium 3Mistral
1,370
1,363–1,378
146 MiniMax M2.5MiniMax
1,369
1,363–1,376
146 Qwen3 Coder 480B A35BAlibaba
1,366
1,358–1,375
149 minimax-m2.1-previewMiniMax
1,364
1,355–1,374
150 Qwen3.5-FlashAlibaba
1,367
1,361–1,373
152 mimo-v2-flash (no reasoning)Xiaomi
1,366
1,360–1,372
154 Step 3.5 FlashStepfun
1,366
1,360–1,372
154 Qwen3.5-35B-A3BAlibaba
1,364
1,356–1,371
156 qwen2.5-maxAlibaba
1,362
1,356–1,369
156 GPT-5.4 Nano (high)OpenAI
1,362
1,356–1,368
156 GPT-4.1 MiniOpenAI
1,361
1,354–1,368
156 hunyuan-turbos-20250416Tencent
1,357
1,345–1,368
156 mimo-v2-flash (thinking reasoning)Xiaomi
1,355
1,344–1,367
157 trinity-large-previewArcee Ai
1,359
1,351–1,366
157 longcat-flash-chatMeituan
1,354
1,342–1,366
159 DeepSeek V3DeepSeek
1,356
1,348–1,364
164 Gemma 3 27BGoogle
1,354
1,348–1,361
164 gemini-1.5-pro-002Google
1,354
1,348–1,360
164 o4 MiniOpenAI
1,354
1,348–1,361
166 gemini-2.0-flash-001Google
1,353
1,347–1,360
166 GPT-5 Mini (high)OpenAI
1,352
1,344–1,360
170 gemini-2.0-flash-lite-preview-02-05Google
1,347
1,340–1,355
172 grok-3-mini (high reasoning)xAI
1,344
1,334–1,354
172 hunyuan-turbos-20250226Tencent
1,333
1,312–1,354
173 Command ACohere
1,348
1,342–1,354
174 Qwen3 235B A22BAlibaba
1,345
1,337–1,353
174 Inkling SmallThinkingmachines
1,344
1,335–1,352
174 Qwen3 Next 80B A3B ThinkingAlibaba
1,341
1,330–1,352
175 GPT-4o (2024-05-13)OpenAI
1,345
1,340–1,351
176 Trinity Large ThinkingArcee Ai
1,343
1,336–1,351
177 Qwen3 Next 80B A3B InstructAlibaba
1,342
1,334–1,351
178 Qwen3 30B A3B Instruct 2507Alibaba
1,342
1,333–1,350
178 o3 Mini HighOpenAI
1,341
1,333–1,350
178 GLM 4.5 AirZ.ai
1,341
1,334–1,349
178 grok-3-mini-betaxAI
1,341
1,332–1,350
178 gemini-advanced-0514Google
1,341
1,333–1,348
178 intellect-3Primeintellect
1,333
1,317–1,350
180 GPT-4o (2024-08-06)OpenAI
1,341
1,334–1,348
184 Solar Pro 4Upstage
1,336
1,325–1,347
184 glm-4-plus-0111Z.ai
1,332
1,317–1,347
187 GLM 4.7 FlashZ.ai
1,331
1,320–1,343
187 hunyuan-turbo-0110Tencent
1,323
1,303–1,343
189 gemini-1.5-pro-001Google
1,334
1,327–1,341
189 llama-3.1-nemotron-ultra-253b-v1NVIDIA
1,321
1,300–1,341
191 MiniMax M1MiniMax
1,332
1,325–1,339
191 Mistral Small 3.2 24BMistral
1,329
1,319–1,339
191 Nemotron 3 SuperNVIDIA
1,325
1,311–1,338
192 claude-3-5-sonnet-20240620Anthropic
1,331
1,325–1,337
192 GPT-4 TurboOpenAI
1,330
1,324–1,337
192 amazon-nova-experimental-chat-11-10Amazon
1,328
1,320–1,336
192 Qwen-PlusAlibaba
1,322
1,307–1,336
194 step-2-16k-exp-202412Stepfun
1,319
1,304–1,335
194 GLM 4.5VZ.ai
1,318
1,300–1,335
198 llama-3.3-nemotron-49b-super-v1NVIDIA
1,311
1,288–1,334
199 grok-2-2024-08-13xAI
1,327
1,321–1,333
199 step-3Stepfun
1,318
1,302–1,333
203 o3 MiniOpenAI
1,325
1,319–1,331
203 Gemma 3 12BGoogle
1,313
1,295–1,331
204 deepseek-v2.5-1210DeepSeek
1,315
1,301–1,328
204 hunyuan-large-2025-02-10Tencent
1,310
1,291–1,329
204 Mercury 2Inception
1,307
1,285–1,329
204 amazon-nova-experimental-chat-10-09Amazon
1,305
1,282–1,329
205 amazon-nova-experimental-chat-10-20Amazon
1,315
1,304–1,327
208 Qwen3 32BAlibaba
1,308
1,291–1,325
209 claude-3-opus-20240229Anthropic
1,316
1,311–1,322
209 llama-3.1-405b-instruct-fp8Meta
1,316
1,310–1,322
212 GPT-4o-mini (2024-07-18)OpenAI
1,314
1,308–1,319
212 nvidia-llama-3.3-nemotron-super-49b-v1.5NVIDIA
1,297
1,276–1,319
213 claude-3-5-haiku-20241022Anthropic
1,314
1,309–1,319
214 llama-3.1-405b-instruct-bf16Meta
1,312
1,306–1,318
214 Llama 4 MaverickMeta
1,312
1,305–1,319
214 glm-4-plusZ.ai
1,309
1,301–1,318
214 qwen-max-0919Alibaba
1,307
1,298–1,317
215 o1-miniOpenAI
1,311
1,305–1,317
215 gpt-oss-120bOpenAI
1,309
1,301–1,317
216 gemini-1.5-flash-002Google
1,309
1,302–1,316
216 gpt-4-1106-previewOpenAI
1,308
1,301–1,314
216 qwq-32bAlibaba
1,308
1,300–1,315
216 gpt-4-0125-previewOpenAI
1,306
1,299–1,312
216 Llama 4 ScoutMeta
1,305
1,297–1,313
216 Qwen3 30B A3BAlibaba
1,304
1,296–1,312
216 step-1o-turbo-202506Stepfun
1,302
1,288–1,316
216 olmo-3.1-32b-instructAi2
1,300
1,288–1,312
216 GPT-4.1 NanoOpenAI
1,299
1,285–1,314
216 MiniMax M2MiniMax
1,298
1,283–1,314
216 Gemma 3 4BGoogle
1,298
1,281–1,315
216 granite-4.2-30bIBM
1,294
1,273–1,316
217 yi-lightning01 Ai
1,303
1,295–1,311
217 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA
1,300
1,288–1,311
217 hunyuan-standard-2025-02-10Tencent
1,293
1,275–1,311
219 Mistral Large 2407Mistral
1,303
1,296–1,310
219 Nova 2 LiteAmazon
1,298
1,287–1,310
219 hunyuan-large-visionTencent
1,292
1,274–1,310
221 gemma-3n-e4b-itGoogle
1,300
1,291–1,309
224 mistral-large-2411Mistral
1,298
1,291–1,305
225 ring-flash-2.0Ant Group
1,289
1,274–1,305
228 GPT-5 Nano (high)OpenAI
1,289
1,275–1,304
229 Gemma 2 27BGoogle
1,298
1,292–1,303
229 magistral-medium-2506Mistral
1,291
1,278–1,303
235 grok-2-mini-2024-08-13xAI
1,295
1,288–1,301
235 qwen2.5-plus-1127Alibaba
1,289
1,278–1,300
239 gemini-1.5-flash-001Google
1,292
1,285–1,299
239 Mistral Small 3.1 24BMistral
1,290
1,283–1,298
241 Llama 3.3 70B InstructMeta
1,292
1,286–1,297
241 llama-3.1-tulu-3-70bAi2
1,278
1,258–1,297
245 gpt-4-0613OpenAI
1,285
1,278–1,292
245 deepseek-v2.5DeepSeek
1,284
1,276–1,292
245 gpt-4-0314OpenAI
1,284
1,275–1,292
245 ling-flash-2.0Ant Group
1,277
1,262–1,293
245 granite-4.1-8bIBM
1,273
1,252–1,294
246 olmo-3-32b-thinkAi2
1,275
1,258–1,291
250 Qwen2.5 72B InstructAlibaba
1,282
1,276–1,289
250 jamba-1.5-largeAI21 Labs
1,277
1,265–1,290
251 gpt-oss-20bOpenAI
1,275
1,262–1,288
252 Command R+ (08-2024)Cohere
1,277
1,266–1,288
255 athene-70b-0725Nexusflow
1,279
1,270–1,288
255 llama-3.1-nemotron-51b-instructNVIDIA
1,270
1,251–1,288
256 athene-v2-chatNexusflow
1,279
1,271–1,286
256 gemma-2-9b-it-simpoPrinceton Nlp
1,275
1,263–1,287
256 mercuryInception
1,257
1,228–1,286
257 reka-core-20240904Rekaai
1,272
1,258–1,286
260 olmo-3.1-32b-thinkAi2
1,269
1,255–1,283
263 Nova Pro 1.0Amazon
1,274
1,267–1,281
264 llama-3.1-nemotron-70b-instructNVIDIA
1,265
1,251–1,279
264 ibm-granite-h-smallIBM
1,260
1,243–1,278
267 claude-3-sonnet-20240229Anthropic
1,270
1,263–1,276
267 Nemotron 3 Nano 30B A3BNVIDIA
1,267
1,256–1,277
273 gemma-2-9b-itGoogle
1,269
1,263–1,275
276 reka-flash-20240904Rekaai
1,259
1,246–1,272
277 Llama 3.1 70B InstructMeta
1,264
1,257–1,270
278 command-r-plusCohere
1,259
1,252–1,267
278 nemotron-4-340b-instructNVIDIA
1,258
1,249–1,268
279 glm-4-0520Z.ai
1,254
1,242–1,266
280 Granite 4.2 8BIBM
1,242
1,219–1,265
284 c4ai-aya-expanse-32bCohere
1,254
1,246–1,262
286 gemini-1.5-flash-8b-001Google
1,255
1,247–1,262
289 Mistral Small 3Mistral
1,248
1,238–1,258
289 granite-4.2-3bIBM
1,234
1,209–1,258
291 llama-3-70b-instructMeta
1,250
1,243–1,256
292 claude-3-haiku-20240307Anthropic
1,247
1,241–1,253
292 deepseek-coder-v2DeepSeek
1,243
1,232–1,253
292 olmo-2-0325-32b-instructAi2
1,234
1,214–1,253
296 qwen2-72b-instructAlibaba
1,242
1,234–1,250
296 Command R (08-2024)Cohere
1,239
1,227–1,250
297 Nova Lite 1.0Amazon
1,240
1,231–1,248
301 Qwen2.5 Coder 32B InstructAlibaba
1,228
1,213–1,243
303 ministral-8b-2410Mistral
1,226
1,210–1,242
305 Phi 4Microsoft
1,229
1,222–1,237
306 gpt-3.5-turbo-0125OpenAI
1,226
1,219–1,233
306 mistral-large-2402Mistral
1,226
1,218–1,234
307 Nova Micro 1.0Amazon
1,223
1,214–1,231
308 qwen1.5-110b-chatAlibaba
1,219
1,209–1,228
308 gemini-pro-dev-apiGoogle
1,218
1,206–1,229
308 hunyuan-standard-256kTencent
1,208
1,188–1,229
310 qwen1.5-72b-chatAlibaba
1,214
1,206–1,223
310 jamba-1.5-miniAI21 Labs
1,214
1,202–1,227
310 c4ai-aya-expanse-8bCohere
1,213
1,202–1,224
310 gemini-proGoogle
1,208
1,189–1,227
311 llama-3.1-tulu-3-8bAi2
1,200
1,181–1,220
314 Mixtral 8x22B InstructMistral
1,210
1,202–1,217
314 command-rCohere
1,209
1,201–1,217
314 mistral-mediumMistral
1,208
1,198–1,217
314 reka-flash-21b-20240226-onlineRekaai
1,204
1,192–1,216
316 zephyr-orpo-141b-A35b-v0.1Huggingface
1,196
1,178–1,214
318 wizardlm-70bMicrosoft
1,195
1,180–1,210
320 reka-flash-21b-20240226Rekaai
1,198
1,188–1,208
320 gpt-3.5-turbo-1106OpenAI
1,193
1,179–1,206
322 falcon-180b-chatTII
1,171
1,139–1,203
326 gemma-2-2b-itGoogle
1,193
1,187–1,200
326 llama-3-8b-instructMeta
1,192
1,185–1,199
326 granite-3.1-8b-instructIBM
1,180
1,159–1,200
327 openchat-3.5Openchat
1,177
1,161–1,192
328 deepseek-llm-67b-chatDeepSeek
1,171
1,152–1,189
329 Llama 3.1 8B InstructMeta
1,182
1,176–1,189
332 dbrx-instruct-previewDatabricks
1,176
1,167–1,186
333 yi-1.5-34b-chat01 Ai
1,175
1,166–1,184
333 phi-3-medium-4k-instructMicrosoft
1,173
1,164–1,182
333 qwen1.5-32b-chatAlibaba
1,172
1,162–1,183
333 vicuna-33bLmsys
1,171
1,161–1,182
333 tulu-2-dpo-70bAi2
1,166
1,149–1,182
336 mixtral-8x7b-instruct-v0.1Mistral
1,171
1,163–1,178
337 qwen1.5-14b-chatAlibaba
1,165
1,153–1,176
337 yi-34b-chat01 Ai
1,164
1,153–1,176
337 openchat-3.5-0106Openchat
1,164
1,151–1,176
337 openhermes-2.5-mistral-7bTeknium
1,159
1,141–1,177
338 snowflake-arctic-instructSnowflake
1,160
1,150–1,170
338 wizardlm-13bMicrosoft
1,153
1,138–1,168
341 internlm2_5-20b-chatShanghai Ai Lab
1,152
1,139–1,164
342 gemma-1.1-7b-itGoogle
1,154
1,145–1,163
342 mpt-30b-chatMosaicml
1,140
1,117–1,162
345 granite-3.0-8b-instructIBM
1,144
1,129–1,160
345 nous-hermes-2-mixtral-8x7b-dpoNousresearch
1,141
1,121–1,160
345 solar-10.7b-instruct-v1.0Upstage
1,140
1,119–1,160
345 dolphin-2.2.1-mistral-7bCognitivecomputations
1,132
1,103–1,160
346 vicuna-13bLmsys
1,146
1,135–1,156
346 Llama 3.2 3B InstructMeta
1,143
1,128–1,157
347 starling-lm-7b-alphaBerkeley
1,140
1,127–1,153
349 phi-3-small-8k-instructMicrosoft
1,141
1,131–1,151
351 llama2-70b-steerlm-chatNVIDIA
1,128
1,106–1,150
352 granite-3.1-2b-instructIBM
1,128
1,107–1,149
352 guanaco-33bTimdettmers
1,123
1,100–1,146
352 zephyr-7b-alphaHuggingface
1,123
1,098–1,148
354 qwen-14b-chatAlibaba
1,121
1,103–1,140
355 llama-2-70b-chatMeta
1,131
1,122–1,139
355 starling-lm-7b-betaNexusflow
1,127
1,115–1,139
358 zephyr-7b-betaHuggingface
1,121
1,107–1,135
358 vicuna-7bLmsys
1,116
1,101–1,132
358 qwq-32b-previewAlibaba
1,113
1,092–1,134
358 qwen1.5-7b-chatAlibaba
1,113
1,095–1,131
362 mistral-7b-instruct-v0.2Mistral
1,113
1,103–1,124
362 granite-3.0-2b-instructIBM
1,106
1,091–1,122
364 gemma-7b-itGoogle
1,105
1,091–1,120
364 codellama-34b-instructMeta
1,105
1,090–1,119
366 llama-2-13b-chatMeta
1,104
1,094–1,115
366 phi-3-mini-4k-instruct-june-2024Microsoft
1,104
1,092–1,115
367 phi-3-mini-128k-instructMicrosoft
1,099
1,087–1,111
367 palm-2Google
1,097
1,082–1,112
367 mistral-7b-instructMistral
1,095
1,080–1,111
367 stripedhyena-nous-7bTogether
1,093
1,075–1,111
370 phi-3-mini-4k-instructMicrosoft
1,093
1,082–1,103
370 gemma-1.1-2b-itGoogle
1,092
1,079–1,105
370 smollm2-1.7b-instructHuggingface
1,079
1,053–1,106
375 alpaca-13bStanford
1,081
1,062–1,100
378 gpt4all-13b-snoozyNomic
1,062
1,031–1,093
380 qwen1.5-4b-chatAlibaba
1,077
1,062–1,092
380 Llama 3.2 1B InstructMeta
1,076
1,061–1,091
380 codellama-70b-instructMeta
1,055
1,018–1,092
383 llama-2-7b-chatMeta
1,076
1,064–1,087
388 gemma-2b-itGoogle
1,058
1,039–1,077
388 mpt-7b-chatMosaicml
1,057
1,037–1,078
389 koala-13bBerkeley
1,049
1,031–1,067
392 chatglm3-6bZ.ai
1,041
1,021–1,061
394 olmo-7b-instructAi2
1,023
1,004–1,041
395 chatglm2-6bZ.ai
1,016
994–1,039
397 oasst-pythia-12bOpenassistant
1,013
995–1,031
398 RWKV-4-Raven-14BRwkv
1,003
984–1,023
399 fastchat-t5-3bLmsys
998
977–1,019
401 chatglm-6bZ.ai
982
961–1,002
401 dolly-v2-12bDatabricks
975
952–998
406 stablelm-tuned-alpha-7bStabilityai
931
907–955
406 llama-13bMeta
929
900–957

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on writing and language prompts.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.