Benchmarks / Arena (formerly LMArena)

Reported by Arena (formerly LMArena)

Arena (formerly LMArena)

Human preference on business, management and finance prompts.

Results dated
25 Sep 2026
Models
402
Unit
Arena rating
Licence
Creative Commons Attribution 4.0 International

Full results

Arena Text: business, management and finance, Arena rating, higher is better
#ModelArena Text: business, management and finance · 95% range
Arena rating, higher is better
1 Muse Spark 1.2Meta
1,519
1,496–1,542
1 Claude Opus 4.7 (high)Anthropic
1,508
1,501–1,514
1 Muse Spark 1.3 (max)Meta
1,506
1,492–1,519
1 Claude Fable 5 (high)Anthropic
1,503
1,496–1,511
1 Claude Opus 4.6 (high)Anthropic
1,501
1,495–1,507
1 Claude Opus 4.6Anthropic
1,501
1,495–1,507
1 Claude Opus 5.5 (high)Anthropic
1,499
1,471–1,528
1 Claude Opus 4.7Anthropic
1,495
1,489–1,502
2 Muse Spark 1.1Meta
1,493
1,485–1,501
2 Kimi K3 (max)Moonshot AI
1,489
1,480–1,498
2 muse-sparkMeta
1,489
1,478–1,501
2 Claude Fable 5.1 (max)Anthropic
1,485
1,471–1,499
2 GPT-6 Astra (max)OpenAI
1,483
1,466–1,499
2 DeepSeek V4.1 Flash (max)DeepSeek
1,481
1,464–1,498
3 Claude Opus 4.8 (high)Anthropic
1,490
1,483–1,496
3 GPT-5.5 (high)OpenAI
1,489
1,483–1,496
6 Claude Opus 4.8Anthropic
1,487
1,481–1,493
6 Claude Opus 5 (high)Anthropic
1,486
1,479–1,493
6 GPT-5.6 Sol (xhigh)OpenAI
1,485
1,477–1,493
6 gpt-5.2-chat-latest-20260210OpenAI
1,485
1,477–1,493
6 Gemini 3.7 Flash (high)Google
1,483
1,473–1,494
7 GPT-5.5OpenAI
1,486
1,479–1,492
7 Claude Opus 5 (max)Anthropic
1,482
1,473–1,491
7 Gemini 3.8 Flash (high)Google
1,482
1,472–1,492
7 Qwen3.8 Max (0902)Alibaba
1,480
1,470–1,490
8 Claude Sonnet 4.6Anthropic
1,482
1,476–1,488
8 GPT-5.4 (high)OpenAI
1,482
1,475–1,488
8 GLM 5.3 (max)Z.ai
1,474
1,463–1,486
9 gpt-5.5-instantOpenAI
1,476
1,467–1,485
9 ernie-5.1Baidu
1,475
1,468–1,483
9 GPT-6 Sol (max)OpenAI
1,465
1,445–1,484
9 MiMo-V2.6-ProXiaomi
1,462
1,440–1,484
11 Gemini 3.1 Pro PreviewGoogle
1,477
1,472–1,482
11 GPT-5.4OpenAI
1,475
1,468–1,481
11 gemini-3-proGoogle
1,474
1,467–1,481
11 DeepSeek V4 Pro 0813DeepSeek
1,467
1,453–1,481
11 MiMo-V2.6-FlashXiaomi
1,460
1,439–1,481
13 Gemini 3.6 Flash (high)Google
1,472
1,464–1,480
14 qwen3.7-max-previewAlibaba
1,459
1,439–1,479
15 Claude Opus 4.5Anthropic
1,472
1,466–1,478
15 grok-4.20-beta1xAI
1,470
1,461–1,478
16 MiMo-V2.5-ProXiaomi
1,471
1,465–1,478
18 gemini-3-flashGoogle
1,469
1,461–1,477
18 muse-glimmerMeta
1,455
1,433–1,477
20 Gemini 3.5 Flash (high)Google
1,468
1,461–1,475
20 Claude Opus 4.5Anthropic
1,467
1,460–1,475
20 GPT-5.6 Terra (xhigh)OpenAI
1,466
1,458–1,474
20 GLM 5.3 FlashZ.ai
1,463
1,453–1,474
22 grok-4.20-beta-0309-reasoningxAI
1,466
1,460–1,472
22 Grok 4.5xAI
1,465
1,457–1,473
22 Claude Sonnet 5 (high)Anthropic
1,465
1,458–1,472
22 GPT-6 Luna (max)OpenAI
1,452
1,432–1,473
24 GLM 5.1Z.ai
1,465
1,459–1,472
24 GPT-5.6 Luna (xhigh)OpenAI
1,463
1,455–1,471
25 qwen3.5-max-previewAlibaba
1,462
1,453–1,471
26 GLM 5.2 (max)Z.ai
1,463
1,456–1,471
27 dola-seed-2.0-proBytedance
1,464
1,458–1,470
27 Gemini 3.5 Flash (medium)Google
1,461
1,454–1,469
27 Qwen3.6 Max PreviewAlibaba
1,450
1,432–1,469
29 gpt-5.3-chat-latestOpenAI
1,459
1,452–1,467
30 grok-4.1xAI
1,461
1,455–1,467
31 DeepSeek V4 Pro 0423DeepSeek
1,460
1,453–1,466
33 Claude Sonnet 4.5Anthropic
1,461
1,455–1,466
33 GPT-5.4 Mini (high)OpenAI
1,460
1,453–1,466
33 Gemma 4 31BGoogle
1,449
1,433–1,466
34 grok-4.1-thinkingxAI
1,459
1,453–1,465
35 Claude Sonnet 4.5Anthropic
1,459
1,453–1,464
37 Kimi K2.6Moonshot AI
1,455
1,447–1,462
37 Gemini 3.5 Flash LiteGoogle
1,454
1,445–1,462
37 mimo-v2-proXiaomi
1,454
1,445–1,462
37 Gemma 4 26B A4BGoogle
1,444
1,427–1,461
38 Hy3Tencent
1,447
1,433–1,461
39 grok-4.20-multi-agent-beta-0309xAI
1,454
1,448–1,461
40 gemini-3-flash (minimal reasoning)Google
1,455
1,449–1,460
42 GLM 5Z.ai
1,451
1,443–1,459
43 chatgpt-4o-latest-20250326OpenAI
1,453
1,447–1,458
44 amazon-nova-experimental-chat-26-02-10Amazon
1,435
1,413–1,458
47 MiniMax M3MiniMax
1,450
1,443–1,456
47 Grok 4.6 (high)xAI
1,447
1,438–1,457
48 GPT-5.1 (high)OpenAI
1,448
1,441–1,456
48 ernie-5.0-preview-1203Baidu
1,442
1,429–1,456
51 deepseek-v4-pro-preview (high reasoning)DeepSeek
1,448
1,441–1,455
51 GLM 4.7Z.ai
1,442
1,430–1,455
52 Claude Opus 4.1Anthropic
1,447
1,441–1,454
52 qwen3-max-previewAlibaba
1,445
1,436–1,454
52 Qwen3 VL 235B A22B InstructAlibaba
1,440
1,426–1,454
59 Claude Opus 4.1Anthropic
1,447
1,441–1,452
59 Qwen3.6 PlusAlibaba
1,446
1,439–1,453
59 Qwen3.7 PlusAlibaba
1,445
1,437–1,452
59 InklingThinkingmachines
1,444
1,436–1,452
59 GLM 5V TurboZ.ai
1,440
1,427–1,453
60 Qwen3.5 397B A17BAlibaba
1,445
1,440–1,451
60 GPT-5.2OpenAI
1,444
1,438–1,450
60 GPT-5.2 (high)OpenAI
1,443
1,437–1,450
60 GPT-5.1OpenAI
1,443
1,436–1,450
60 mimo-v2-omniXiaomi
1,441
1,431–1,451
61 gpt-5-chatOpenAI
1,440
1,432–1,449
62 MiMo-V2.5Xiaomi
1,441
1,433–1,448
62 ernie-5.0-0110Baidu
1,441
1,433–1,448
64 Kimi K2.5Moonshot AI
1,441
1,435–1,446
64 Grok 4.3xAI
1,440
1,433–1,446
64 DeepSeek V4 Flash 0423DeepSeek
1,439
1,432–1,445
64 DeepSeek V3.1 TerminusDeepSeek
1,423
1,401–1,445
65 Qwen3.8 27BAlibaba
1,434
1,423–1,445
65 Grok 4.7 (xhigh)xAI
1,424
1,403–1,445
67 Mistral Medium 3.5Mistral
1,430
1,417–1,443
69 Gemini 2.5 ProGoogle
1,437
1,433–1,442
69 amazon-nova-experimental-chat-26-01-10Amazon
1,420
1,398–1,442
69 hunyuan-vision-1.5-thinkingTencent
1,415
1,388–1,442
71 deepseek-v4-flash-preview (high reasoning)DeepSeek
1,434
1,427–1,441
71 longcat-flash-chat-2602-expMeituan
1,433
1,424–1,441
71 gpt-4.5-preview-2025-02-27OpenAI
1,426
1,410–1,441
73 Kimi K2.5Moonshot AI
1,426
1,411–1,441
81 Qwen3 235B A22B Instruct 2507Alibaba
1,432
1,427–1,437
86 DeepSeek V3.2 ExpDeepSeek
1,422
1,409–1,434
89 o3OpenAI
1,426
1,420–1,433
91 Qwen3 MaxAlibaba
1,419
1,405–1,433
98 nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA
1,418
1,405–1,431
98 DeepSeek V3.1DeepSeek
1,417
1,404–1,431
98 longcat-flash-chatMeituan
1,417
1,405–1,430
98 ernie-5.0-preview-1022Baidu
1,412
1,394–1,431
99 MiniMax M2.7MiniMax
1,423
1,417–1,429
99 DeepSeek V3.2DeepSeek
1,423
1,416–1,430
99 Qwen3.5-122B-A10BAlibaba
1,422
1,413–1,430
100 DeepSeek V3.2DeepSeek
1,422
1,415–1,428
103 Hy3 previewTencent
1,411
1,395–1,427
104 kimi-k2-thinking-turboMoonshot AI
1,421
1,415–1,427
104 Gemini 3.1 Flash Lite PreviewGoogle
1,421
1,414–1,427
105 DeepSeek V3.1DeepSeek
1,414
1,402–1,426
105 amazon-nova-experimental-chat-12-10Amazon
1,402
1,379–1,425
106 Claude Haiku 4.5Anthropic
1,420
1,415–1,424
106 grok-4-1-fast-reasoningxAI
1,417
1,411–1,423
107 GPT-4.1OpenAI
1,415
1,408–1,422
107 Qwen3 235B A22BAlibaba
1,414
1,406–1,423
107 GPT-5 (high)OpenAI
1,413
1,405–1,422
107 GLM 4.5Z.ai
1,412
1,403–1,421
107 Qwen3 Next 80B A3B InstructAlibaba
1,411
1,402–1,421
107 DeepSeek V3.2 ExpDeepSeek
1,406
1,392–1,420
107 hunyuan-turbos-20250416Tencent
1,406
1,390–1,422
108 GLM 4.6Z.ai
1,412
1,404–1,420
108 claude-opus-4 (thinking-16k reasoning)Anthropic
1,409
1,401–1,418
108 Kimi K2 0711Moonshot AI
1,409
1,400–1,418
108 R1 0528DeepSeek
1,407
1,395–1,418
108 Qwen3 235B A22B Thinking 2507Alibaba
1,404
1,389–1,419
108 grok-4-fast-chatxAI
1,401
1,383–1,418
108 DeepSeek V3.1 TerminusDeepSeek
1,397
1,375–1,418
110 Qwen3.5-27BAlibaba
1,408
1,400–1,416
110 Inkling SmallThinkingmachines
1,408
1,398–1,417
110 Kimi K2 0905Moonshot AI
1,404
1,391–1,417
110 Gemma 3 12BGoogle
1,386
1,356–1,416
112 Mistral Large 3 2512Mistral
1,409
1,404–1,415
117 Mistral Medium 3.1Mistral
1,407
1,402–1,412
117 GPT-5.4 Nano (high)OpenAI
1,405
1,398–1,412
117 claude-opus-4Anthropic
1,403
1,396–1,411
117 gemini-2.5-flash-preview-09-2025Google
1,403
1,395–1,411
117 grok-3-preview-02-24xAI
1,403
1,393–1,413
117 grok-4-fast-reasoningxAI
1,403
1,393–1,413
119 Qwen3.5-35B-A3BAlibaba
1,403
1,395–1,411
121 Qwen3.5-FlashAlibaba
1,403
1,397–1,409
122 MiniMax M2.5MiniMax
1,400
1,393–1,407
122 Qwen3 30B A3B Instruct 2507Alibaba
1,397
1,388–1,407
122 Qwen3 VL 235B A22B ThinkingAlibaba
1,392
1,378–1,407
130 Gemini 2.5 FlashGoogle
1,399
1,395–1,404
132 grok-4-0709xAI
1,395
1,388–1,403
134 R1DeepSeek
1,388
1,374–1,402
137 Qwen3 Coder 480B A35BAlibaba
1,391
1,382–1,401
137 mimo-v2-flash (thinking reasoning)Xiaomi
1,388
1,376–1,401
137 hunyuan-turbos-20250226Tencent
1,368
1,337–1,400
139 mimo-v2-flash (no reasoning)Xiaomi
1,393
1,386–1,400
142 Step 3.5 FlashStepfun
1,390
1,384–1,397
142 DeepSeek V3 0324DeepSeek
1,390
1,382–1,397
142 Solar Pro 4Upstage
1,386
1,374–1,398
143 Mistral Medium 3Mistral
1,387
1,378–1,396
147 Claude Sonnet 4Anthropic
1,387
1,379–1,395
147 GLM 4.6VZ.ai
1,370
1,345–1,395
150 amazon-nova-experimental-chat-10-09Amazon
1,370
1,346–1,394
153 minimax-m2.1-previewMiniMax
1,382
1,371–1,393
156 trinity-large-previewArcee Ai
1,381
1,373–1,389
156 Claude Sonnet 4Anthropic
1,381
1,372–1,389
156 GPT-5 Mini (high)OpenAI
1,381
1,372–1,390
160 GPT-4.1 MiniOpenAI
1,379
1,371–1,387
160 o4 MiniOpenAI
1,379
1,372–1,387
160 hunyuan-t1-20250711Tencent
1,366
1,345–1,388
161 gemini-2.5-flash-lite-preview-09-2025 (no reasoning)Google
1,378
1,371–1,385
161 Gemma 3 27BGoogle
1,377
1,369–1,385
161 amazon-nova-experimental-chat-11-10Amazon
1,377
1,368–1,385
164 o1OpenAI
1,370
1,358–1,382
164 intellect-3Primeintellect
1,363
1,345–1,382
164 hunyuan-turbo-0110Tencent
1,348
1,315–1,382
165 GLM 4.5 AirZ.ai
1,372
1,364–1,380
165 Qwen3 235B A22BAlibaba
1,370
1,361–1,380
165 GLM 4.7 FlashZ.ai
1,368
1,356–1,380
167 qwen2.5-maxAlibaba
1,369
1,359–1,378
168 Qwen3 Next 80B A3B ThinkingAlibaba
1,367
1,355–1,378
169 claude-3-7-sonnet-20250219Anthropic
1,368
1,359–1,376
169 llama-3.1-nemotron-ultra-253b-v1NVIDIA
1,342
1,308–1,377
170 Trinity Large ThinkingArcee Ai
1,367
1,359–1,375
170 amazon-nova-experimental-chat-10-20Amazon
1,363
1,350–1,376
171 step-3Stepfun
1,358
1,341–1,375
173 Mistral Small 3.2 24BMistral
1,363
1,352–1,374
175 claude-3-7-sonnet-20250219 (thinking-32k reasoning)Anthropic
1,363
1,355–1,372
178 gemini-2.5-flash-lite-preview-06-17 (thinking reasoning)Google
1,363
1,354–1,371
180 gemini-2.0-flash-lite-preview-02-05Google
1,359
1,347–1,370
181 glm-4-plus-0111Z.ai
1,345
1,321–1,369
182 nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA
1,352
1,339–1,365
182 Nova 2 LiteAmazon
1,351
1,339–1,364
182 Nemotron 3 SuperNVIDIA
1,350
1,335–1,365
182 MiniMax M2MiniMax
1,348
1,331–1,364
182 Qwen-PlusAlibaba
1,342
1,318–1,365
182 Qwen3 32BAlibaba
1,340
1,314–1,366
182 Mercury 2Inception
1,340
1,316–1,364
183 o1-previewOpenAI
1,353
1,343–1,364
183 olmo-3.1-32b-instructAi2
1,350
1,337–1,363
183 DeepSeek V3DeepSeek
1,350
1,338–1,362
183 o3 Mini HighOpenAI
1,349
1,336–1,363
183 ling-flash-2.0Ant Group
1,347
1,331–1,363
183 GLM 4.5VZ.ai
1,342
1,323–1,362
184 claude-3-5-sonnet-20241022Anthropic
1,354
1,348–1,361
184 gpt-oss-120bOpenAI
1,351
1,343–1,360
184 MiniMax M1MiniMax
1,351
1,343–1,359
184 Gemma 3 4BGoogle
1,330
1,300–1,360
185 grok-3-mini-betaxAI
1,349
1,338–1,359
188 Command ACohere
1,351
1,345–1,358
189 gemini-2.0-flash-001Google
1,348
1,339–1,356
189 grok-3-mini (high reasoning)xAI
1,344
1,333–1,356
190 granite-4.2-30bIBM
1,331
1,307–1,356
193 GPT-5 Nano (high)OpenAI
1,339
1,323–1,354
193 nvidia-llama-3.3-nemotron-super-49b-v1.5NVIDIA
1,329
1,306–1,352
193 mercuryInception
1,321
1,289–1,353
193 llama-3.3-nemotron-49b-super-v1NVIDIA
1,319
1,285–1,354
196 qwq-32bAlibaba
1,337
1,327–1,347
202 GPT-4.1 NanoOpenAI
1,321
1,299–1,343
205 ring-flash-2.0Ant Group
1,326
1,309–1,342
206 gemini-1.5-pro-002Google
1,331
1,323–1,339
206 Qwen3 30B A3BAlibaba
1,330
1,320–1,339
206 step-1o-turbo-202506Stepfun
1,324
1,309–1,340
212 gpt-oss-20bOpenAI
1,323
1,309–1,337
213 step-2-16k-exp-202412Stepfun
1,312
1,287–1,336
214 o3 MiniOpenAI
1,328
1,321–1,335
216 qwen2.5-plus-1127Alibaba
1,315
1,298–1,332
218 GPT-4o (2024-05-13)OpenAI
1,322
1,314–1,329
218 claude-3-5-sonnet-20240620Anthropic
1,321
1,313–1,329
218 glm-4-plusZ.ai
1,319
1,308–1,330
218 yi-lightning01 Ai
1,318
1,307–1,330
218 gemma-3n-e4b-itGoogle
1,317
1,306–1,328
218 Nemotron 3 Nano 30B A3BNVIDIA
1,317
1,306–1,328
218 hunyuan-standard-2025-02-10Tencent
1,300
1,272–1,329
219 o1-miniOpenAI
1,319
1,310–1,327
219 Llama 4 MaverickMeta
1,317
1,309–1,325
219 Llama 4 ScoutMeta
1,316
1,307–1,325
219 gemini-advanced-0514Google
1,314
1,303–1,324
219 olmo-3-32b-thinkAi2
1,308
1,290–1,326
219 deepseek-v2.5-1210DeepSeek
1,306
1,284–1,327
222 claude-3-5-haiku-20241022Anthropic
1,315
1,308–1,322
222 grok-2-2024-08-13xAI
1,315
1,307–1,323
222 llama-3.1-405b-instruct-fp8Meta
1,314
1,306–1,323
222 llama-3.1-405b-instruct-bf16Meta
1,313
1,304–1,322
223 athene-v2-chatNexusflow
1,310
1,298–1,321
224 hunyuan-large-2025-02-10Tencent
1,290
1,259–1,320
225 gemini-1.5-pro-001Google
1,311
1,302–1,320
225 GPT-4o-mini (2024-07-18)OpenAI
1,311
1,303–1,319
225 qwen-max-0919Alibaba
1,306
1,293–1,319
225 llama-3.1-nemotron-51b-instructNVIDIA
1,291
1,264–1,319
226 granite-4.1-8bIBM
1,293
1,269–1,317
228 llama-3.1-nemotron-70b-instructNVIDIA
1,295
1,276–1,314
228 Granite 4.2 8BIBM
1,290
1,265–1,315
231 claude-3-opus-20240229Anthropic
1,305
1,298–1,312
231 Llama 3.3 70B InstructMeta
1,304
1,296–1,311
231 GPT-4o (2024-08-06)OpenAI
1,302
1,293–1,311
231 deepseek-v2.5DeepSeek
1,300
1,289–1,312
231 athene-70b-0725Nexusflow
1,298
1,285–1,312
232 grok-2-mini-2024-08-13xAI
1,301
1,293–1,309
232 granite-4.2-3bIBM
1,284
1,258–1,310
236 Qwen2.5 72B InstructAlibaba
1,299
1,290–1,309
237 gemini-1.5-flash-002Google
1,298
1,289–1,308
237 llama-3.1-tulu-3-70bAi2
1,276
1,244–1,308
247 Mistral Small 3.1 24BMistral
1,297
1,288–1,306
247 mistral-large-2411Mistral
1,294
1,283–1,305
247 magistral-medium-2506Mistral
1,292
1,278–1,305
247 Qwen2.5 Coder 32B InstructAlibaba
1,283
1,261–1,305
251 GPT-4 TurboOpenAI
1,293
1,284–1,301
251 gemma-2-9b-it-simpoPrinceton Nlp
1,284
1,267–1,302
251 reka-core-20240904Rekaai
1,280
1,261–1,300
252 Mistral Large 2407Mistral
1,290
1,281–1,300
252 hunyuan-large-visionTencent
1,278
1,257–1,299
256 olmo-3.1-32b-thinkAi2
1,280
1,264–1,296
257 Llama 3.1 70B InstructMeta
1,287
1,279–1,296
257 gemini-1.5-flash-001Google
1,284
1,275–1,293
260 gpt-4-0125-previewOpenAI
1,283
1,274–1,292
260 Nova Pro 1.0Amazon
1,279
1,268–1,290
260 ibm-granite-h-smallIBM
1,272
1,252–1,291
266 gpt-4-1106-previewOpenAI
1,279
1,271–1,288
266 Command R+ (08-2024)Cohere
1,271
1,254–1,288
267 Gemma 2 27BGoogle
1,278
1,271–1,286
268 reka-flash-20240904Rekaai
1,266
1,247–1,285
272 Nova Lite 1.0Amazon
1,269
1,257–1,282
272 jamba-1.5-largeAI21 Labs
1,264
1,246–1,283
274 c4ai-aya-expanse-32bCohere
1,268
1,257–1,279
276 Mistral Small 3Mistral
1,259
1,244–1,275
276 llama-3.1-tulu-3-8bAi2
1,244
1,212–1,276
279 nemotron-4-340b-instructNVIDIA
1,258
1,245–1,271
281 claude-3-sonnet-20240229Anthropic
1,261
1,252–1,270
281 gemma-2-9b-itGoogle
1,261
1,252–1,269
282 command-r-plusCohere
1,259
1,250–1,269
282 Phi 4Microsoft
1,256
1,244–1,268
283 olmo-2-0325-32b-instructAi2
1,236
1,204–1,267
285 gemini-1.5-flash-8b-001Google
1,255
1,245–1,265
285 deepseek-coder-v2DeepSeek
1,250
1,236–1,264
287 glm-4-0520Z.ai
1,245
1,228–1,262
290 ministral-8b-2410Mistral
1,235
1,212–1,259
290 granite-3.1-8b-instructIBM
1,225
1,193–1,258
291 llama-3-70b-instructMeta
1,249
1,241–1,257
294 claude-3-haiku-20240307Anthropic
1,248
1,240–1,256
294 gpt-4-0314OpenAI
1,245
1,234–1,256
294 hunyuan-standard-256kTencent
1,224
1,193–1,255
300 Nova Micro 1.0Amazon
1,233
1,220–1,247
300 Command R (08-2024)Cohere
1,229
1,211–1,246
301 c4ai-aya-expanse-8bCohere
1,228
1,210–1,246
304 gemini-pro-dev-apiGoogle
1,227
1,210–1,244
306 jamba-1.5-miniAI21 Labs
1,223
1,205–1,242
306 granite-3.1-2b-instructIBM
1,213
1,184–1,243
307 gpt-4-0613OpenAI
1,231
1,222–1,241
307 reka-flash-21b-20240226-onlineRekaai
1,224
1,209–1,240
308 qwen2-72b-instructAlibaba
1,227
1,217–1,238
310 command-rCohere
1,223
1,213–1,234
310 mistral-large-2402Mistral
1,220
1,210–1,230
310 qwen1.5-110b-chatAlibaba
1,219
1,207–1,232
311 reka-flash-21b-20240226Rekaai
1,213
1,200–1,226
312 Mixtral 8x22B InstructMistral
1,211
1,201–1,221
313 Llama 3.1 8B InstructMeta
1,210
1,201–1,219
313 mistral-mediumMistral
1,206
1,194–1,219
313 qwen1.5-72b-chatAlibaba
1,206
1,194–1,217
314 llama-3-8b-instructMeta
1,205
1,196–1,214
318 zephyr-orpo-141b-A35b-v0.1Huggingface
1,183
1,155–1,210
322 gpt-3.5-turbo-0125OpenAI
1,198
1,189–1,208
322 yi-1.5-34b-chat01 Ai
1,195
1,183–1,208
322 llama2-70b-steerlm-chatNVIDIA
1,172
1,137–1,207
323 gemini-proGoogle
1,177
1,147–1,207
329 qwen1.5-32b-chatAlibaba
1,182
1,169–1,196
329 wizardlm-70bMicrosoft
1,171
1,147–1,195
333 gemma-2-2b-itGoogle
1,181
1,172–1,190
333 phi-3-medium-4k-instructMicrosoft
1,179
1,166–1,191
333 openchat-3.5-0106Openchat
1,171
1,153–1,189
333 tulu-2-dpo-70bAi2
1,165
1,140–1,191
334 mixtral-8x7b-instruct-v0.1Mistral
1,177
1,168–1,187
334 dbrx-instruct-previewDatabricks
1,174
1,161–1,187
334 qwen1.5-14b-chatAlibaba
1,170
1,154–1,186
334 yi-34b-chat01 Ai
1,169
1,153–1,186
334 starling-lm-7b-betaNexusflow
1,169
1,153–1,186
334 deepseek-llm-67b-chatDeepSeek
1,160
1,132–1,188
334 nous-hermes-2-mixtral-8x7b-dpoNousresearch
1,151
1,117–1,186
335 gemma-1.1-7b-itGoogle
1,170
1,157–1,183
335 internlm2_5-20b-chatShanghai Ai Lab
1,167
1,150–1,184
336 llama-2-70b-chatMeta
1,160
1,148–1,172
336 phi-3-small-8k-instructMicrosoft
1,159
1,145–1,173
336 starling-lm-7b-alphaBerkeley
1,158
1,138–1,179
336 granite-3.0-8b-instructIBM
1,150
1,127–1,172
336 qwen1.5-7b-chatAlibaba
1,148
1,120–1,176
337 gpt-3.5-turbo-1106OpenAI
1,150
1,131–1,169
337 openchat-3.5Openchat
1,146
1,122–1,169
340 vicuna-33bLmsys
1,150
1,135–1,166
340 Llama 3.2 3B InstructMeta
1,146
1,126–1,166
341 granite-3.0-2b-instructIBM
1,136
1,115–1,158
341 openhermes-2.5-mistral-7bTeknium
1,131
1,101–1,160
341 solar-10.7b-instruct-v1.0Upstage
1,125
1,091–1,159
341 mpt-30b-chatMosaicml
1,121
1,083–1,158
347 snowflake-arctic-instructSnowflake
1,139
1,126–1,153
347 llama-2-13b-chatMeta
1,134
1,118–1,150
347 codellama-34b-instructMeta
1,128
1,103–1,152
351 mistral-7b-instruct-v0.2Mistral
1,130
1,114–1,145
351 qwen-14b-chatAlibaba
1,118
1,090–1,146
352 gemma-7b-itGoogle
1,123
1,101–1,145
353 qwq-32b-previewAlibaba
1,108
1,076–1,140
356 vicuna-13bLmsys
1,118
1,101–1,135
358 wizardlm-13bMicrosoft
1,107
1,082–1,131
358 gemma-2b-itGoogle
1,101
1,073–1,129
361 phi-3-mini-4k-instructMicrosoft
1,112
1,098–1,125
361 llama-2-7b-chatMeta
1,105
1,087–1,122
362 phi-3-mini-4k-instruct-june-2024Microsoft
1,104
1,087–1,121
363 gemma-1.1-2b-itGoogle
1,099
1,080–1,118
364 guanaco-33bTimdettmers
1,080
1,042–1,118
365 palm-2Google
1,092
1,067–1,116
367 phi-3-mini-128k-instructMicrosoft
1,098
1,082–1,114
367 zephyr-7b-betaHuggingface
1,094
1,073–1,114
367 olmo-7b-instructAi2
1,086
1,060–1,113
367 qwen1.5-4b-chatAlibaba
1,084
1,060–1,108
367 vicuna-7bLmsys
1,084
1,057–1,111
367 stripedhyena-nous-7bTogether
1,081
1,051–1,110
367 smollm2-1.7b-instructHuggingface
1,065
1,022–1,108
372 Llama 3.2 1B InstructMeta
1,070
1,050–1,091
372 mistral-7b-instructMistral
1,070
1,046–1,094
380 koala-13bBerkeley
1,048
1,019–1,077
381 chatglm3-6bZ.ai
1,044
1,012–1,075
390 RWKV-4-Raven-14BRwkv
1,009
975–1,042
390 mpt-7b-chatMosaicml
1,006
969–1,042
390 chatglm2-6bZ.ai
1,005
964–1,046
391 fastchat-t5-3bLmsys
1,000
962–1,038
393 alpaca-13bStanford
980
946–1,013
394 oasst-pythia-12bOpenassistant
960
930–991
394 chatglm-6bZ.ai
951
914–989
398 stablelm-tuned-alpha-7bStabilityai
906
866–946
399 dolly-v2-12bDatabricks
897
854–940

Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.

What it measures

Human preference on business, management and finance prompts.

What it does not measure

Not accuracy or correctness: it ranks which answer voters preferred, with answer length and formatting controlled for.

Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.