1,501
1,495–1,507
Benchmarks / Arena (formerly LMArena)
Reported by Arena (formerly LMArena)
Arena (formerly LMArena)
Human preference combined with labels of whether each answer's checkable claims were true (factuality weighted 25% by default).
- Results dated
- 25 Sep 2026
- Models
- 177
- Unit
- Arena rating
Full results
| # | Model | Arena Text factuality: overall · 95% range Arena rating, higher is better |
|---|---|---|
| 1 | Claude Fable 5.1 (max)Anthropic | |
| 1 | Claude Opus 4.6 (high)Anthropic |
1,494 1,491–1,497 |
| 2 | Claude Opus 5 (max)Anthropic |
1,488 1,484–1,493 |
| 2 | Muse Spark 1.2Meta |
1,484 1,475–1,493 |
| 3 | Claude Opus 4.6Anthropic |
1,488 1,486–1,491 |
| 3 | GPT-5.5 (high)OpenAI |
1,486 1,483–1,489 |
| 3 | GPT-5.4 (high)OpenAI |
1,485 1,482–1,488 |
| 3 | Claude Fable 5 (high)Anthropic |
1,483 1,480–1,487 |
| 3 | MiMo-V2.6-ProXiaomi |
1,483 1,475–1,491 |
| 3 | qwen3.7-max-previewAlibaba |
1,481 1,472–1,489 |
| 4 | GPT-5.5OpenAI |
1,482 1,480–1,485 |
| 4 | gemini-3-proGoogle |
1,481 1,478–1,485 |
| 4 | Muse Spark 1.3 (max)Meta |
1,479 1,473–1,485 |
| 6 | Gemini 3.7 Flash (high)Google |
1,477 1,473–1,482 |
| 6 | Gemini 3.8 Flash (high)Google |
1,477 1,473–1,482 |
| 7 | Claude Opus 5 (high)Anthropic |
1,477 1,474–1,480 |
| 7 | Claude Opus 4.7 (high)Anthropic |
1,477 1,474–1,480 |
| 9 | Gemini 3.5 Flash (high)Google |
1,476 1,472–1,479 |
| 9 | GPT-5.6 Sol (xhigh)OpenAI |
1,476 1,472–1,479 |
| 9 | GPT-5.4OpenAI |
1,475 1,473–1,478 |
| 9 | Claude Opus 4.7Anthropic |
1,475 1,472–1,479 |
| 9 | qwen3.5-max-previewAlibaba |
1,475 1,470–1,479 |
| 10 | Kimi K3 (max)Moonshot AI |
1,472 1,468–1,476 |
| 10 | DeepSeek V4.1 Flash (max)DeepSeek |
1,471 1,464–1,478 |
| 10 | Qwen3.8 Max (0902)Alibaba |
1,471 1,466–1,475 |
| 13 | Gemini 3.1 Pro PreviewGoogle |
1,472 1,469–1,474 |
| 14 | Gemini 3.6 Flash (high)Google |
1,470 1,466–1,474 |
| 15 | GLM 5.3 (max)Z.ai |
1,468 1,463–1,473 |
| 15 | muse-sparkMeta |
1,467 1,462–1,473 |
| 18 | Claude Opus 4.8 (high)Anthropic |
1,469 1,466–1,472 |
| 22 | gemini-3-flashGoogle |
1,468 1,464–1,472 |
| 22 | GLM 5.3 FlashZ.ai |
1,467 1,462–1,471 |
| 22 | GPT-6 Astra (max)OpenAI |
1,465 1,458–1,471 |
| 23 | GPT-5.6 Terra (xhigh)OpenAI |
1,467 1,463–1,470 |
| 24 | Gemini 3.5 Flash (medium)Google |
1,466 1,462–1,469 |
| 24 | MiMo-V2.5-ProXiaomi |
1,465 1,462–1,468 |
| 24 | Grok 4.5xAI |
1,465 1,462–1,469 |
| 25 | Claude Opus 4.8Anthropic |
1,465 1,461–1,468 |
| 25 | Muse Spark 1.1Meta |
1,463 1,459–1,467 |
| 25 | MiMo-V2.6-FlashXiaomi |
1,459 1,451–1,468 |
| 26 | GLM 5.2 (max)Z.ai |
1,463 1,459–1,466 |
| 28 | Gemini 2.5 ProGoogle |
1,462 1,459–1,465 |
| 28 | GPT-5.6 Luna (xhigh)OpenAI |
1,461 1,458–1,465 |
| 29 | Claude Sonnet 4.6Anthropic |
1,461 1,458–1,464 |
| 32 | Claude Opus 4.5Anthropic |
1,459 1,456–1,463 |
| 35 | Claude Opus 4.5Anthropic |
1,459 1,456–1,462 |
| 35 | GPT-5.1 (high)OpenAI |
1,459 1,455–1,462 |
| 38 | grok-4.20-multi-agent-beta-0309xAI |
1,457 1,454–1,460 |
| 38 | GLM 5.1Z.ai |
1,456 1,453–1,460 |
| 38 | Kimi K2.6Moonshot AI |
1,456 1,452–1,460 |
| 38 | ernie-5.1Baidu |
1,456 1,452–1,460 |
| 38 | Qwen3.6 Max PreviewAlibaba |
1,452 1,445–1,460 |
| 38 | amazon-nova-experimental-chat-26-02-10Amazon |
1,452 1,443–1,460 |
| 41 | grok-4.20-beta-0309-reasoningxAI |
1,456 1,453–1,459 |
| 41 | DeepSeek V4 Pro 0813DeepSeek |
1,453 1,448–1,459 |
| 43 | DeepSeek V4 Pro 0423DeepSeek |
1,455 1,452–1,458 |
| 44 | grok-4.20-beta1xAI |
1,453 1,448–1,457 |
| 44 | Gemma 4 31BGoogle |
1,450 1,443–1,457 |
| 44 | DeepSeek V3.2 ExpDeepSeek |
1,446 1,435–1,457 |
| 45 | Qwen3.7 PlusAlibaba |
1,453 1,449–1,456 |
| 46 | Claude Sonnet 5 (high)Anthropic |
1,452 1,448–1,455 |
| 46 | InklingThinkingmachines |
1,452 1,448–1,455 |
| 46 | GLM 5Z.ai |
1,452 1,448–1,456 |
| 47 | gemini-3-flash (minimal reasoning)Google |
1,451 1,449–1,454 |
| 47 | gpt-5.2-chat-latest-20260210OpenAI |
1,451 1,447–1,455 |
| 48 | Grok 4.6 (high)xAI |
1,449 1,445–1,454 |
| 49 | Hy3Tencent |
1,447 1,441–1,453 |
| 53 | Gemini 3.5 Flash LiteGoogle |
1,448 1,444–1,451 |
| 53 | Gemma 4 26B A4BGoogle |
1,445 1,438–1,452 |
| 54 | Claude Sonnet 4.5Anthropic |
1,449 1,446–1,451 |
| 54 | deepseek-v4-pro-preview (high reasoning)DeepSeek |
1,447 1,444–1,451 |
| 54 | GPT-5.4 Mini (high)OpenAI |
1,447 1,444–1,450 |
| 54 | GLM 4.6Z.ai |
1,447 1,443–1,451 |
| 54 | Claude Sonnet 4.5Anthropic |
1,447 1,444–1,449 |
| 54 | GLM 4.7Z.ai |
1,444 1,438–1,450 |
| 55 | ernie-5.0-0110Baidu |
1,445 1,442–1,449 |
| 58 | ernie-5.0-preview-1203Baidu |
1,442 1,436–1,448 |
| 58 | qwen3-max-previewAlibaba |
1,442 1,435–1,448 |
| 58 | ernie-5.0-preview-1022Baidu |
1,440 1,431–1,448 |
| 60 | Kimi K2.5Moonshot AI |
1,445 1,442–1,448 |
| 60 | GPT-5.1OpenAI |
1,445 1,441–1,448 |
| 61 | Qwen3.5 397B A17BAlibaba |
1,445 1,442–1,447 |
| 61 | chatgpt-4o-latest-20250326OpenAI |
1,444 1,441–1,447 |
| 61 | gpt-5.5-instantOpenAI |
1,443 1,439–1,448 |
| 61 | mimo-v2-proXiaomi |
1,443 1,439–1,448 |
| 63 | GPT-5.2OpenAI |
1,442 1,440–1,445 |
| 63 | GLM 5V TurboZ.ai |
1,440 1,435–1,446 |
| 65 | GPT-5.2 (high)OpenAI |
1,442 1,438–1,445 |
| 69 | Qwen3.8 27BAlibaba |
1,439 1,434–1,443 |
| 72 | DeepSeek V4 Flash 0423DeepSeek |
1,439 1,436–1,443 |
| 72 | MiMo-V2.5Xiaomi |
1,439 1,435–1,442 |
| 74 | DeepSeek V3.2 ExpDeepSeek |
1,436 1,430–1,442 |
| 77 | Qwen3.6 PlusAlibaba |
1,438 1,434–1,441 |
| 77 | mimo-v2-omniXiaomi |
1,436 1,431–1,441 |
| 78 | DeepSeek V3.2DeepSeek |
1,437 1,434–1,440 |
| 80 | Gemini 2.5 FlashGoogle |
1,437 1,434–1,439 |
| 81 | Claude Opus 4.1Anthropic |
1,435 1,432–1,439 |
| 84 | MiniMax M3MiniMax |
1,434 1,431–1,437 |
| 84 | grok-4.1-thinkingxAI |
1,434 1,431–1,437 |
| 84 | deepseek-v4-flash-preview (high reasoning)DeepSeek |
1,434 1,430–1,437 |
| 84 | Mistral Large 3 2512Mistral |
1,434 1,431–1,436 |
| 84 | Claude Opus 4.1Anthropic |
1,433 1,429–1,437 |
| 84 | Gemini 3.1 Flash Lite PreviewGoogle |
1,433 1,430–1,436 |
| 84 | DeepSeek V3.2DeepSeek |
1,433 1,429–1,436 |
| 84 | nvidia-nemotron-3-ultra-550b-a55b-nvfp4NVIDIA |
1,430 1,424–1,437 |
| 84 | Mistral Medium 3.5Mistral |
1,430 1,424–1,436 |
| 88 | Kimi K2.5Moonshot AI |
1,429 1,423–1,435 |
| 92 | Qwen3 235B A22B Instruct 2507Alibaba |
1,431 1,429–1,434 |
| 92 | grok-4.1xAI |
1,431 1,428–1,434 |
| 93 | amazon-nova-experimental-chat-12-10Amazon |
1,424 1,415–1,434 |
| 94 | longcat-flash-chat-2602-expMeituan |
1,429 1,425–1,433 |
| 94 | Qwen3 VL 235B A22B InstructAlibaba |
1,414 1,396–1,432 |
| 95 | Mistral Medium 3.1Mistral |
1,429 1,426–1,431 |
| 95 | Qwen3.5-122B-A10BAlibaba |
1,428 1,424–1,432 |
| 95 | GPT-6 Sol (max)OpenAI |
1,424 1,416–1,432 |
| 100 | Grok 4.3xAI |
1,428 1,425–1,431 |
| 103 | GPT-6 Luna (max)OpenAI |
1,422 1,414–1,430 |
| 105 | Inkling SmallThinkingmachines |
1,425 1,421–1,429 |
| 105 | gemini-2.5-flash-preview-09-2025Google |
1,425 1,420–1,429 |
| 105 | Grok 4.7 (xhigh)xAI |
1,420 1,412–1,429 |
| 106 | gpt-5-chatOpenAI |
1,422 1,415–1,428 |
| 107 | GPT-5 (high)OpenAI |
1,421 1,414–1,428 |
| 108 | kimi-k2-thinking-turboMoonshot AI |
1,423 1,420–1,426 |
| 108 | MiniMax M2.7MiniMax |
1,422 1,419–1,425 |
| 108 | mimo-v2-flash (no reasoning)Xiaomi |
1,422 1,419–1,425 |
| 108 | Qwen3 Next 80B A3B InstructAlibaba |
1,419 1,412–1,425 |
| 109 | grok-4-0709xAI |
1,419 1,413–1,425 |
| 113 | Qwen3.5-27BAlibaba |
1,420 1,416–1,424 |
| 113 | grok-4-fast-reasoningxAI |
1,417 1,411–1,423 |
| 114 | dola-seed-2.0-proBytedance |
1,419 1,416–1,422 |
| 114 | gpt-5.3-chat-latestOpenAI |
1,419 1,415–1,422 |
| 114 | GPT-5.4 Nano (high)OpenAI |
1,418 1,415–1,421 |
| 117 | Claude Haiku 4.5Anthropic |
1,418 1,416–1,420 |
| 117 | Step 3.5 FlashStepfun |
1,417 1,414–1,420 |
| 117 | Hy3 previewTencent |
1,413 1,406–1,420 |
| 119 | amazon-nova-experimental-chat-11-10Amazon |
1,415 1,411–1,419 |
| 119 | Qwen3.5-FlashAlibaba |
1,414 1,411–1,417 |
| 119 | Kimi K2 0905Moonshot AI |
1,403 1,389–1,418 |
| 119 | Qwen3 Coder 480B A35BAlibaba |
1,401 1,383–1,419 |
| 120 | grok-4-1-fast-reasoningxAI |
1,413 1,410–1,416 |
| 120 | minimax-m2.1-previewMiniMax |
1,411 1,406–1,416 |
| 120 | mimo-v2-flash (thinking reasoning)Xiaomi |
1,410 1,404–1,416 |
| 127 | GPT-4.1OpenAI |
1,408 1,402–1,415 |
| 129 | Solar Pro 4Upstage |
1,409 1,403–1,414 |
| 133 | Qwen3.5-35B-A3BAlibaba |
1,408 1,404–1,411 |
| 133 | o3OpenAI |
1,405 1,398–1,411 |
| 133 | amazon-nova-experimental-chat-26-01-10Amazon |
1,403 1,394–1,411 |
| 136 | gemini-2.5-flash-lite-preview-09-2025 (no reasoning)Google |
1,407 1,404–1,411 |
| 137 | muse-glimmerMeta |
1,401 1,393–1,410 |
| 139 | amazon-nova-experimental-chat-10-20Amazon |
1,399 1,393–1,405 |
| 143 | GLM 4.6VZ.ai |
1,392 1,381–1,402 |
| 144 | GLM 4.5 AirZ.ai |
1,395 1,388–1,402 |
| 144 | GPT-5 Mini (high)OpenAI |
1,394 1,387–1,401 |
| 145 | Nemotron 3 SuperNVIDIA |
1,390 1,383–1,397 |
| 149 | MiniMax M2.5MiniMax |
1,386 1,382–1,389 |
| 149 | gpt-oss-120bOpenAI |
1,385 1,378–1,391 |
| 149 | Gemma 3 27BGoogle |
1,380 1,369–1,391 |
| 152 | Nova 2 LiteAmazon |
1,380 1,374–1,386 |
| 152 | granite-4.2-30bIBM |
1,377 1,368–1,386 |
| 156 | intellect-3Primeintellect |
1,373 1,365–1,381 |
| 156 | MiniMax M1MiniMax |
1,370 1,359–1,381 |
| 156 | o4 MiniOpenAI |
1,368 1,358–1,378 |
| 157 | trinity-large-previewArcee Ai |
1,373 1,369–1,377 |
| 157 | Trinity Large ThinkingArcee Ai |
1,371 1,367–1,375 |
| 157 | GLM 4.7 FlashZ.ai |
1,370 1,365–1,376 |
| 157 | Mercury 2Inception |
1,368 1,359–1,378 |
| 158 | Command ACohere |
1,363 1,357–1,370 |
| 161 | Nemotron 3 Nano 30B A3BNVIDIA |
1,362 1,357–1,367 |
| 161 | MiniMax M2MiniMax |
1,360 1,353–1,367 |
| 162 | nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4NVIDIA |
1,360 1,354–1,366 |
| 171 | Granite 4.2 8BIBM |
1,343 1,333–1,352 |
| 171 | olmo-3.1-32b-instructAi2 |
1,342 1,336–1,348 |
| 171 | granite-4.2-3bIBM |
1,327 1,317–1,337 |
| 173 | olmo-3-32b-thinkAi2 |
1,319 1,312–1,327 |
| 173 | granite-4.1-8bIBM |
1,311 1,302–1,320 |
| 173 | mercuryInception |
1,305 1,292–1,317 |
| 175 | olmo-3.1-32b-thinkAi2 |
1,300 1,294–1,307 |
Models share a rank when their ranges overlap. Results as published by Arena (formerly LMArena); we do not re-run them.
What it measures
Human preference combined with labels of whether each answer's checkable claims were true (factuality weighted 25% by default).
What it does not measure
Not an error rate: claims that cannot be checked on the web are skipped, and preference still carries most of the weight.
Source
Contains data from the Arena Leaderboard Dataset by Arena, licensed under CC BY 4.0. Licence: Creative Commons Attribution 4.0 International.