Benchmarks / BulletBench

Measured by Spring Prompt

BulletBench

When every second of thinking time comes off the clock, which models are fast enough to still make good decisions?

Results dated
1 Oct 2026
Models
23
Unit
ladder Elo
Licence
Spring Prompt original

Lightning: strength against thinking time

Each configuration's median time per move at 10 seconds plus 1 a move. Right of the line, a model thinks longer than the increment it earns and the clock drains.

02004006008001,000 0.1 s1 s10 s Median time per move (log scale) Ladder Elo 1 s increment Inkling Small (no reasoning): 571, 0.6 s Mistral Medium 3.5 (no reasoning): 529, 0.5 s Mistral Medium 3.5: 529, 0.5 s Gemini 3.8 Flash (low reasoning): 197, 1.8 s GPT-5.4 Nano (no reasoning): 197, 1.0 s Claude Haiku 4.5: 33, 1.3 s Claude Sonnet 5.5 (low reasoning): 33, 2.1 s Gemini 3.6 Flash (minimal reasoning): 33, 1.5 s Gemini 3.5 Flash Lite: 892, 0.9 s Gemini 3.1 Flash Lite (minimal reasoning): 780, 0.8 s Gemini 3.5 Flash (minimal reasoning): 727, 1.2 s Seed-2.0-Mini (minimal reasoning): 571, 0.3 s Mistral Small 4 (no reasoning): 571, 0.6 s GPT-5.4 Mini (no reasoning): 571, 0.9 s Gemini 3.5 Flash Lite Gemini 3.1 Flash Lite (minimal reasoning) Gemini 3.5 Flash (minimal reasoning) Seed-2.0-Mini (minimal reasoning) Mistral Small 4 (no reasoning) GPT-5.4 Mini (no reasoning)

Full results

BulletBench Bullet 60s: ladder Elo, ladder Elo, higher is better
#ModelLightning 10+1 · 95% range
ladder Elo, higher is better
Lightning 10+1
ladder Elo
Blitz 3+2
ladder Elo
Move time
milliseconds
Lost on time
% of games
Cost per game
US dollars
1 Gemini 3.8 Flash (low reasoning)Google
1,068
888–1,241
197–1.8 s83.3%$0.0041
1 Gemini 3.1 Flash Lite (minimal reasoning)Google
912
697–1,087
780–0.8 s0.0%$0.0058
1 Gemini 3.5 Flash (minimal reasoning)Google
810
582–1,006
727–1.2 s33.3%$0.0213
1 Gemini 3.5 Flash LiteGoogle
780
586–956
8927070.9 s0.0%$0.0070
2 Gemini 3.6 Flash (minimal reasoning)Google
628
429–849
33–1.5 s91.7%$0.0050
2 Mistral Medium 3.5 (no reasoning)Mistral
572
428–708
529–0.5 s0.0%$0.0491
2 Gemini 3.1 Pro Preview (low reasoning)Google
529
329–698
–––––
3 Gemini 3.8 FlashGoogle
529
263–688
–1,126–––
3 Inkling Small (no reasoning)Thinkingmachines
529
393–652
571–0.6 s0.0%$0.0077
3 Claude Haiku 4.5Anthropic
445
135–626
334911.3 s83.3%$0.0095
3 GPT-6 Sol (no reasoning)OpenAI
445
215–639
–––––
5 Seed-2.0-Mini (minimal reasoning)Bytedance
453
355–538
571–0.3 s0.0%$0.0019
5 Mistral Medium 3.5Mistral
385
276–464
5295550.5 s0.0%$0.0297
5 Mistral Small 4 (no reasoning)Mistral
367
126–564
571–0.6 s0.0%$0.0041
5 GPT-6 Astra (low reasoning)OpenAI
323
0–528
–––––
5 GPT-6 Luna (no reasoning)OpenAI
249
0–453
–––––
5 GPT-5.4 Mini (no reasoning)OpenAI
197
0–445
571–0.9 s0.0%$0.0136
5 GPT-6 AstraOpenAI
197
0–439
–839–––
11 Muse Spark 1.3 (minimal reasoning)Meta
33
0–270
–––––
11 Kimi K3 (low reasoning)Moonshot AI
33
0–270
–––––
11 GPT-5.4 Nano (no reasoning)OpenAI
33
0–273
197–1.0 s75.0%$0.0025
11 GLM 5.3 (low reasoning)Z.ai
33
0–270
–––––
11 GLM 5.3Z.ai
33
0–270
–––––

Models share a rank when their ranges overlap. Each model runs at its provider's default reasoning setting and, where the provider offers a faster one, again at its fastest setting, listed separately. Blitz 3+2 was run at default settings only.

Too slow for the clock

These configurations lost their first four games on time, so they were stopped there and are not rated for that clock. Being too slow is the result, not a fault.

Bullet 60s

  • Claude Fable 5.1 4.2 s a move
  • Claude Fable 5.1 (low reasoning) 4.5 s a move
  • Claude Opus 5.5 3.1 s a move
  • Claude Opus 5.5 (low reasoning) 3.3 s a move
  • Claude Sonnet 5.5 2.9 s a move
  • Claude Sonnet 5.5 (low reasoning) 2.6 s a move
  • DeepSeek V4 Pro 0423 5.0 s a move
  • DeepSeek V4.1 Flash (low reasoning) 2.4 s a move
  • GLM 4.7 Flash 9.7 s a move
  • GLM 5.3 Flash (low reasoning) 2.2 s a move
  • GPT-6 Luna 5.4 s a move
  • GPT-6 Sol 3.9 s a move
  • Gemini 3.1 Pro Preview 5.0 s a move
  • Grok 4.7 4.6 s a move
  • Grok 4.7 (low reasoning) 5.2 s a move
  • Kimi K3 3.2 s a move
  • MiMo-V2.6-Flash 4.7 s a move
  • Muse Spark 1.3 7.0 s a move
  • Qwen3.8 Max (0902) 3.0 s a move
  • Qwen3.8 Max (0902) (minimal reasoning) 4.7 s a move
  • qwen/qwen3.8-flash 3.8 s a move

Lightning 10+1

  • Claude Fable 5.1 4.4 s a move
  • Claude Fable 5.1 (low reasoning) 4.1 s a move
  • Claude Opus 5.5 3.0 s a move
  • Claude Opus 5.5 (low reasoning) 2.9 s a move
  • Claude Sonnet 5.5 2.1 s a move
  • DeepSeek V4 Pro 0423 6.2 s a move
  • DeepSeek V4.1 Flash (low reasoning) 0.8 s a move
  • GLM 4.7 Flash 4.4 s a move
  • GLM 5.3 1.8 s a move
  • GLM 5.3 (low reasoning) 1.1 s a move
  • GLM 5.3 Flash (low reasoning) 0.9 s a move
  • GPT-6 Astra 2.1 s a move
  • GPT-6 Astra (low reasoning) 2.3 s a move
  • GPT-6 Luna 2.9 s a move
  • GPT-6 Luna (no reasoning) 2.4 s a move
  • GPT-6 Sol 1.7 s a move
  • GPT-6 Sol (no reasoning) 1.7 s a move
  • Gemini 3.1 Pro Preview 2.7 s a move
  • Gemini 3.1 Pro Preview (low reasoning) 2.5 s a move
  • Gemini 3.8 Flash 2.3 s a move
  • Grok 4.7 2.1 s a move
  • Grok 4.7 (low reasoning) 2.1 s a move
  • Kimi K3 1.4 s a move
  • Kimi K3 (low reasoning) 1.7 s a move
  • MiMo-V2.6-Flash 3.2 s a move
  • Muse Spark 1.3 4.6 s a move
  • Muse Spark 1.3 (minimal reasoning) 2.2 s a move
  • Qwen3.8 Max (0902) 3.8 s a move
  • Qwen3.8 Max (0902) (minimal reasoning) 3.9 s a move
  • qwen/qwen3.8-flash 3.0 s a move

Blitz 3+2

  • DeepSeek V4 Pro 0423 7.3 s a move
  • GPT-6 Sol 7.4 s a move
  • Grok 4.7 12.6 s a move
  • Kimi K3 4.0 s a move
  • Muse Spark 1.3 19.4 s a move
  • Qwen3.8 Max (0902) 7.1 s a move

Real games: the clock at Lightning 10+1

Each model's clock after every move of one game. A fast model earns back more than it spends; a slow one runs out within a few moves, whatever the position.

0 s5 s10 s15 s 0481216202428 Move Clock left Won by checkmate after 28 moves Gemini 3.5 Flash Lite Lost on time after 3 moves Claude Opus 5.5
Gemini 3.5 Flash LiteWon by checkmate after 28 moves
  1. e40.6 s10.4 s left
  2. Nf30.9 s10.4 s left
  3. Bc40.6 s10.9 s left
  4. O-O0.9 s10.9 s left
  5. c30.6 s11.4 s left
  6. d40.9 s11.4 s left
  7. Nxe51.0 s11.4 s left
  8. Nxc60.6 s11.8 s left
  9. Qxg40.9 s11.9 s left
  10. Qxc8+0.9 s12.0 s left
  11. … 18 more moves
Claude Opus 5.5Lost on time after 3 moves
  1. e43.5 s7.5 s left
  2. Nf33.5 s5.0 s left
  3. d43.3 s2.6 s left

More from the results

Bullet: strength against thinking time

The same at 60 seconds for the whole game, no increment. A 40-move game leaves 1.5 seconds a move.

05001,0001,500 0.1 s1 s10 s Median time per move (log scale) Ladder Elo 1.5 s a move Gemini 3.1 Pro Preview (low reasoning): 529, 3.1 s Gemini 3.8 Flash: 529, 2.8 s Inkling Small (no reasoning): 529, 0.6 s Claude Haiku 4.5: 445, 1.2 s GPT-6 Sol (no reasoning): 445, 1.6 s Seed-2.0-Mini (minimal reasoning): 453, 0.3 s Mistral Medium 3.5: 385, 0.5 s Mistral Small 4 (no reasoning): 367, 0.6 s GPT-6 Astra (low reasoning): 323, 2.3 s GPT-6 Luna (no reasoning): 249, 1.5 s GPT-5.4 Mini (no reasoning): 197, 0.9 s GPT-6 Astra: 197, 3.0 s Muse Spark 1.3 (minimal reasoning): 33, 4.2 s Kimi K3 (low reasoning): 33, 2.6 s GPT-5.4 Nano (no reasoning): 33, 1.1 s GLM 5.3 (low reasoning): 33, 1.6 s GLM 5.3: 33, 3.6 s Gemini 3.8 Flash (low reasoning): 1,068, 1.8 s Gemini 3.1 Flash Lite (minimal reasoning): 912, 0.8 s Gemini 3.5 Flash (minimal reasoning): 810, 1.2 s Gemini 3.5 Flash Lite: 780, 0.9 s Gemini 3.6 Flash (minimal reasoning): 628, 1.6 s Mistral Medium 3.5 (no reasoning): 572, 0.5 s Gemini 3.8 Flash (low reasoning) Gemini 3.1 Flash Lite (minimal reasoning) Gemini 3.5 Flash (minimal reasoning) Gemini 3.5 Flash Lite Gemini 3.6 Flash (minimal reasoning) Mistral Medium 3.5 (no reasoning)

How games are lost

Share of games lost on time, and moves with no legal reply, by clock.

ModelOn time, LightningOn time, BulletInvalid moves, LightningInvalid moves, Bullet
Gemini 3.5 Flash LiteGoogle0.0%0.0%0.0%0.0%
Gemini 3.1 Flash Lite (minimal reasoning)Google0.0%8.3%0.2%0.0%
Gemini 3.5 Flash (minimal reasoning)Google33.3%25.0%0.6%0.5%
Seed-2.0-Mini (minimal reasoning)Bytedance0.0%0.0%0.8%0.4%
Mistral Small 4 (no reasoning)Mistral0.0%25.0%1.0%0.6%
GPT-5.4 Mini (no reasoning)OpenAI0.0%50.0%0.0%0.0%
Inkling Small (no reasoning)Thinkingmachines0.0%0.0%5.3%7.2%
Mistral Medium 3.5 (no reasoning)Mistral0.0%0.0%0.0%0.4%
Mistral Medium 3.5Mistral0.0%8.3%0.3%0.8%
Gemini 3.8 Flash (low reasoning)Google83.3%50.0%0.0%0.0%
GPT-5.4 Nano (no reasoning)OpenAI75.0%66.7%4.0%3.1%
Claude Haiku 4.5Anthropic83.3%25.0%0.0%0.3%
Claude Sonnet 5.5 (low reasoning)Anthropic91.7%–0.0%–
Gemini 3.6 Flash (minimal reasoning)Google91.7%41.7%0.0%0.3%

How BulletBench works

  1. 1

    The position

    The model gets the position, the moves so far, its remaining clock and the legal moves.

  2. 2

    The reply

    It answers with one move. The whole API round trip, including any hidden reasoning, comes off its clock.

  3. 3

    The engine

    Stockfish replies instantly at the model's current ladder level.

  4. 4

    The ladder

    Win and the next game is a level up; lose and it is a level down; draw and it stays. The results give a rating with a 95% interval.

Why chess on a clock

Many products need an answer in about a second: routing, triage, autocomplete, live agents. BulletBench asks which models can still think usefully at that speed. Chess gives a hard, objective score, and the clock makes slow thinking a real cost instead of a free extra.

The clocks

Lightning 10+1
Ten seconds, plus one second a move. A model can play for ever, but only at about a second an answer.
Bullet 60s
One minute for the whole game, no increment.
Blitz 3+2
Three minutes plus two seconds a move: room for reasoning models, for comparison.

Fair play

Same prompt
Every model gets the same system prompt and position format.
Invalid replies
A reply with no legal move gets two corrective retries, then a random legal move is played and counted.
Settings
Each model runs at its provider's default and, where the provider offers one, its fastest reasoning setting, shown separately.

Honest caveats

Twelve games per clock give wide intervals: models whose ranges overlap share a rank. Latency depends on the provider's servers on the day. The ladder's Elo anchors come from v1's Stockfish; this edition runs Stockfish 19, so ratings are not comparable with v1's.

What it measures

  • Decision quality under real time pressure
  • Response latency at the provider's default settings
  • Which reasoning settings are fast enough to use

What it does not measure

  • Any business skill: this is chess against an engine
  • Chess strength without a clock

Method

  • Games against a Stockfish ladder; every second of response time comes off the model's clock
  • Each model at its default setting and, where offered, its fastest reasoning setting
  • Ladder Elo with a 95% interval; it orders models, it is not a FIDE rating