Benchmarks / Vending-Bench 2
Reported by Vending-Bench 2
Vending-Bench 2
Bank balance after an agent runs a simulated vending business for a year: ordering stock, setting prices and dealing with suppliers.
- Results dated
- 1 Oct 2026
- Models
- 63
- Unit
- US dollars
Money after a year: Claude Sonnet 4.6
Top 15 of 63 results · US dollars, higher is better. Choose a model to highlight it.Clear highlight
-
1
GPT-6 AstraOpenAI
$15,514.70
-
2
GPT-6 SolOpenAI
$14,427.85
-
3
Claude Opus 5Anthropic
$11,181.87
-
4
Claude Opus 4.7Anthropic
$10,936.76
-
5
GPT-5.6 SolOpenAI
$9,619.37
-
6
Grok 4.6xAI
$9,047.03
-
7
GLM 5.2Z.ai
$8,313.78
-
8
GLM 5.3Z.ai
$8,163.61
-
9
Claude Opus 4.6Anthropic
$8,017.59
-
10
GPT-5.5OpenAI
$7,523.84
-
11
GPT-5.6 TerraOpenAI
$7,343.21
-
12
Claude Sonnet 4.6Anthropic
$7,204.14
-
13
Muse Spark 1.1Meta
$6,520.48
-
14
Claude Sonnet 5Anthropic
$6,377.70
-
15
Kimi K2.6Moonshot AI
$6,204.57
$0$5,000$10,000$15,000$20,000
Full results
Vending-Bench 2: money after a year, US dollars, higher is better
| # | Model | Money after a year US dollars, higher is better |
| 1 |
GPT-6 AstraOpenAI |
|
| 2 |
GPT-6 SolOpenAI |
|
| 3 |
Claude Opus 5Anthropic |
|
| 4 |
Claude Opus 4.7Anthropic |
|
| 5 |
GPT-5.6 SolOpenAI |
|
| 6 |
Grok 4.6xAI |
|
| 7 |
GLM 5.2Z.ai |
|
| 8 |
GLM 5.3Z.ai |
|
| 9 |
Claude Opus 4.6Anthropic |
|
| 10 |
GPT-5.5OpenAI |
|
| 11 |
GPT-5.6 TerraOpenAI |
|
| 12 |
Claude Sonnet 4.6Anthropic |
|
| 13 |
Muse Spark 1.1Meta |
|
| 14 |
Claude Sonnet 5Anthropic |
|
| 15 |
Kimi K2.6Moonshot AI |
|
| 16 |
GPT-5.4OpenAI |
|
| 17 |
GPT-5.3-CodexOpenAI |
|
| 18 |
Claude Opus 4.8Anthropic |
|
| 19 |
Claude Fable 5 (high)Anthropic |
|
| 20 |
GLM 5.1Z.ai |
|
| 21 |
gemini-3-pro-previewGoogle |
|
| 22 |
Claude Fable 5.1Anthropic |
|
| 23 |
Gemini 3.5 FlashGoogle |
|
| 24 |
Kimi K3Moonshot AI |
|
| 25 |
Qwen3.6 PlusAlibaba |
|
| 26 |
Gemini 3.8 FlashGoogle |
|
| 27 |
Kimi K2.7 CodeMoonshot AI |
|
| 28 |
Claude Fable 5 (low reasoning)Anthropic |
|
| 29 |
Claude Opus 4.5Anthropic |
|
| 30 |
Claude Fable 5 (max reasoning)Anthropic |
|
| 31 |
Grok 4.20xAI |
|
| 32 |
Claude Fable 5Anthropic |
|
| 33 |
GLM 5Z.ai |
|
| 34 |
Claude Fable 5 (medium reasoning)Anthropic |
|
| 35 |
Qwen3.6 Max PreviewAlibaba |
|
| 36 |
GPT-5.6 LunaOpenAI |
|
| 37 |
Grok 4.5xAI |
|
| 38 |
Claude Sonnet 4.5Anthropic |
|
| 39 |
Gemini 3.1 Pro Preview Custom ToolsGoogle |
|
| 40 |
Gemini 3 Flash PreviewGoogle |
|
| 41 |
GPT-5.2OpenAI |
|
| 42 |
DeepSeek V4 Pro 0423DeepSeek |
|
| 43 |
Claude Opus 4.8 (max reasoning)Anthropic |
|
| 44 |
GLM 4.7Z.ai |
|
| 45 |
MiniMax M3MiniMax |
|
| 46 |
GPT-5.1OpenAI |
|
| 47 |
Kimi K2.5Moonshot AI |
|
| 48 |
grok-4-1-fast-reasoningxAI |
|
| 49 |
DeepSeek V3.2 ExpDeepSeek |
|
| 50 |
Gemini 3.1 Pro PreviewGoogle |
|
| 51 |
Gemini 2.5 ProGoogle |
|
| 52 |
Gemini 2.5 FlashGoogle |
|
| 53 |
Qwen3.5-FlashAlibaba |
|
| 54 |
Claude Haiku 4.5Anthropic |
|
| 55 |
Qwen3.5-27BAlibaba |
|
| 56 |
MiniMax M2MiniMax |
|
| 57 |
Qwen3 MaxAlibaba |
|
| 58 |
Grok 4.3xAI |
|
| 59 |
Qwen3.5 Plus 2026-02-15Alibaba |
|
| 60 |
Qwen3 235B A22B Thinking 2507Alibaba |
|
| 61 |
gpt-oss-120bOpenAI |
|
| 62 |
MiniMax M2.5MiniMax |
|
| 63 |
GPT-5 MiniOpenAI |
|
Results as published by Vending-Bench 2; we do not re-run them.
What it measures
Bank balance after an agent runs a simulated vending business for a year: ordering stock, setting prices and dealing with suppliers.
What it does not measure
Not a real business; one simulated market with set rules.
Andon Labs; collected by Epoch AI. Licence: Published with permission (Andon Labs results via Epoch AI).