Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4
Reported by Berkeley Function Calling Leaderboard (BFCL) V4
Berkeley Function Calling Leaderboard (BFCL) V4
Completing tasks over several turns with stateful tools, including when functions or parameters are missing.
- Results dated
- 16 Dec 2025
- Models
- 109
- Unit
- % correct
- Licence
- Apache License 2.0
| # | Model | BFCL: multi-turn tasks % correct, higher is better |
|---|---|---|
| 1 | xlam-2-70b-fc-rSalesforce |
77.4%
|
| 2 | xlam-2-8b-fc-rSalesforce |
70.0%
|
| 3 | xlam-2-32b-fc-rSalesforce |
69.5%
|
| 4 | Claude Opus 4.5Anthropic · claude-opus-4.5 |
68.4%
|
| 5 | GLM 4.6Z.ai · glm-4.6 |
68.0%
|
| 6 | gemini-3-pro-previewGoogle |
63.1%
|
| 7 | bitagent-bounty-8bBittensor |
62.4%
|
| 8 | o3OpenAI |
62.2%
|
| 9 | Claude Sonnet 4.5Anthropic · claude-sonnet-4.5 |
61.4%
|
| 10 | gemini-3-pro-previewGoogle |
60.8%
|
| 11 | grok-4-1-fast-reasoningxAI |
58.9%
|
| 12 | xlam-2-3b-fc-rSalesforce |
58.4%
|
| 13 | arch-agent-32bKatanemo |
54.2%
|
| 14 | Claude Haiku 4.5Anthropic · claude-haiku-4.5 |
53.6%
|
| 15 | nanbeige4-3b-thinking-2511Nanbeige |
51.1%
|
| 16 | Kimi K2 0711Moonshot AI · kimi-k2 |
50.6%
|
| 17 | command-a-reasoningCohere |
50.1%
|
| 18 | Qwen3 32BAlibaba · qwen3-32b |
47.9%
|
| 19 | grok-4-0709xAI |
47.0%
|
| 20 | grok-4-1-fast-non-reasoningxAI |
46.8%
|
| 21 | Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507 |
45.4%
|
| 22 | DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp |
44.9%
|
| 23 | Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507 |
44.6%
|
| 24 | GPT-5.2OpenAI · gpt-5.2 |
43.8%
|
| 25 | Qwen3 32BAlibaba · qwen3-32b |
43.2%
|
| 26 | Qwen3 8BAlibaba · qwen3-8b |
41.8%
|
| 26 | o4 MiniOpenAI · o4-mini |
41.8%
|
| 28 | nanbeige3.5-pro-thinkingNanbeige |
40.0%
|
| 29 | GPT-4.1OpenAI · gpt-4.1 |
38.9%
|
| 30 | toolace-2-8bHuawei Noah And Ustc |
38.4%
|
| 31 | DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp |
37.4%
|
| 32 | Gemini 2.5 FlashGoogle · gemini-2.5-flash |
36.2%
|
| 33 | xlam-2-1b-fc-rSalesforce |
36.0%
|
| 34 | arch-agent-3bKatanemo |
34.9%
|
| 35 | Qwen3 14BAlibaba · qwen3-14b |
34.8%
|
| 36 | GPT-5 NanoOpenAI · gpt-5-nano |
34.5%
|
| 37 | GPT-4.1 MiniOpenAI · gpt-4.1-mini |
34.1%
|
| 38 | grok-4-0709xAI |
33.9%
|
| 39 | Qwen3 8BAlibaba · qwen3-8b |
33.4%
|
| 40 | Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507 |
30.0%
|
| 41 | Command ACohere · command-a |
29.5%
|
| 42 | GPT-5.2OpenAI · gpt-5.2 |
28.1%
|
| 43 | GPT-5 MiniOpenAI · gpt-5-mini |
27.5%
|
| 44 | arch-agent-1.5bKatanemo |
26.6%
|
| 45 | Qwen3 14BAlibaba · qwen3-14b |
26.1%
|
| 46 | hammer2.1-7bMadeagents |
23.9%
|
| 47 | GPT-4.1 NanoOpenAI · gpt-4.1-nano |
23.6%
|
| 48 | Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507 |
23.5%
|
| 49 | qwen3-4b-instruct-2507Alibaba |
22.1%
|
| 50 | Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct |
21.5%
|
| 51 | qwen3-4b-instruct-2507Alibaba |
20.5%
|
| 52 | llama-4-maverick-17b-128e-instruct-fp8Meta |
20.2%
|
| 53 | Gemini 2.5 FlashGoogle · gemini-2.5-flash |
16.8%
|
| 54 | o4 MiniOpenAI · o4-mini |
16.6%
|
| 55 | hammer2.1-3bMadeagents |
16.5%
|
| 56 | Claude Opus 4.5Anthropic · claude-opus-4.5 |
16.1%
|
| 57 | hammer2.1-1.5bMadeagents |
15.6%
|
| 58 | Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct |
14.8%
|
| 58 | o3OpenAI |
14.8%
|
| 60 | mistral-large-2411Mistral |
14.1%
|
| 61 | mistral-large-2411Mistral |
13.8%
|
| 62 | Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite |
13.5%
|
| 63 | Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct |
11.5%
|
| 64 | Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct |
11.1%
|
| 65 | qwen3-1.7bAlibaba |
11.0%
|
| 66 | Gemma 3 27BGoogle · gemma-3-27b-it |
10.8%
|
| 66 | Mistral Medium 3Mistral · mistral-medium-3 |
10.8%
|
| 68 | coalm-70bUiuc Oumi |
10.6%
|
| 69 | Mistral Medium 3Mistral · mistral-medium-3 |
9.9%
|
| 70 | GPT-4.1OpenAI · gpt-4.1 |
9.8%
|
| 71 | Llama 4 ScoutMeta · llama-4-scout |
9.0%
|
| 72 | Command R7B (12-2024)Cohere · command-r7b-12-2024 |
8.2%
|
| 73 | coalm-8bUiuc Oumi |
8.0%
|
| 74 | Mistral NemoMistral · mistral-nemo |
7.8%
|
| 75 | Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite |
7.6%
|
| 76 | granite-3.1-8b-instructIBM |
7.5%
|
| 77 | granite-3.2-8b-instructIBM |
7.4%
|
| 78 | falcon3-10b-instructTII |
6.5%
|
| 79 | Gemma 3 12BGoogle · gemma-3-12b-it |
5.8%
|
| 80 | GPT-5 MiniOpenAI · gpt-5-mini |
5.5%
|
| 81 | granite-20b-functioncallingIBM |
5.4%
|
| 82 | falcon3-7b-instructTII |
5.0%
|
| 83 | Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct |
4.0%
|
| 84 | Phi 4Microsoft · phi-4 |
3.9%
|
| 84 | minicpm3-4bOpenbmb |
3.9%
|
| 86 | qwen3-0.6bAlibaba |
3.6%
|
| 87 | minicpm3-4bOpenbmb |
3.5%
|
| 88 | hammer2.1-0.5bMadeagents |
2.9%
|
| 88 | rzn-tPhronetic Ai |
2.9%
|
| 90 | bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh |
2.6%
|
| 91 | granite-4.0-350mIBM |
2.5%
|
| 91 | GPT-4.1 MiniOpenAI · gpt-4.1-mini |
2.5%
|
| 93 | Nova 2 LiteAmazon · nova-2-lite-v1 |
2.1%
|
| 94 | GPT-4.1 NanoOpenAI · gpt-4.1-nano |
2.0%
|
| 95 | Nova Pro 1.0Amazon · nova-pro-v1 |
1.9%
|
| 96 | Claude Haiku 4.5Anthropic · claude-haiku-4.5 |
1.8%
|
| 97 | Claude Sonnet 4.5Anthropic · claude-sonnet-4.5 |
1.6%
|
| 98 | qwen3-0.6bAlibaba |
1.4%
|
| 98 | Nova Micro 1.0Amazon · nova-micro-v1 |
1.4%
|
| 100 | falcon3-3b-instructTII |
1.0%
|
| 101 | Mistral NemoMistral · mistral-nemo |
0.8%
|
| 101 | GPT-5 NanoOpenAI · gpt-5-nano |
0.8%
|
| 103 | Gemma 3 4BGoogle · gemma-3-4b-it |
0.4%
|
| 103 | palmyra-x-004Writer |
0.4%
|
| 105 | gemma-3-1b-itGoogle |
0.0%
|
| 105 | Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct |
0.0%
|
| 105 | ministral-8b-2410Mistral |
0.0%
|
| 105 | llama-3.1-nemotron-ultra-253b-v1NVIDIA |
0.0%
|
| 105 | falcon3-1b-instructTII |
0.0%
|
Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.
What it measures
Completing tasks over several turns with stateful tools, including when functions or parameters are missing.
What it does not measure
Not open-ended agent work: the tools and tasks are BFCL's simulated APIs.
Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.