Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

Choosing the right function and arguments in one turn, on BFCL's curated set.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: single-turn calls (curated), % correct, higher is better
#ModelBFCL: single-turn calls (curated)
% correct, higher is better
1 gemini-3-pro-previewGoogle
90.7%
2 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
90.3%
3 Qwen3 32BAlibaba · qwen3-32b
90.3%
4 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
89.7%
5 Claude Opus 4.5Anthropic · claude-opus-4.5
89.7%
6 xlam-2-32b-fc-rSalesforce
89.6%
7 Qwen3 14BAlibaba · qwen3-14b
89.5%
8 Llama 4 ScoutMeta · llama-4-scout
89.4%
9 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
88.9%
9 arch-agent-32bKatanemo
88.9%
11 Qwen3 32BAlibaba · qwen3-32b
88.8%
12 GPT-4.1OpenAI · gpt-4.1
88.7%
13 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
88.7%
13 llama-4-maverick-17b-128e-instruct-fp8Meta
88.7%
15 Claude Opus 4.5Anthropic · claude-opus-4.5
88.6%
16 Qwen3 8BAlibaba · qwen3-8b
88.6%
17 Mistral NemoMistral · mistral-nemo
88.5%
18 xlam-2-70b-fc-rSalesforce
88.4%
19 grok-4-1-fast-reasoningxAI
88.3%
20 grok-4-1-fast-non-reasoningxAI
88.1%
21 Gemini 2.5 FlashGoogle · gemini-2.5-flash
88.1%
22 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
88.0%
23 qwen3-4b-instruct-2507Alibaba
87.9%
24 Qwen3 8BAlibaba · qwen3-8b
87.6%
25 Command ACohere · command-a
87.6%
25 GLM 4.6Z.ai · glm-4.6
87.6%
27 palmyra-x-004Writer
87.5%
28 Gemma 3 27BGoogle · gemma-3-27b-it
87.2%
29 toolace-2-8bHuawei Noah And Ustc
87.1%
30 Nova 2 LiteAmazon · nova-2-lite-v1
87.0%
31 arch-agent-3bKatanemo
86.7%
32 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
86.6%
33 Nova Pro 1.0Amazon · nova-pro-v1
86.6%
34 Claude Haiku 4.5Anthropic · claude-haiku-4.5
86.5%
35 qwen3-4b-instruct-2507Alibaba
86.4%
36 command-a-reasoningCohere
86.3%
37 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
85.8%
38 gemini-3-pro-previewGoogle
85.8%
39 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
85.5%
40 hammer2.1-7bMadeagents
85.5%
41 grok-4-0709xAI
85.4%
42 Mistral Medium 3Mistral · mistral-medium-3
85.3%
43 falcon3-10b-instructTII
85.0%
44 Gemini 2.5 FlashGoogle · gemini-2.5-flash
85.0%
44 hammer2.1-3bMadeagents
85.0%
46 Qwen3 14BAlibaba · qwen3-14b
84.9%
47 coalm-8bUiuc Oumi
84.9%
48 mistral-large-2411Mistral
84.7%
49 GPT-4.1 MiniOpenAI · gpt-4.1-mini
84.6%
50 xlam-2-8b-fc-rSalesforce
84.6%
51 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
84.0%
52 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
83.9%
53 GPT-4.1 MiniOpenAI · gpt-4.1-mini
83.8%
54 coalm-70bUiuc Oumi
83.4%
55 mistral-large-2411Mistral
83.0%
56 hammer2.1-1.5bMadeagents
83.0%
57 xlam-2-3b-fc-rSalesforce
83.0%
58 qwen3-1.7bAlibaba
82.9%
59 Mistral NemoMistral · mistral-nemo
82.8%
60 GPT-4.1OpenAI · gpt-4.1
82.8%
61 grok-4-0709xAI
82.8%
62 falcon3-7b-instructTII
82.7%
63 arch-agent-1.5bKatanemo
82.7%
63 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
82.7%
65 granite-20b-functioncallingIBM
82.3%
66 o3OpenAI
81.9%
67 GPT-5.2OpenAI · gpt-5.2
81.8%
68 minicpm3-4bOpenbmb
81.8%
69 bitagent-bounty-8bBittensor
81.6%
69 Kimi K2 0711Moonshot AI · kimi-k2
81.6%
71 nanbeige4-3b-thinking-2511Nanbeige
81.6%
72 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
81.5%
73 o4 MiniOpenAI · o4-mini
81.3%
74 Command R7B (12-2024)Cohere · command-r7b-12-2024
81.0%
75 GPT-5 NanoOpenAI · gpt-5-nano
80.8%
76 granite-3.2-8b-instructIBM
79.8%
77 Gemma 3 12BGoogle · gemma-3-12b-it
79.4%
78 granite-3.1-8b-instructIBM
78.3%
79 GPT-5.2OpenAI · gpt-5.2
78.3%
80 Nova Micro 1.0Amazon · nova-micro-v1
74.1%
81 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
73.6%
82 GPT-4.1 NanoOpenAI · gpt-4.1-nano
73.0%
83 GPT-4.1 NanoOpenAI · gpt-4.1-nano
72.4%
84 qwen3-0.6bAlibaba
71.8%
85 minicpm3-4bOpenbmb
70.5%
86 qwen3-0.6bAlibaba
70.0%
87 GPT-5 MiniOpenAI · gpt-5-mini
69.8%
88 Phi 4Microsoft · phi-4
69.6%
89 xlam-2-1b-fc-rSalesforce
69.0%
90 GPT-5 MiniOpenAI · gpt-5-mini
68.0%
91 GPT-5 NanoOpenAI · gpt-5-nano
68.0%
92 rzn-tPhronetic Ai
67.9%
93 granite-4.0-350mIBM
67.9%
94 Mistral Medium 3Mistral · mistral-medium-3
67.4%
95 hammer2.1-0.5bMadeagents
66.0%
96 Gemma 3 4BGoogle · gemma-3-4b-it
61.1%
97 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
59.8%
98 Claude Haiku 4.5Anthropic · claude-haiku-4.5
55.4%
99 falcon3-3b-instructTII
54.6%
100 o3OpenAI
40.4%
101 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
38.4%
102 nanbeige3.5-pro-thinkingNanbeige
38.4%
103 o4 MiniOpenAI · o4-mini
37.7%
104 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
37.4%
105 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
34.9%
106 gemma-3-1b-itGoogle
20.2%
107 falcon3-1b-instructTII
9.0%
108 ministral-8b-2410Mistral
0.0%
108 llama-3.1-nemotron-ultra-253b-v1NVIDIA
0.0%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

Choosing the right function and arguments in one turn, on BFCL's curated set.

What it does not measure

Not reliability on your own tools: BFCL's functions and queries are a fixed test set, and a correct call is judged by its form, not by what it achieved.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.