Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

BFCL's own weighted average across its test categories.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: overall accuracy, % correct, higher is better
#ModelBFCL: overall accuracy
% correct, higher is better
1 Claude Opus 4.5Anthropic · claude-opus-4.5
77.5%
2 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
73.2%
3 gemini-3-pro-previewGoogle
72.5%
4 GLM 4.6Z.ai · glm-4.6
72.4%
5 grok-4-1-fast-reasoningxAI
69.6%
6 Claude Haiku 4.5Anthropic · claude-haiku-4.5
68.7%
7 gemini-3-pro-previewGoogle
68.1%
8 o3OpenAI
63.0%
9 grok-4-0709xAI
63.0%
10 grok-4-0709xAI
61.4%
11 Kimi K2 0711Moonshot AI · kimi-k2
59.1%
12 grok-4-1-fast-non-reasoningxAI
58.3%
13 command-a-reasoningCohere
57.1%
14 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
56.7%
15 Gemini 2.5 FlashGoogle · gemini-2.5-flash
56.2%
16 GPT-5.2OpenAI · gpt-5.2
55.9%
17 GPT-5 MiniOpenAI · gpt-5-mini
55.5%
18 xlam-2-32b-fc-rSalesforce
54.7%
19 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
54.1%
20 GPT-4.1OpenAI · gpt-4.1
54.0%
21 o4 MiniOpenAI · o4-mini
53.2%
22 xlam-2-70b-fc-rSalesforce
53.1%
23 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
52.1%
24 GPT-5 NanoOpenAI · gpt-5-nano
51.5%
25 nanbeige4-3b-thinking-2511Nanbeige
51.4%
26 Gemini 2.5 FlashGoogle · gemini-2.5-flash
50.9%
27 GPT-4.1 MiniOpenAI · gpt-4.1-mini
50.5%
28 o4 MiniOpenAI · o4-mini
50.3%
29 Qwen3 32BAlibaba · qwen3-32b
48.7%
30 o3OpenAI
48.6%
31 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
48.0%
32 nanbeige3.5-pro-thinkingNanbeige
47.7%
33 Qwen3 32BAlibaba · qwen3-32b
46.8%
34 xlam-2-8b-fc-rSalesforce
46.7%
35 Command ACohere · command-a
46.5%
36 bitagent-bounty-8bBittensor
46.2%
37 arch-agent-32bKatanemo
45.4%
38 GPT-5.2OpenAI · gpt-5.2
45.3%
39 Qwen3 8BAlibaba · qwen3-8b
42.6%
40 toolace-2-8bHuawei Noah And Ustc
42.4%
41 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
41.4%
42 xlam-2-3b-fc-rSalesforce
41.2%
43 Qwen3 14BAlibaba · qwen3-14b
41.0%
44 Qwen3 8BAlibaba · qwen3-8b
40.4%
45 GPT-4.1OpenAI · gpt-4.1
39.4%
46 mistral-large-2411Mistral
38.4%
47 Qwen3 14BAlibaba · qwen3-14b
37.8%
48 Mistral Medium 3Mistral · mistral-medium-3
37.7%
49 Mistral Medium 3Mistral · mistral-medium-3
37.6%
50 llama-4-maverick-17b-128e-instruct-fp8Meta
37.3%
51 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
37.1%
52 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
36.9%
53 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
36.7%
54 qwen3-4b-instruct-2507Alibaba
35.7%
55 qwen3-4b-instruct-2507Alibaba
35.5%
56 arch-agent-3bKatanemo
35.4%
57 Claude Opus 4.5Anthropic · claude-opus-4.5
33.5%
58 GPT-4.1 NanoOpenAI · gpt-4.1-nano
33.0%
59 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
32.4%
60 arch-agent-1.5bKatanemo
32.1%
61 Command R7B (12-2024)Cohere · command-r7b-12-2024
32.1%
62 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
31.9%
63 mistral-large-2411Mistral
31.8%
64 hammer2.1-7bMadeagents
31.7%
65 xlam-2-1b-fc-rSalesforce
30.4%
66 Gemma 3 12BGoogle · gemma-3-12b-it
30.4%
67 GPT-4.1 MiniOpenAI · gpt-4.1-mini
29.7%
68 hammer2.1-3bMadeagents
29.7%
69 Gemma 3 27BGoogle · gemma-3-27b-it
29.5%
70 Phi 4Microsoft · phi-4
28.8%
71 qwen3-1.7bAlibaba
28.4%
72 Llama 4 ScoutMeta · llama-4-scout
28.1%
73 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
28.0%
74 coalm-70bUiuc Oumi
28.0%
75 hammer2.1-1.5bMadeagents
27.9%
76 palmyra-x-004Writer
27.9%
77 GPT-5 MiniOpenAI · gpt-5-mini
27.8%
78 Mistral NemoMistral · mistral-nemo
27.6%
79 GPT-5 NanoOpenAI · gpt-5-nano
27.6%
80 Nova 2 LiteAmazon · nova-2-lite-v1
27.1%
80 granite-3.1-8b-instructIBM
27.1%
82 falcon3-10b-instructTII
27.0%
83 granite-3.2-8b-instructIBM
26.9%
84 coalm-8bUiuc Oumi
26.8%
85 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
25.8%
86 minicpm3-4bOpenbmb
25.6%
87 Claude Haiku 4.5Anthropic · claude-haiku-4.5
25.3%
88 Nova Pro 1.0Amazon · nova-pro-v1
25.0%
89 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
24.9%
90 GPT-4.1 NanoOpenAI · gpt-4.1-nano
24.9%
91 falcon3-7b-instructTII
24.0%
92 qwen3-0.6bAlibaba
23.9%
93 granite-20b-functioncallingIBM
23.2%
94 qwen3-0.6bAlibaba
22.4%
95 Nova Micro 1.0Amazon · nova-micro-v1
22.3%
96 rzn-tPhronetic Ai
22.2%
97 minicpm3-4bOpenbmb
22.1%
98 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
21.9%
99 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
21.9%
100 hammer2.1-0.5bMadeagents
21.2%
101 Gemma 3 4BGoogle · gemma-3-4b-it
19.6%
102 Mistral NemoMistral · mistral-nemo
19.3%
103 granite-4.0-350mIBM
19.0%
104 falcon3-3b-instructTII
16.2%
105 ministral-8b-2410Mistral
11.1%
106 falcon3-1b-instructTII
11.1%
107 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
10.8%
108 llama-3.1-nemotron-ultra-253b-v1NVIDIA
10.0%
109 gemma-3-1b-itGoogle
7.2%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

BFCL's own weighted average across its test categories.

What it does not measure

Not a neutral average: the weighting is BFCL's. Not reliability on your own tools: BFCL's functions and queries are a fixed test set, and a correct call is judged by its form, not by what it achieved.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.