Benchmarks / Berkeley Function Calling Leaderboard (BFCL) V4

Reported by Berkeley Function Calling Leaderboard (BFCL) V4

Berkeley Function Calling Leaderboard (BFCL) V4

Storing and recalling facts across sessions with memory tools.

Results dated
16 Dec 2025
Models
109
Unit
% correct
Licence
Apache License 2.0
BFCL: memory, % correct, higher is better
#ModelBFCL: memory
% correct, higher is better
1 Claude Opus 4.5Anthropic · claude-opus-4.5
73.8%
2 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
65.0%
3 gemini-3-pro-previewGoogle
61.7%
4 grok-4-0709xAI
55.9%
5 GLM 4.6Z.ai · glm-4.6
55.7%
6 gemini-3-pro-previewGoogle
54.8%
7 Claude Haiku 4.5Anthropic · claude-haiku-4.5
54.4%
8 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
54.2%
9 grok-4-1-fast-reasoningxAI
54.0%
10 o3OpenAI
51.8%
11 grok-4-0709xAI
50.5%
12 o3OpenAI
47.3%
13 GPT-5.2OpenAI · gpt-5.2
45.8%
14 nanbeige3.5-pro-thinkingNanbeige
45.2%
15 GPT-5 MiniOpenAI · gpt-5-mini
44.3%
16 DeepSeek V3.2 ExpDeepSeek · deepseek-v3.2-exp
44.1%
17 Gemini 2.5 FlashGoogle · gemini-2.5-flash
41.3%
18 Gemini 2.5 FlashGoogle · gemini-2.5-flash
38.7%
19 nanbeige4-3b-thinking-2511Nanbeige
36.8%
20 o4 MiniOpenAI · o4-mini
35.3%
21 o4 MiniOpenAI · o4-mini
34.2%
22 GPT-5 MiniOpenAI · gpt-5-mini
29.2%
23 Kimi K2 0711Moonshot AI · kimi-k2
29.0%
24 command-a-reasoningCohere
28.8%
25 Gemma 3 12BGoogle · gemma-3-12b-it
27.5%
25 falcon3-10b-instructTII
27.5%
27 GPT-4.1 MiniOpenAI · gpt-4.1-mini
26.9%
28 Qwen3 32BAlibaba · qwen3-32b
26.7%
29 grok-4-1-fast-non-reasoningxAI
26.2%
30 mistral-large-2411Mistral
24.9%
31 Phi 4Microsoft · phi-4
24.7%
31 GPT-5 NanoOpenAI · gpt-5-nano
24.7%
33 GPT-5 NanoOpenAI · gpt-5-nano
24.5%
34 GPT-4.1 MiniOpenAI · gpt-4.1-mini
24.3%
35 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
23.9%
35 qwen3-4b-instruct-2507Alibaba
23.9%
35 GPT-4.1OpenAI · gpt-4.1
23.9%
38 mistral-large-2411Mistral
23.7%
39 Mistral Medium 3Mistral · mistral-medium-3
23.0%
40 Mistral Medium 3Mistral · mistral-medium-3
21.7%
41 GPT-4.1OpenAI · gpt-4.1
21.5%
42 xlam-2-32b-fc-rSalesforce
20.9%
43 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
20.6%
43 falcon3-7b-instructTII
20.6%
45 Qwen3 14BAlibaba · qwen3-14b
19.6%
46 Qwen3 235B A22B Instruct 2507Alibaba · qwen3-235b-a22b-2507
19.4%
47 llama-4-maverick-17b-128e-instruct-fp8Meta
18.9%
47 GPT-4.1 NanoOpenAI · gpt-4.1-nano
18.9%
49 toolace-2-8bHuawei Noah And Ustc
18.5%
50 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
18.1%
51 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
17.6%
51 qwen3-4b-instruct-2507Alibaba
17.6%
53 GPT-4.1 NanoOpenAI · gpt-4.1-nano
16.8%
54 Command ACohere · command-a
16.6%
55 Qwen3 32BAlibaba · qwen3-32b
15.7%
56 Mistral Small 3.2 24BMistral · mistral-small-3.2-24b-instruct
15.1%
57 Qwen3 8BAlibaba · qwen3-8b
14.6%
57 arch-agent-32bKatanemo
14.6%
59 granite-3.1-8b-instructIBM
14.4%
59 xlam-2-70b-fc-rSalesforce
14.4%
61 xlam-2-8b-fc-rSalesforce
14.0%
62 Gemma 3 27BGoogle · gemma-3-27b-it
13.6%
63 Qwen3 8BAlibaba · qwen3-8b
13.1%
63 palmyra-x-004Writer
13.1%
65 Gemini 2.5 Flash LiteGoogle · gemini-2.5-flash-lite
12.7%
66 granite-3.2-8b-instructIBM
12.5%
67 minicpm3-4bOpenbmb
12.0%
68 xlam-2-3b-fc-rSalesforce
11.4%
68 bielik-11b-v2.3-instructSpeakleash And Ack Cyfronet Agh
11.4%
70 Qwen3 14BAlibaba · qwen3-14b
11.2%
71 Llama 3.1 8B InstructMeta · llama-3.1-8b-instruct
10.8%
72 Mistral NemoMistral · mistral-nemo
10.3%
73 Qwen3 30B A3B Instruct 2507Alibaba · qwen3-30b-a3b-instruct-2507
9.7%
74 minicpm3-4bOpenbmb
9.5%
75 qwen3-0.6bAlibaba
8.6%
75 Gemma 3 4BGoogle · gemma-3-4b-it
8.6%
75 Mistral NemoMistral · mistral-nemo
8.6%
78 qwen3-0.6bAlibaba
8.4%
79 arch-agent-1.5bKatanemo
8.2%
79 Llama 3.3 70B InstructMeta · llama-3.3-70b-instruct
8.2%
79 Llama 4 ScoutMeta · llama-4-scout
8.2%
82 falcon3-3b-instructTII
7.7%
83 arch-agent-3bKatanemo
6.9%
83 rzn-tPhronetic Ai
6.9%
85 Llama 3.2 3B InstructMeta · llama-3.2-3b-instruct
6.2%
86 qwen3-1.7bAlibaba
6.0%
87 falcon3-1b-instructTII
5.8%
87 coalm-70bUiuc Oumi
5.8%
89 Claude Sonnet 4.5Anthropic · claude-sonnet-4.5
5.4%
90 Command R7B (12-2024)Cohere · command-r7b-12-2024
5.2%
91 ministral-8b-2410Mistral
4.5%
92 GPT-5.2OpenAI · gpt-5.2
3.9%
92 xlam-2-1b-fc-rSalesforce
3.9%
94 gemma-3-1b-itGoogle
3.2%
94 granite-4.0-350mIBM
3.2%
94 Llama 3.2 1B InstructMeta · llama-3.2-1b-instruct
3.2%
97 hammer2.1-3bMadeagents
3.0%
98 coalm-8bUiuc Oumi
2.8%
99 Claude Haiku 4.5Anthropic · claude-haiku-4.5
2.6%
100 Nova 2 LiteAmazon · nova-2-lite-v1
2.4%
100 Nova Micro 1.0Amazon · nova-micro-v1
2.4%
102 Nova Pro 1.0Amazon · nova-pro-v1
1.9%
102 Claude Opus 4.5Anthropic · claude-opus-4.5
1.9%
104 bitagent-bounty-8bBittensor
1.5%
105 hammer2.1-0.5bMadeagents
1.1%
106 granite-20b-functioncallingIBM
0.0%
106 hammer2.1-1.5bMadeagents
0.0%
106 hammer2.1-7bMadeagents
0.0%
106 llama-3.1-nemotron-ultra-253b-v1NVIDIA
0.0%

Results as published by Berkeley Function Calling Leaderboard (BFCL) V4; we do not re-run them.

What it measures

Storing and recalling facts across sessions with memory tools.

What it does not measure

Not long-term personal memory in a product: sessions are BFCL's scripted ones.

Berkeley Function Calling Leaderboard (BFCL) V4 by the UC Berkeley Gorilla team, Apache License 2.0.