BFCL (Berkeley Function Calling Leaderboard)
iaDéfinition
BFCL (Berkeley Function Calling Leaderboard) est un benchmark de reference pour evaluer la capacite des LLMs a appeler correctement des fonctions/outils (function calling ou tool use), une competence critique pour les applications d'agents IA. Developpe par UC Berkeley (2024), il comprend 2000 paires question-fonction dans 18 categories, evaluant la precision du LLM a choisir la bonne fonction et les bons arguments. Les categories BFCL incluent : appels simples avec arguments standards, appels multiples (choisir entre plusieurs fonctions disponibles), appels paralleles (executer plusieurs fonctions en meme temps), appels imbriques (utiliser la sortie d'une fonction comme argument d'une autre), et la gestion des cas ou aucun appel n'est necessaire (irrelevant detection). L'evaluation BFCL se distingue des autres benchmarks car elle mesure la precision syntaxique et semantique des appels de fonctions : le LLM doit generer exactement le bon nom de fonction, les bons noms de parametres, les bonnes valeurs (correctement typees), et dans le bon format JSON. Une legere erreur de typage ou un parametre manquant constitue un echec. Les scores BFCL revelent des differences importantes entre les modeles : Claude 3.5 Sonnet et GPT-4o obtiennent generalement 90%+ sur les appels simples mais peuvent descendre a 60-70% sur les appels imbriques complexes ou les scenarios avec de nombreuses fonctions disponibles. Les petits modeles (7B) ont des scores significativement plus faibles sur les categories complexes. BFCL est devenu la reference pour les developpeurs qui construisent des agents IA avec tool use : il permet de comparer rapidement quel LLM est le plus fiable pour appeler les outils correctement dans leur application specifique. Les entreprises utilisant les agents IA pour des workflows automatises doivent optimiser ce score.
Exemple de test BFCL
# Scenario: LLM doit appeler la bonne fonction
tools = [{
'name': 'get_stock_price',
'parameters': {'symbol': 'string', 'currency': 'string (USD/EUR)'}
}, {
'name': 'convert_currency',
'parameters': {'amount': 'float', 'from': 'string', 'to': 'string'}
}]
user_query = 'Quel est le prix AAPL en euros ?'
# Reponse attendue (2 appels paralleles):
expected = [
{'name': 'get_stock_price', 'arguments': {'symbol': 'AAPL', 'currency': 'USD'}},
{'name': 'convert_currency', 'arguments': {'from': 'USD', 'to': 'EUR', 'amount': 'RESULT_OF_CALL_1'}}
]Scores BFCL (Overall accuracy)
| Modele | Score % |
|---|---|
| Claude 3.5 Sonnet | 90.2% |
| GPT-4o | 88.4% |
| Gemini 1.5 Pro | 85.1% |
| Llama 3.1 70B Instruct | 76.3% |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h