Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

BFCL (Berkeley Function Calling Leaderboard)

ia

Définition

BFCL (Berkeley Function Calling Leaderboard) est un benchmark de reference pour evaluer la capacite des LLMs a appeler correctement des fonctions/outils (function calling ou tool use), une competence critique pour les applications d'agents IA. Developpe par UC Berkeley (2024), il comprend 2000 paires question-fonction dans 18 categories, evaluant la precision du LLM a choisir la bonne fonction et les bons arguments. Les categories BFCL incluent : appels simples avec arguments standards, appels multiples (choisir entre plusieurs fonctions disponibles), appels paralleles (executer plusieurs fonctions en meme temps), appels imbriques (utiliser la sortie d'une fonction comme argument d'une autre), et la gestion des cas ou aucun appel n'est necessaire (irrelevant detection). L'evaluation BFCL se distingue des autres benchmarks car elle mesure la precision syntaxique et semantique des appels de fonctions : le LLM doit generer exactement le bon nom de fonction, les bons noms de parametres, les bonnes valeurs (correctement typees), et dans le bon format JSON. Une legere erreur de typage ou un parametre manquant constitue un echec. Les scores BFCL revelent des differences importantes entre les modeles : Claude 3.5 Sonnet et GPT-4o obtiennent generalement 90%+ sur les appels simples mais peuvent descendre a 60-70% sur les appels imbriques complexes ou les scenarios avec de nombreuses fonctions disponibles. Les petits modeles (7B) ont des scores significativement plus faibles sur les categories complexes. BFCL est devenu la reference pour les developpeurs qui construisent des agents IA avec tool use : il permet de comparer rapidement quel LLM est le plus fiable pour appeler les outils correctement dans leur application specifique. Les entreprises utilisant les agents IA pour des workflows automatises doivent optimiser ce score.

Exemple de test BFCL

# Scenario: LLM doit appeler la bonne fonction
tools = [{
    'name': 'get_stock_price',
    'parameters': {'symbol': 'string', 'currency': 'string (USD/EUR)'}
}, {
    'name': 'convert_currency',
    'parameters': {'amount': 'float', 'from': 'string', 'to': 'string'}
}]

user_query = 'Quel est le prix AAPL en euros ?'

# Reponse attendue (2 appels paralleles):
expected = [
    {'name': 'get_stock_price', 'arguments': {'symbol': 'AAPL', 'currency': 'USD'}},
    {'name': 'convert_currency', 'arguments': {'from': 'USD', 'to': 'EUR', 'amount': 'RESULT_OF_CALL_1'}}
]

Scores BFCL (Overall accuracy)

ModeleScore %
Claude 3.5 Sonnet90.2%
GPT-4o88.4%
Gemini 1.5 Pro85.1%
Llama 3.1 70B Instruct76.3%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis