Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

IFEval (Instruction Following Evaluation)

ia

Définition

IFEval (Instruction Following Evaluation) est un benchmark developpe par Google (Zhou et al., 2023) qui evalue la capacite des LLMs a suivre des instructions formelles, verifiables automatiquement par programme. Le benchmark se compose d'environ 500 prompts contenant des contraintes precises et verificables : 'Ecris une reponse de 300 a 400 mots', 'Utilise au moins 3 mentions du mot "securite"', 'Ta reponse doit commencer par "Bonjour"', 'Ne pas utiliser de virgules'. L'originalite d'IFEval est la verification automatique : contrairement aux benchmarks qui necessitent un juge humain ou un LLM, les contraintes IFEval sont suffisamment formelles pour etre verifiees par du code Python. Cela permet une evaluation reproductible et scalable. Les types de contraintes incluent : longueur (mots, phrases, paragraphes), mots-cles (inclure/exclure), format (JSON, markdown, listes), structure (commencer par, finir par), et style (eviter les pronoms, ecrire en majuscules). IFEval mesure deux niveaux de conformite : Prompt-level accuracy (le prompt entier satisfait toutes ses contraintes ?) et Instruction-level accuracy (quelle proportion des contraintes individuelles sont respectees ?). La distinction permet d'identifier si un modele rate systematiquement certains types de contraintes. Les scores IFEval revelent des differences importantes entre les modeles d'instruction following : GPT-4o atteint ~87% prompt-level, Claude 3.5 Sonnet ~89%, Llama 3.1 70B Instruct ~88%. Les modeles plus petits ont des scores nettement inferieurs : Llama 3.2 1B ~60%, Mistral 7B ~67%. IFEval est particulierement pertinent pour les applications enterprise ou les LLMs doivent respecter des contraintes de format strictes : generation de rapports avec structure imposee, remplissage de formulaires, generation de code avec contraintes syntaxiques, et tout scenario ou la non-conformite de format cause des erreurs en aval.

Types de contraintes IFEval

CategorieExemple de contrainte
Longueur'Ecris exactement 5 phrases.'
Mots-cles'Mentionne le mot "zero-trust" au moins 4 fois.'
Format'Reponds au format JSON avec les cles title et summary.'
Structure'Commence ta reponse par la lettre J.'
Style'N\'utilise pas de point d\'exclamation.'

Scores IFEval (prompt-level strict)

ModeleScore %
Claude 3.5 Sonnet89.4%
GPT-4o87.2%
Llama 3.1 70B Instruct88.1%
Mistral 7B Instruct v0.367.4%
Llama 3.2 1B Instruct60.1%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis