IFEval (Instruction Following Evaluation)
iaDéfinition
IFEval (Instruction Following Evaluation) est un benchmark developpe par Google (Zhou et al., 2023) qui evalue la capacite des LLMs a suivre des instructions formelles, verifiables automatiquement par programme. Le benchmark se compose d'environ 500 prompts contenant des contraintes precises et verificables : 'Ecris une reponse de 300 a 400 mots', 'Utilise au moins 3 mentions du mot "securite"', 'Ta reponse doit commencer par "Bonjour"', 'Ne pas utiliser de virgules'. L'originalite d'IFEval est la verification automatique : contrairement aux benchmarks qui necessitent un juge humain ou un LLM, les contraintes IFEval sont suffisamment formelles pour etre verifiees par du code Python. Cela permet une evaluation reproductible et scalable. Les types de contraintes incluent : longueur (mots, phrases, paragraphes), mots-cles (inclure/exclure), format (JSON, markdown, listes), structure (commencer par, finir par), et style (eviter les pronoms, ecrire en majuscules). IFEval mesure deux niveaux de conformite : Prompt-level accuracy (le prompt entier satisfait toutes ses contraintes ?) et Instruction-level accuracy (quelle proportion des contraintes individuelles sont respectees ?). La distinction permet d'identifier si un modele rate systematiquement certains types de contraintes. Les scores IFEval revelent des differences importantes entre les modeles d'instruction following : GPT-4o atteint ~87% prompt-level, Claude 3.5 Sonnet ~89%, Llama 3.1 70B Instruct ~88%. Les modeles plus petits ont des scores nettement inferieurs : Llama 3.2 1B ~60%, Mistral 7B ~67%. IFEval est particulierement pertinent pour les applications enterprise ou les LLMs doivent respecter des contraintes de format strictes : generation de rapports avec structure imposee, remplissage de formulaires, generation de code avec contraintes syntaxiques, et tout scenario ou la non-conformite de format cause des erreurs en aval.
Types de contraintes IFEval
| Categorie | Exemple de contrainte |
|---|---|
| Longueur | 'Ecris exactement 5 phrases.' |
| Mots-cles | 'Mentionne le mot "zero-trust" au moins 4 fois.' |
| Format | 'Reponds au format JSON avec les cles title et summary.' |
| Structure | 'Commence ta reponse par la lettre J.' |
| Style | 'N\'utilise pas de point d\'exclamation.' |
Scores IFEval (prompt-level strict)
| Modele | Score % |
|---|---|
| Claude 3.5 Sonnet | 89.4% |
| GPT-4o | 87.2% |
| Llama 3.1 70B Instruct | 88.1% |
| Mistral 7B Instruct v0.3 | 67.4% |
| Llama 3.2 1B Instruct | 60.1% |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h