Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Metrique BLEU

ia

Définition

BLEU (Bilingual Evaluation Understudy) est une metrique historiquement developpee pour juger la qualite de traductions automatiques, en mesurant le chevauchement de n-grammes (sequences de mots consecutifs) entre le texte genere et des traductions de reference humaines. Le calcul combine la precision sur des n-grammes de differentes tailles (generalement de un a quatre mots consecutifs), moyennee geometriquement, et une penalite de brievete qui sanctionne les traductions anormalement courtes susceptibles d'obtenir artificiellement une precision elevee en evitant les mots risques. BLEU privilegie donc la precision : il verifie que ce que le modele a genere figure bien dans la reference, sans se soucier symetriquement de savoir si tout le contenu de la reference a ete restitue. Cette metrique reste largement citee par heritage historique dans les publications sur la traduction automatique et, plus largement, sur la generation de texte, en raison de sa simplicite de calcul et de sa reproductibilite totale sans intervention humaine. Ses limites sont bien documentees : correlation imparfaite avec le jugement humain de qualite, insensibilite aux synonymes et reformulations valides, et penalisation excessive de traductions correctes mais formulees differemment de la reference disponible. Pour un DSI, BLEU garde un interet pour un suivi de regression rapide entre deux versions d'un meme systeme, mais ne doit plus servir seul de critere de decision face a des metriques semantiques plus recentes comme BERTScore ou a une evaluation humaine.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis