Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

MMLU (Massive Multitask Language Understanding)

ia

Définition

MMLU (Massive Multitask Language Understanding) est l'un des benchmarks d'evaluation les plus utilises pour mesurer les connaissances et capacites de raisonnement des LLMs dans 57 domaines academiques distincts. Developpe par Hendrycks et al. (UC Berkeley, 2021), MMLU couvre des sujets allant des mathematiques elementaires a la medecine, du droit aux sciences informatiques, en passant par l'histoire, l'astronomie et la philosophie. MMLU se compose de 15 908 questions a choix multiples (4 options, une seule bonne reponse) issues de differentes disciplines. Les questions sont organisees en 57 sous-categories et concoues pour tester des niveaux de connaissance allant du lycee au niveau professionnel/expert. Exemples : abstract algebra, anatomy, clinical knowledge, computer security, medical genetics, virology. L'evaluation se fait typiquement en few-shot (5-shot) : le modele recoit 5 exemples de questions/reponses dans le domaine avant la question cible. Le score final est le pourcentage de reponses correctes sur l'ensemble des 57 categories. Les scores MMLU sont devenus des indicateurs de reference : GPT-4 ~87%, Claude 3.5 Sonnet ~88%, LLaMA 3 70B ~82%, Mistral Large 2 ~84%, DeepSeek V3 ~88.5%. MMLU a des limites reconnues : contamination potentielle des donnees de test, biais vers l'anglais, questions parfois ambigues. MMLU-Pro (2024) propose une version amelioree avec des questions plus difficiles et 10 options de reponse. Pour les responsables IA en entreprise, MMLU est un bon indicateur des connaissances generales d'un LLM, mais doit etre complete par des evaluations sur le domaine metier specifique.

Structure de l'evaluation MMLU

CategorieNb questionsNiveau
STEM (math, physique, bio, chimie)~4500Lycee a Expert
Sciences humaines (histoire, philo, droit)~3000Lycee a Pro
Sciences sociales (economie, politique)~2500Lycee a Pro
Autres (business, medecine)~5900Professionnel

Evaluation avec lm-evaluation-harness

lm_eval --model hf \
  --model_args pretrained=mistralai/Mistral-7B-Instruct-v0.3 \
  --tasks mmlu \
  --num_fewshot 5 \
  --batch_size 8

Scores MMLU des principaux modeles (5-shot)

  • GPT-4o : 87.2%
  • Claude 3.5 Sonnet : 88.3%
  • LLaMA 3.1 70B : 83.6%
  • Mistral Large 2 : 84.0%
  • Qwen2.5 72B : 86.1%
  • DeepSeek V3 : 88.5%

Limites et alternatives

MMLU-Pro : questions 10-options, plus difficiles, moins de data contamination. GPQA Diamond : questions expert verifiees resistantes a la search. ARC-Challenge : raisonnement scientifique lycee.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis