MMLU (Massive Multitask Language Understanding)
iaDéfinition
MMLU (Massive Multitask Language Understanding) est l'un des benchmarks d'evaluation les plus utilises pour mesurer les connaissances et capacites de raisonnement des LLMs dans 57 domaines academiques distincts. Developpe par Hendrycks et al. (UC Berkeley, 2021), MMLU couvre des sujets allant des mathematiques elementaires a la medecine, du droit aux sciences informatiques, en passant par l'histoire, l'astronomie et la philosophie. MMLU se compose de 15 908 questions a choix multiples (4 options, une seule bonne reponse) issues de differentes disciplines. Les questions sont organisees en 57 sous-categories et concoues pour tester des niveaux de connaissance allant du lycee au niveau professionnel/expert. Exemples : abstract algebra, anatomy, clinical knowledge, computer security, medical genetics, virology. L'evaluation se fait typiquement en few-shot (5-shot) : le modele recoit 5 exemples de questions/reponses dans le domaine avant la question cible. Le score final est le pourcentage de reponses correctes sur l'ensemble des 57 categories. Les scores MMLU sont devenus des indicateurs de reference : GPT-4 ~87%, Claude 3.5 Sonnet ~88%, LLaMA 3 70B ~82%, Mistral Large 2 ~84%, DeepSeek V3 ~88.5%. MMLU a des limites reconnues : contamination potentielle des donnees de test, biais vers l'anglais, questions parfois ambigues. MMLU-Pro (2024) propose une version amelioree avec des questions plus difficiles et 10 options de reponse. Pour les responsables IA en entreprise, MMLU est un bon indicateur des connaissances generales d'un LLM, mais doit etre complete par des evaluations sur le domaine metier specifique.
Structure de l'evaluation MMLU
| Categorie | Nb questions | Niveau |
|---|---|---|
| STEM (math, physique, bio, chimie) | ~4500 | Lycee a Expert |
| Sciences humaines (histoire, philo, droit) | ~3000 | Lycee a Pro |
| Sciences sociales (economie, politique) | ~2500 | Lycee a Pro |
| Autres (business, medecine) | ~5900 | Professionnel |
Evaluation avec lm-evaluation-harness
lm_eval --model hf \
--model_args pretrained=mistralai/Mistral-7B-Instruct-v0.3 \
--tasks mmlu \
--num_fewshot 5 \
--batch_size 8Scores MMLU des principaux modeles (5-shot)
- GPT-4o : 87.2%
- Claude 3.5 Sonnet : 88.3%
- LLaMA 3.1 70B : 83.6%
- Mistral Large 2 : 84.0%
- Qwen2.5 72B : 86.1%
- DeepSeek V3 : 88.5%
Limites et alternatives
MMLU-Pro : questions 10-options, plus difficiles, moins de data contamination. GPQA Diamond : questions expert verifiees resistantes a la search. ARC-Challenge : raisonnement scientifique lycee.
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h