HellaSwag
iaDéfinition
HellaSwag (Harder Endings, Longer contexts, and Low-shot Activities For Situations With Adversarial Generations) est un benchmark de completion de phrase testant le raisonnement de sens commun, developpe par Zellers et al. (2019). Il propose 70K exemples de type : une situation est decrite, et 4 completions sont proposees dont 3 sont plausibles mais incorrectes (generees par un LLM adverse) et 1 est la vraie suite. L'originalite de HellaSwag est sa construction adversariale : les distracteurs (fausses reponses) sont generes par un modele adverse pour etre maximalement plausibles et pieger les LLMs. Exemple : 'Une personne cuisine. Elle met la poele sur le feu et verse de l'huile...' avec comme completions : (A) Elle mange son repas. (B) Elle remue les ingredients avec une spatule. (C) Elle lave la vaisselle. (D) Elle prepare un gateau. La bonne reponse est B, mais A et D sont plausibles. HellaSwag a joue un role important dans l'histoire de l'evaluation des LLMs : quand il a ete publie en 2019, les meilleurs modeles (BERT) atteignaient ~47% (les humains font 95%). Aujourd'hui, les modeles 70B+ depassent 90%, indiquant que HellaSwag est pratiquement sature pour les grands LLMs. Comme ARC-Challenge, HellaSwag est maintenant utilise principalement pour comparer des petits modeles (1-7B params) ou il reste discriminant. Pour les grands modeles, des benchmarks plus difficiles (GPQA, MMLU-Pro, ARC-AGI) ont pris le relais. HellaSwag est disponible dans LM-Eval-Harness (Eleuther AI) et fait partie du benchmark 'Open LLM Leaderboard v1' de HuggingFace, qui inclut aussi ARC-Challenge, MMLU, TruthfulQA, Winogrande et GSM8K pour un profil complet d'un modele 7B.
Exemple HellaSwag
Contexte : 'Ils preparent une sauce. D'abord ils font revenir des oignons dans l'huile d'olive.'
- A) 'Ils ajoutent ensuite de l'eau froide et remuent.' (plausible mais incorrect — eau froide sur oignons = erreur culinaire)
- B) 'Ils incorporent la tomate concassee et laissent mijoter.' (correct)
- C) 'Ils retirent la poele du feu et vont faire leurs achats.' (incohérent temporellement)
- D) 'Ils saupoudrent de sucre glace et de cannelle.' (incorrect — ce serait pour un dessert)
Scores HellaSwag (10-shot)
| Modele | Score % |
|---|---|
| GPT-4 / Claude 3.5 Sonnet | ~95% |
| Llama 3.1 70B | 93.4% |
| Mistral 7B v0.3 | 81.3% |
| TinyLlama 1.1B | 59.2% |
| BERT large | 47.3% |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés. 2.1.7
Un projet cybersécurité ?
Expert dispo · Réponse 24h