BIG-Bench
iaDéfinition
BIG-Bench (Beyond the Imitation Game Benchmark) est une suite de benchmarks collaboratifs publiee par Srivastava et al. (2022) avec plus de 450 auteurs de 132 institutions, comprenant 204 taches conçues pour tester des capacites emergentes et etonnantes des LLMs. L'objectif est d'aller au-dela des benchmarks traditionnels pour mesurer ce que les LLMs peuvent faire dans des domaines varies et inattendus. Les 204 taches BIG-Bench couvrent : raisonnement logique, arithmetique, multilingual (200+ langues), code, sciences, ethique, generation de poesie, jeux de mots, musique, physique naïve, theorie de l'esprit, et des taches specifiques comme 'detecter les syllogismes valides' ou 'expliquer l'humour'. Cette diversite unique permet d'evaluer les LLMs sous des angles impossibles avec les benchmarks classiques. BIG-Bench Hard (BBH) est un subset de 23 taches particulierement difficiles sur lesquelles les modeles de 2022 etaient mauvais (< 50%). Ce subset est devenu un benchmark standard pour evaluer les capacites de raisonnement avance : raisonnement causal, deduction logique multi-etapes, arithmetique de date/calendrier, et interpretation de code. Les resultats BIG-Bench ont mis en evidence le phenomene d'emergence : certaines capacites n'apparaissent qu'au-dela d'un seuil de taille de modele, passant soudainement de negligeable a substantielle. Ces 'emergent abilities' ont alimente le debat sur la nature du scaling des LLMs. En 2025, la plupart des modeles frontieres (GPT-4, Claude 3.5, Gemini 1.5) saturent de nombreuses taches BIG-Bench. Des versions plus difficiles (BIG-Bench Extra Hard) sont en developpement. BIG-Bench reste precieux comme reference historique de la progression des capacites LLMs.
BIG-Bench Hard : exemples de taches
- Logical Deduction : 'A est plus grand que B. B est plus grand que C. C est-il plus grand que A ?' (5+ variables)
- Date Understanding : 'La reunion etait hier, 31 decembre. Quelle est la date dans 10 jours ?'
- Causal Judgement : 'X s\'est produit a cause de A ou de B ? Justifie.'
- Penguins In A Table : lire un tableau, repondre a des questions complexes
Scores BIG-Bench Hard (3-shot CoT)
| Modele | Score % |
|---|---|
| o1 / o3 | ~95% |
| GPT-4o | 76.6% |
| Claude 3.5 Sonnet | 79.4% |
| Llama 3.1 70B | 64.6% |
| GPT-3.5 Turbo | 52.7% |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h