Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

BIG-Bench

ia

Définition

BIG-Bench (Beyond the Imitation Game Benchmark) est une suite de benchmarks collaboratifs publiee par Srivastava et al. (2022) avec plus de 450 auteurs de 132 institutions, comprenant 204 taches conçues pour tester des capacites emergentes et etonnantes des LLMs. L'objectif est d'aller au-dela des benchmarks traditionnels pour mesurer ce que les LLMs peuvent faire dans des domaines varies et inattendus. Les 204 taches BIG-Bench couvrent : raisonnement logique, arithmetique, multilingual (200+ langues), code, sciences, ethique, generation de poesie, jeux de mots, musique, physique naïve, theorie de l'esprit, et des taches specifiques comme 'detecter les syllogismes valides' ou 'expliquer l'humour'. Cette diversite unique permet d'evaluer les LLMs sous des angles impossibles avec les benchmarks classiques. BIG-Bench Hard (BBH) est un subset de 23 taches particulierement difficiles sur lesquelles les modeles de 2022 etaient mauvais (< 50%). Ce subset est devenu un benchmark standard pour evaluer les capacites de raisonnement avance : raisonnement causal, deduction logique multi-etapes, arithmetique de date/calendrier, et interpretation de code. Les resultats BIG-Bench ont mis en evidence le phenomene d'emergence : certaines capacites n'apparaissent qu'au-dela d'un seuil de taille de modele, passant soudainement de negligeable a substantielle. Ces 'emergent abilities' ont alimente le debat sur la nature du scaling des LLMs. En 2025, la plupart des modeles frontieres (GPT-4, Claude 3.5, Gemini 1.5) saturent de nombreuses taches BIG-Bench. Des versions plus difficiles (BIG-Bench Extra Hard) sont en developpement. BIG-Bench reste precieux comme reference historique de la progression des capacites LLMs.

BIG-Bench Hard : exemples de taches

  • Logical Deduction : 'A est plus grand que B. B est plus grand que C. C est-il plus grand que A ?' (5+ variables)
  • Date Understanding : 'La reunion etait hier, 31 decembre. Quelle est la date dans 10 jours ?'
  • Causal Judgement : 'X s\'est produit a cause de A ou de B ? Justifie.'
  • Penguins In A Table : lire un tableau, repondre a des questions complexes

Scores BIG-Bench Hard (3-shot CoT)

ModeleScore %
o1 / o3~95%
GPT-4o76.6%
Claude 3.5 Sonnet79.4%
Llama 3.1 70B64.6%
GPT-3.5 Turbo52.7%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis