Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

ARC-Challenge

ia

Définition

ARC-Challenge (AI2 Reasoning Challenge) est un subset du dataset ARC developpe par l'Allen Institute for AI (AI2), compose de 1172 questions a choix multiples de sciences scolaires (niveau CE2 a 3eme) soigneusement selectionnees pour leur difficulte : ce sont les questions que les methodes de recuperation d'information et les modeles de langue simples ont echouee a repondre correctement lors de la creation du dataset. ARC est divise en ARC-Easy (questions repondues correctement par les methodes simples) et ARC-Challenge (questions difficiles, le benchmark de reference). Les questions testent des concepts scientifiques : physique elementaire ('Pourquoi les glaciers se deplacent-ils ?'), biologie ('Qu'est-ce qui se produit lors de la division cellulaire ?'), et raisonnement causal ('Si on retire les feuilles d'une plante, que se passera-t-il ?'). Les scores ARC-Challenge ont ete des indicateurs importants des progres en NLP : GPT-2 obtenait ~25% (equivalent du hasard a 4 choix), alors que les modeles modernes comme Llama 3.1 70B atteignent 96%+ en zero-shot. Ce benchmark est maintenant 'sature' pour les grands modeles, mais reste utile pour evaluer les petits modeles (1B-7B). ARC-Challenge est l'un des benchmarks de l'Eleuther AI LM-Eval-Harness, la suite d'evaluation standard de la communaute open-source. Il est utilise dans les comparaisons publiques de modeles sur Open LLM Leaderboard (HuggingFace) pour les modeles de moins de 70B. Des benchmarks plus difficiles comme GPQA Diamond et MMLU Pro ont remplace ARC-Challenge pour l'evaluation des grands modeles, mais ARC reste pertinent pour les modeles compacts (< 7B params) ou la performance sur les questions scientifiques simples differentie encore les modeles.

Exemple de questions ARC-Challenge

  • 'Un eleve met une plante en croissance dans un placard sombre pendant deux semaines. La plante mourra probablement parce qu'elle ne peut pas faire de... A) eau B) photosynthese C) respiration D) reproduction' — (B)
  • 'Lequel de ces exemples est une propriete chimique du fer ? A) conduire l'electricite B) se dilater quand chauffe C) se rouiller dans l'air humide D) etre attire par un aimant' — (C)

Scores ARC-Challenge (25-shot)

ModeleScore %
Llama 3.1 70B96.1%
Mistral 7B v0.360.9%
Llama 3.2 1B41.7%
GPT-2 Large25.6%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis