Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

RULER (Long-Context Benchmark)

ia

Définition

RULER (Retrieval, Understanding, Linking, and Evaluation for Long-context) est un benchmark de long contexte developpe par Hsieh et al. (NVIDIA, 2024) qui etend le test Needle in a Haystack en un framework configurable evaluant plusieurs types de capacites sur des contextes de 4K a 128K tokens. Il est conçu pour etre plus discriminant que NIAH (Needle in a Haystack) qui est sature par les modeles modernes. RULER comprend 4 types de taches : (1) Needle in a Haystack (NIAH) — retrouver un ou plusieurs 'faits aiguilles' inseres dans un long contexte, (2) Variable Tracing (VT) — suivre des chaines de variables ('x = y, y = z, z = valeur, x = ?'), (3) Aggregation (CWE/FWE) — compter/lister des mots ou des entites frequemment mentionnes, (4) Question Answering (QA) — repondre a des questions multi-sauts sur des documents longs. La configurabilite de RULER est son avantage cle : le nombre de 'needles', leur position, la profondeur de la chaine de raisonnement, et la longueur du contexte sont des parametres ajustables. Cela permet de creer des evaluations adaptees a la longueur de contexte specifique d'un modele et d'identifier precisement ses capacites et ses limites. Les resultats RULER revelent des differences significatives entre les modeles 'long-context' : Gemini 1.5 Pro maintient ~90% de performance jusqu'a 128K tokens, Claude 3 Sonnet decroit de 95% a 4K a 70% a 128K, tandis que les modeles Llama 3.1 128K showent une degradation significative au-dela de 32K. Ces differences ne sont pas visibles avec le NIAH simple. RULER est disponible sur HuggingFace et dans LM-Eval-Harness depuis 2024. Il est devenu le benchmark de reference pour evaluer les capacites reelles de long contexte, distinguant les modeles qui ont simplement augmente leur fenetre de contexte de ceux qui peuvent effectivement utiliser le long contexte pour du raisonnement complexe.

Types de taches RULER et difficultes

TacheTypeDifficulte
NIAH SingleRetrievalModeree
NIAH Multi-keysRetrievalElevee
NIAH Multi-queriesRetrievalElevee
Variable Tracing (3 hops)ReasoningTres elevee
Common Word ExtractionAggregationModeree
QA 2-sautsReasoningElevee

Scores RULER a 128K tokens

  • Gemini 1.5 Pro : ~90% (excellent long-context)
  • Claude 3.5 Sonnet : ~75%
  • GPT-4o (128K) : ~72%
  • LLaMA 3.1 70B (128K) : ~58%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis