RULER (Long-Context Benchmark)
iaDéfinition
RULER (Retrieval, Understanding, Linking, and Evaluation for Long-context) est un benchmark de long contexte developpe par Hsieh et al. (NVIDIA, 2024) qui etend le test Needle in a Haystack en un framework configurable evaluant plusieurs types de capacites sur des contextes de 4K a 128K tokens. Il est conçu pour etre plus discriminant que NIAH (Needle in a Haystack) qui est sature par les modeles modernes. RULER comprend 4 types de taches : (1) Needle in a Haystack (NIAH) — retrouver un ou plusieurs 'faits aiguilles' inseres dans un long contexte, (2) Variable Tracing (VT) — suivre des chaines de variables ('x = y, y = z, z = valeur, x = ?'), (3) Aggregation (CWE/FWE) — compter/lister des mots ou des entites frequemment mentionnes, (4) Question Answering (QA) — repondre a des questions multi-sauts sur des documents longs. La configurabilite de RULER est son avantage cle : le nombre de 'needles', leur position, la profondeur de la chaine de raisonnement, et la longueur du contexte sont des parametres ajustables. Cela permet de creer des evaluations adaptees a la longueur de contexte specifique d'un modele et d'identifier precisement ses capacites et ses limites. Les resultats RULER revelent des differences significatives entre les modeles 'long-context' : Gemini 1.5 Pro maintient ~90% de performance jusqu'a 128K tokens, Claude 3 Sonnet decroit de 95% a 4K a 70% a 128K, tandis que les modeles Llama 3.1 128K showent une degradation significative au-dela de 32K. Ces differences ne sont pas visibles avec le NIAH simple. RULER est disponible sur HuggingFace et dans LM-Eval-Harness depuis 2024. Il est devenu le benchmark de reference pour evaluer les capacites reelles de long contexte, distinguant les modeles qui ont simplement augmente leur fenetre de contexte de ceux qui peuvent effectivement utiliser le long contexte pour du raisonnement complexe.
Types de taches RULER et difficultes
| Tache | Type | Difficulte |
|---|---|---|
| NIAH Single | Retrieval | Moderee |
| NIAH Multi-keys | Retrieval | Elevee |
| NIAH Multi-queries | Retrieval | Elevee |
| Variable Tracing (3 hops) | Reasoning | Tres elevee |
| Common Word Extraction | Aggregation | Moderee |
| QA 2-sauts | Reasoning | Elevee |
Scores RULER a 128K tokens
- Gemini 1.5 Pro : ~90% (excellent long-context)
- Claude 3.5 Sonnet : ~75%
- GPT-4o (128K) : ~72%
- LLaMA 3.1 70B (128K) : ~58%
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h