LongBench
iaDéfinition
LongBench est un benchmark bilingue (anglais et chinois) developpe par l'equipe THUDM (Tsinghua University, 2023) pour evaluer la comprehension de documents longs par les LLMs. Il comprend 21 sous-taches dans 6 categories : Single-document QA, Multi-document QA, Summarization, Few-shot learning, Code completion, et Synthetic tasks, avec des contextes allant de 5000 a 200000 tokens. La particularite de LongBench est son evaluation bilingue et l'accent mis sur des scenarios realistes : les documents sont issus de sources authentiques (Wikipedia, arXiv, livres, bases de code GitHub), les questions sont generees et verifiees par des humains, et les metriques couvrent l'exactitude (F1, EM pour le QA), la qualite de resume (ROUGE), et la precision de completion de code. Les sous-taches les plus discriminantes de LongBench : (1) MuSiQue (multi-document QA avec chaines de raisonnement implicites), (2) HotpotQA multi-hop a long contexte, (3) 2WikiMultihopQA, (4) TREC et TriviaQA pour le few-shot a long contexte, et (5) RepoBench-P pour la completion de code dans des repositoires entiers. Les scores LongBench revelent des differences importantes entre les modeles 'long-context' declares : des modeles qui performent bien sur Needle in a Haystack (simple retrieval) peuvent echouer sur LongBench (comprehension et raisonnement). Claude 3 et GPT-4 Turbo dominent sur les taches necessitant du raisonnement multi-hop, tandis que des modeles open-source plus petits peinent sur ces memes taches. LongBench v2 (2024) a introduit des taches encore plus difficiles avec des contextes de 32K-128K tokens et une focus sur le raisonnement en profondeur dans de longs documents, plus resistant a la memorisation et au fine-tuning specifique au benchmark.
Evaluation avec LongBench
# pip install longbench
from longbench import LongBench
benchmark = LongBench(
tasks=['qasper', 'hotpotqa', '2wikimqa', 'musique'],
language='en' # 'en' ou 'zh'
)
# Evaluer votre modele
results = benchmark.evaluate(
model_fn=lambda prompt: your_model.generate(prompt),
max_length=128000 # Fenetre de contexte max
)
print(results) # {task: score} pour chaque tacheScores LongBench moyens
| Modele | Avg. Score |
|---|---|
| Claude 3.5 Sonnet (200K) | ~68% |
| GPT-4o (128K) | ~65% |
| Llama 3.1 70B (128K) | ~58% |
| Mistral 7B (8K) | ~39% |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h