Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

LongBench

ia

Définition

LongBench est un benchmark bilingue (anglais et chinois) developpe par l'equipe THUDM (Tsinghua University, 2023) pour evaluer la comprehension de documents longs par les LLMs. Il comprend 21 sous-taches dans 6 categories : Single-document QA, Multi-document QA, Summarization, Few-shot learning, Code completion, et Synthetic tasks, avec des contextes allant de 5000 a 200000 tokens. La particularite de LongBench est son evaluation bilingue et l'accent mis sur des scenarios realistes : les documents sont issus de sources authentiques (Wikipedia, arXiv, livres, bases de code GitHub), les questions sont generees et verifiees par des humains, et les metriques couvrent l'exactitude (F1, EM pour le QA), la qualite de resume (ROUGE), et la precision de completion de code. Les sous-taches les plus discriminantes de LongBench : (1) MuSiQue (multi-document QA avec chaines de raisonnement implicites), (2) HotpotQA multi-hop a long contexte, (3) 2WikiMultihopQA, (4) TREC et TriviaQA pour le few-shot a long contexte, et (5) RepoBench-P pour la completion de code dans des repositoires entiers. Les scores LongBench revelent des differences importantes entre les modeles 'long-context' declares : des modeles qui performent bien sur Needle in a Haystack (simple retrieval) peuvent echouer sur LongBench (comprehension et raisonnement). Claude 3 et GPT-4 Turbo dominent sur les taches necessitant du raisonnement multi-hop, tandis que des modeles open-source plus petits peinent sur ces memes taches. LongBench v2 (2024) a introduit des taches encore plus difficiles avec des contextes de 32K-128K tokens et une focus sur le raisonnement en profondeur dans de longs documents, plus resistant a la memorisation et au fine-tuning specifique au benchmark.

Evaluation avec LongBench

# pip install longbench
from longbench import LongBench

benchmark = LongBench(
    tasks=['qasper', 'hotpotqa', '2wikimqa', 'musique'],
    language='en'  # 'en' ou 'zh'
)

# Evaluer votre modele
results = benchmark.evaluate(
    model_fn=lambda prompt: your_model.generate(prompt),
    max_length=128000  # Fenetre de contexte max
)
print(results)  # {task: score} pour chaque tache

Scores LongBench moyens

ModeleAvg. Score
Claude 3.5 Sonnet (200K)~68%
GPT-4o (128K)~65%
Llama 3.1 70B (128K)~58%
Mistral 7B (8K)~39%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis