Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Long Context LLM

ia

Définition

Les Long Context LLMs sont des modeles de langage capables de traiter des fenetres de contexte de 128K a plusieurs millions de tokens, representant des milliers de pages de texte ou des bases de code entires. Cette capacite, developpee principalement depuis 2023-2024, change fundamentalement les architectures des applications LLM en permettant d'inclure directement des documents entiers dans le contexte plutot que de recourir a du RAG. L'evolution des fenetres de contexte : GPT-3 (2048 tokens), GPT-4 Turbo (128K), Claude 2.1 (200K), Claude 3 Opus/Sonnet (200K), Gemini 1.5 Pro (1M tokens), Gemini 1.5 Flash (1M tokens), LLaMA 3.1 (128K), Qwen-Long (1M tokens). En 2025, 1M tokens (environ 750K mots = une encyclopedie) est devenu le standard pour les modeles frontieres. Les techniques permettant les longs contextes : RoPE avec extension de frequence (YaRN, LongRoPE) pour etendre les encodages de position, Flash Attention 2/3 pour l'efficacite quadratique de l'attention, Memory-efficient chunking pour les activations, et des strategies d'entrainement progressif (entrainer d'abord sur contexte court, puis etendre). Les cas d'usage des Long Context LLMs : analyse de contrats complets (200-300 pages), revue de bases de code (100K+ lignes), analyse de transcriptions de reunions (10-20 heures), questions sur des livres entiers, deduplication et consolidation de large corpus de documentation, analyse de logs complets pour la securite. La tension entre Long Context et RAG : les Long Context LLMs ne remplacent pas le RAG mais le complement. Pour des corpora tres volumineux (millions de documents), le RAG reste necessaire. Pour des documents individuels de taille moyenne (<200 pages), l'approche 'whole document in context' peut etre plus simple et plus fiable que le RAG (pas de chunking, pas de retrieval, acces complet au document).

Long Context vs RAG : quand choisir ?

CritereLong ContextRAG
Volume< 1M tokens (~750K mots)Illimite
PrecisionHaute (contexte complet)Depend du retrieval
CoutEleve (1M tokens)Modere (chunks)
LatenceElevee (prefill long)Moderee
MaintenanceSimple (pas d'indexation)Complexe (pipeline)

Acceleration du prefill long contexte

  • Prompt caching (Anthropic, OpenAI) : cacher les tokens du systeme prompt pour reutilisation, reduction de cout de 90%
  • Speculative decoding : acceleration de la generation apres le prefill
  • KV cache quantisation : reduire la memoire du cache attention

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis