Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Sequence Length (LLM Training)

ia

Définition

La Sequence Length (longueur de sequence) est un hyperparametre fondamental de l'entrainement des LLMs qui definit le nombre maximal de tokens traites dans un seul exemple d'entrainement. Elle determine directement la fenetre de contexte du modele, le cout memoire de l'attention (quadratique en O(L^2)), et le trade-off avec la taille de batch. L'impact quadratique de la sequence length sur la memoire : le mecanisme d'attention standard (softmax(QK^T/sqrt(d_k))V) necessite de materialiser la matrice d'attention de taille L x L. Pour une sequence de L=32768 tokens et 32 tetes d'attention en BF16, la matrice d'attention seule represente 32 * 32768^2 * 2 bytes ≈ 64 GB, rendant la full attention impossible sans optimisations. Les solutions pour les longues sequences : (1) Flash Attention — calcul par blocs pour eviter de materialiser la matrice L x L (algorithme IO-aware, standard en 2024), (2) Sliding Window Attention — chaque token n'attende qu'une fenetre de W tokens precedents (Mistral, Longformer), (3) Ring Attention — distribuer le calcul d'attention sur plusieurs GPUs, permettant des sequences theoriquement illimitees. Le trade-off sequence length / batch size : la memoire GPU est fixe. Doubler la sequence length reduit d'abord lineairement la taille de batch possible (memoire KV cache), puis quadratiquement si l'on materialise la matrice d'attention. En pratique avec Flash Attention (attention O(L) en memoire), le trade-off est principalement lineaire, permettant les sequence lengths de 128K+ avec Flash Attention. L'extension de sequence length post-pretraining : les modeles peuvent etre fine-tunes pour des sequence lengths plus longues que pendant le pretraining (Long Context Fine-Tuning). Des techniques comme YaRN (Yet another RoPE Extension), LongRoPE, et RoPE ABF (Adjusted Base Frequency) modifient les positions encodings pour extrapoler au-dela de la fenetre de pretraining. Llama 3 a ete etendu de 8K a 128K tokens avec ces techniques.

Memoire attention selon la sequence length

Seq LengthMatrice attention (BF16, 32h)Avec Flash Attention
20480.5 GBnegligeable
81928 GBnegligeable
32768128 GB (impossible 1 GPU)OK (Flash Attn)
128K2 TB (impossible)OK (Flash Attn)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis