Sequence Length (LLM Training)
iaDéfinition
La Sequence Length (longueur de sequence) est un hyperparametre fondamental de l'entrainement des LLMs qui definit le nombre maximal de tokens traites dans un seul exemple d'entrainement. Elle determine directement la fenetre de contexte du modele, le cout memoire de l'attention (quadratique en O(L^2)), et le trade-off avec la taille de batch. L'impact quadratique de la sequence length sur la memoire : le mecanisme d'attention standard (softmax(QK^T/sqrt(d_k))V) necessite de materialiser la matrice d'attention de taille L x L. Pour une sequence de L=32768 tokens et 32 tetes d'attention en BF16, la matrice d'attention seule represente 32 * 32768^2 * 2 bytes ≈ 64 GB, rendant la full attention impossible sans optimisations. Les solutions pour les longues sequences : (1) Flash Attention — calcul par blocs pour eviter de materialiser la matrice L x L (algorithme IO-aware, standard en 2024), (2) Sliding Window Attention — chaque token n'attende qu'une fenetre de W tokens precedents (Mistral, Longformer), (3) Ring Attention — distribuer le calcul d'attention sur plusieurs GPUs, permettant des sequences theoriquement illimitees. Le trade-off sequence length / batch size : la memoire GPU est fixe. Doubler la sequence length reduit d'abord lineairement la taille de batch possible (memoire KV cache), puis quadratiquement si l'on materialise la matrice d'attention. En pratique avec Flash Attention (attention O(L) en memoire), le trade-off est principalement lineaire, permettant les sequence lengths de 128K+ avec Flash Attention. L'extension de sequence length post-pretraining : les modeles peuvent etre fine-tunes pour des sequence lengths plus longues que pendant le pretraining (Long Context Fine-Tuning). Des techniques comme YaRN (Yet another RoPE Extension), LongRoPE, et RoPE ABF (Adjusted Base Frequency) modifient les positions encodings pour extrapoler au-dela de la fenetre de pretraining. Llama 3 a ete etendu de 8K a 128K tokens avec ces techniques.
Memoire attention selon la sequence length
| Seq Length | Matrice attention (BF16, 32h) | Avec Flash Attention |
|---|---|---|
| 2048 | 0.5 GB | negligeable |
| 8192 | 8 GB | negligeable |
| 32768 | 128 GB (impossible 1 GPU) | OK (Flash Attn) |
| 128K | 2 TB (impossible) | OK (Flash Attn) |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h