Positional Encoding
iaDéfinition
Le Positional Encoding (encodage positionnel) est une technique essentielle dans les architectures Transformer pour injecter une information sur la position des tokens dans une séquence. Contrairement aux RNNs et LSTMs qui traitent les séquences de manière séquentielle et intrinsèquement consciente de l'ordre, les Transformers traitent tous les tokens en parallèle via le Self-Attention — ils ne possèdent donc aucune notion d'ordre par défaut. Sans encodage positionnel, "chat mange souris" et "souris mange chat" produiraient les mêmes représentations. Dans le Transformer original (Vaswani et al., 2017), le positional encoding utilise des fonctions sinusoïdales à différentes fréquences : PE(pos, 2i) = sin(pos / 10000^(2i/d_model)) et PE(pos, 2i+1) = cos(pos / 10000^(2i/d_model)). Ces vecteurs sont additionnés aux embeddings de tokens avant d'entrer dans le premier bloc d'attention. L'avantage est que le modèle peut généraliser à des longueurs de séquences non vues à l'entraînement. L'encodage positionnel appris (learned positional embeddings), utilisé dans BERT et GPT-2, consiste en une matrice de paramètres entraînables de taille (max_length × d_model). Plus flexible mais limité à la longueur maximale vue à l'entraînement. Les LLMs modernes ont largement adopté des approches d'encodage positionnel relatif : ALiBi (Attention with Linear Biases), RoPE (Rotary Position Embedding) et YaRN permettent de mieux extrapoler à des longueurs de contexte très supérieures à celles de l'entraînement, ce qui est crucial pour les LLMs à long contexte (128K-1M tokens). Pour les praticiens MLOps, le choix du positional encoding impacte directement la capacité du modèle à gérer de longs documents dans les pipelines RAG et les applications de synthèse documentaire.
Fonctionnement technique
Trois familles d'encodage positionnel :
- Absolu sinusoïdal : vecteurs fixes basés sur sin/cos à différentes fréquences (Transformer original)
- Absolu appris : matrice entraînable P ∈ ℝ^(max_len × d) ajoutée aux embeddings (BERT, GPT-2)
- Relatif (RoPE, ALiBi) : encode la distance relative entre tokens directement dans le calcul d'attention, sans modifier les embeddings
Comparatif des approches modernes
| Méthode | Modèles | Extrapolation |
|---|---|---|
| RoPE | LLaMA, Mistral, Qwen | Bonne avec YaRN/LongRoPE |
| ALiBi | MPT, BLOOM | Très bonne |
| Absolu appris | GPT-4, PaLM | Limitée |
Impact sur les pipelines RAG
Le positional encoding détermine la longueur de contexte exploitable. Avec RoPE + YaRN, Llama 3.1 70B supporte 128K tokens, permettant d'ingérer des documents de 300 pages sans chunking. À surveiller : l'effet "lost in the middle" où les informations au centre du contexte sont moins bien mémorisées.
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h