Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Positional Encoding

ia

Définition

Le Positional Encoding (encodage positionnel) est une technique essentielle dans les architectures Transformer pour injecter une information sur la position des tokens dans une séquence. Contrairement aux RNNs et LSTMs qui traitent les séquences de manière séquentielle et intrinsèquement consciente de l'ordre, les Transformers traitent tous les tokens en parallèle via le Self-Attention — ils ne possèdent donc aucune notion d'ordre par défaut. Sans encodage positionnel, "chat mange souris" et "souris mange chat" produiraient les mêmes représentations. Dans le Transformer original (Vaswani et al., 2017), le positional encoding utilise des fonctions sinusoïdales à différentes fréquences : PE(pos, 2i) = sin(pos / 10000^(2i/d_model)) et PE(pos, 2i+1) = cos(pos / 10000^(2i/d_model)). Ces vecteurs sont additionnés aux embeddings de tokens avant d'entrer dans le premier bloc d'attention. L'avantage est que le modèle peut généraliser à des longueurs de séquences non vues à l'entraînement. L'encodage positionnel appris (learned positional embeddings), utilisé dans BERT et GPT-2, consiste en une matrice de paramètres entraînables de taille (max_length × d_model). Plus flexible mais limité à la longueur maximale vue à l'entraînement. Les LLMs modernes ont largement adopté des approches d'encodage positionnel relatif : ALiBi (Attention with Linear Biases), RoPE (Rotary Position Embedding) et YaRN permettent de mieux extrapoler à des longueurs de contexte très supérieures à celles de l'entraînement, ce qui est crucial pour les LLMs à long contexte (128K-1M tokens). Pour les praticiens MLOps, le choix du positional encoding impacte directement la capacité du modèle à gérer de longs documents dans les pipelines RAG et les applications de synthèse documentaire.

Fonctionnement technique

Trois familles d'encodage positionnel :

  • Absolu sinusoïdal : vecteurs fixes basés sur sin/cos à différentes fréquences (Transformer original)
  • Absolu appris : matrice entraînable P ∈ ℝ^(max_len × d) ajoutée aux embeddings (BERT, GPT-2)
  • Relatif (RoPE, ALiBi) : encode la distance relative entre tokens directement dans le calcul d'attention, sans modifier les embeddings

Comparatif des approches modernes

MéthodeModèlesExtrapolation
RoPELLaMA, Mistral, QwenBonne avec YaRN/LongRoPE
ALiBiMPT, BLOOMTrès bonne
Absolu apprisGPT-4, PaLMLimitée

Impact sur les pipelines RAG

Le positional encoding détermine la longueur de contexte exploitable. Avec RoPE + YaRN, Llama 3.1 70B supporte 128K tokens, permettant d'ingérer des documents de 300 pages sans chunking. À surveiller : l'effet "lost in the middle" où les informations au centre du contexte sont moins bien mémorisées.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis