Positionnement relatif des tokens
iaDéfinition
Le positionnement relatif des tokens designe une famille de methodes d'encodage de position dans les architectures transformeurs, qui encodent la distance relative entre deux tokens plutot que leur position absolue dans la sequence. Les premiers transformeurs, comme le modele original de 2017, utilisaient un encodage positionnel absolu, ajoute une seule fois en entree, ce qui limitait la capacite du modele a generaliser a des longueurs de sequence superieures a celles vues pendant l'entrainement. Les methodes de positionnement relatif, dont RoPE, pour Rotary Position Embedding, sont devenues la reference dans la plupart des grands modeles de langage recents, dont Llama, Mistral et GPT-NeoX. RoPE encode la position en appliquant une rotation dans l'espace vectoriel aux representations de requete et de cle a l'interieur du mecanisme d'attention, de sorte que le produit scalaire entre deux tokens depende naturellement de leur distance relative plutot que de leur position absolue. Cette approche ameliore la capacite d'extrapolation a des contextes plus longs que ceux vus a l'entrainement, une propriete exploitee par des techniques d'extension de contexte comme le scaling lineaire ou le NTK-aware scaling. Le choix du schema de positionnement influence directement la longueur de contexte maximale exploitable et la robustesse du modele face a des sequences tres longues, un enjeu critique pour les usages documentaires en entreprise.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.