Plongement positionnel appris
iaDéfinition
Le plongement positionnel appris (learned positional embedding) est une methode par laquelle un modele Transformer encode la position de chaque token dans une sequence a l'aide d'un vecteur numerique optimise durant l'entrainement, plutot que calcule par une formule fixe. Contrairement aux plongements sinusoidaux introduits dans l'article originel Transformer (Vaswani et al., 2017), qui utilisent des fonctions sinus et cosinus deterministes, les plongements positionnels appris sont des parametres entraines comme les poids du reseau, stockes dans une table indexee par la position (0, 1, 2, jusqu'a la longueur maximale de contexte). Ils sont utilises notamment dans BERT et GPT-2. Leur principale limite est la generalisation : un modele entraine avec une longueur maximale fixe extrapole mal au-dela de cette limite, ce qui a motive le developpement d'alternatives comme RoPE (Rotary Position Embedding), utilisee par Llama et Mistral, ou ALiBi, plus robustes pour l'extension de contexte. Pour un ingenieur ML, le choix du mecanisme de plongement positionnel est un critere technique lors de la selection d'un modele open source destine a traiter de longs documents (contrats, rapports d'audit), car il determine directement la capacite reelle du modele a exploiter une fenetre de contexte annoncee sans degradation de performance.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.