Cache de valeurs-clés paginé (PagedAttention)
iaDéfinition
Le cache de valeurs-clés paginé, popularisé sous le nom PagedAttention par le moteur d'inférence vLLM, est une méthode de gestion mémoire pour le cache de valeurs-clés, ou KV cache, des grands modèles de langage lors de l'inférence. Le KV cache stocke les représentations calculées pour chaque token déjà généré, afin d'éviter de les recalculer à chaque nouveau token, mais son allocation contiguë classique gaspille beaucoup de mémoire GPU par fragmentation, en particulier lorsque de nombreuses séquences de longueurs différentes sont traitées simultanément. En s'inspirant de la pagination mémoire des systèmes d'exploitation, le cache paginé découpe le KV cache en blocs de taille fixe non contigus en mémoire physique, gérés via une table de correspondance logique-physique. Cette approche réduit le gaspillage mémoire à quelques pourcents, contre parfois plus de la moitié de la mémoire allouée avec les méthodes classiques, et permet le partage de blocs identiques entre séquences, par exemple pour un prompt commun à plusieurs requêtes. Le gain principal est une augmentation du nombre de séquences traitées simultanément sur un même GPU, donc du débit du serveur d'inférence. Le cache de valeurs-clés paginé est aujourd'hui repris par la plupart des moteurs d'inférence modernes, dont TensorRT-LLM et Text Generation Inference. Pour une DSI, cette optimisation réduit directement le nombre de GPU nécessaires pour un volume de trafic donné.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.