Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Compression du cache KV

ia

Définition

La compression du cache KV désigne un ensemble de techniques visant à réduire la taille du cache de valeurs-clés d'un grand modèle de langage en mémoire GPU lors de l'inférence, ce cache croissant linéairement avec la longueur de la séquence traitée et le nombre de requêtes simultanées, au point de devenir souvent le principal facteur limitant le débit d'un serveur d'inférence. Plusieurs approches existent : la quantification du cache KV, qui stocke les valeurs sur 8 ou 4 bits au lieu de 16, réduit l'empreinte mémoire par un facteur deux à quatre avec un impact limité sur la qualité ; les méthodes d'éviction ou de sparsification, qui suppriment ou résument les entrées correspondant aux tokens jugés les moins importants pour les prédictions futures, selon des scores d'attention ; et les architectures d'attention modifiées, comme Grouped Query Attention ou Multi-Query Attention, qui réduisent nativement le nombre de têtes dont les clés et valeurs doivent être stockées, une approche utilisée par exemple dans Llama 2 et Mistral. La compression du cache KV permet de traiter des contextes plus longs et davantage de requêtes concurrentes sans augmenter la mémoire GPU disponible. Pour une DSI, cette famille de techniques est un levier direct de réduction du coût d'infrastructure d'inférence, en particulier pour les cas d'usage à long contexte comme l'analyse de documents.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis