KV-Cache
iaDéfinition
Le KV-cache est une optimisation d'inférence des grands modèles de langage qui stocke les vecteurs clé et valeur, key et value, calculés par les couches d'attention pour chaque token déjà traité, afin d'éviter de les recalculer intégralement à chaque nouveau token généré. Dans l'architecture Transformer, le mécanisme d'attention doit en principe comparer chaque nouveau token à tous les tokens précédents du contexte ; sans cache, cela impose de recalculer l'ensemble des projections clé-valeur pour toute la séquence à chaque étape de génération, un coût quadratique prohibitif pour les longs contextes. En conservant ces vecteurs en mémoire GPU au fur et à mesure de la génération, le KV-cache réduit considérablement la latence, en particulier pour les conversations longues ou les documents volumineux traités dans la fenêtre de contexte. Sa contrepartie est une consommation mémoire significative, qui croît linéairement avec la longueur du contexte et le nombre de couches du modèle, ce qui pousse les fournisseurs d'inférence à développer des techniques complémentaires comme le paged attention, popularisé par vLLM, ou la quantification du cache. Pour les architectures multi-tenant, l'isolation correcte du KV-cache entre utilisateurs est un enjeu de sécurité critique : une fuite ou un partage accidentel de cache entre sessions pourrait exposer le contenu du contexte d'un autre utilisateur.
Description
Le KV-Cache (Key-Value Cache) est une optimisation d'inférence LLM qui stocke les vecteurs clé-valeur calculés lors de l'attention pour les tokens déjà traités. Cela évite de les recalculer à chaque nouveau token généré, réduisant significativement la latence pour les longues conversations.
Fonctionnement
Lors de l'inférence autorégressive, chaque nouveau token peut utiliser les KV déjà calculés pour tous les tokens précédents. Le cache est stocké en mémoire GPU (VRAM) et représente un compromis : réduction de latence au prix d'une consommation mémoire proportionnelle à la longueur du contexte.
Points clés
- Le KV-Cache peut représenter 30-70% de la VRAM requise pour les longues conversations avec des contextes étendus
- PagedAttention (vLLM) gère le KV-Cache en pages virtuelles pour maximiser l'utilisation mémoire en serving
- Le prompt caching (Anthropic, OpenAI) étend ce principe pour réutiliser le KV-Cache entre requêtes sur un même système prompt
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h