Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Attention multi-requetes MQA

ia

Définition

L'attention multi-requetes, ou MQA (Multi-Query Attention), est une optimisation du mecanisme d'attention multi-tetes dans les transformeurs, ou toutes les tetes d'attention partagent une unique paire de projections cle et valeur, tout en conservant des projections de requete distinctes par tete. Dans l'attention multi-tetes standard, chaque tete possede ses propres matrices de cle et de valeur, ce qui multiplie la taille du cache KV, la memoire stockant les cles et valeurs deja calculees pour accelerer la generation token par token en inference autoregressive. En reduisant ce cache a une seule paire cle-valeur partagee, MQA diminue drastiquement la bande passante memoire necessaire lors de la generation, ce qui accelere significativement l'inference et reduit le cout de deploiement a grande echelle, un enjeu majeur pour servir des millions de requetes simultanees. Cette technique, introduite par Noam Shazeer en 2019 et adoptee notamment par PaLM, a toutefois un cout en qualite du modele, du fait de la reduction de la diversite representationnelle entre tetes. L'attention par requetes groupees, ou GQA, constitue un compromis intermediaire, partageant les cles et valeurs entre plusieurs sous-groupes de tetes plutot qu'une seule. Le choix entre attention standard, MQA et GQA est aujourd'hui un arbitrage architectural direct entre cout d'inference et qualite, central dans la conception des LLM de production.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis