Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Sparse MoE

ia

Définition

Le Sparse Mixture of Experts (Sparse MoE) est une architecture de réseaux de neurones qui combine un grand nombre d'experts (sous-réseaux spécialisés) avec un mécanisme de routage qui n'active qu'un petit sous-ensemble d'experts pour chaque token d'entrée. Contrairement au Dense MoE où tous les experts sont activés, le Sparse MoE permet d'avoir des modèles avec des milliards de paramètres tout en maintenant un coût computationnel équivalent à un modèle dense beaucoup plus petit. Le principe fondateur date du "Sparsely-Gated Mixture-of-Experts Layer" (Shazeer et al., 2017, Google Brain), mais c'est la série Switch Transformer (Fedus et al., 2021) puis Mixtral 8x7B (Mistral AI, 2023) qui ont démocratisé son usage. Dans Mixtral, chaque couche FFN est remplacée par 8 experts, et seuls 2 experts sont activés par token via un routeur Top-2. Résultat : 46.7B paramètres totaux mais seulement ~12.9B paramètres actifs par inférence — performances proches de Llama 2 70B pour un coût 6× moindre. DeepSeek V2 et V3 poussent le concept plus loin avec des architectures MoE ultra-fines (160 experts fins + 2 partagés, Top-6 pour DeepSeek V3), permettant une spécialisation extrême tout en maintenant un équilibre de charge efficace. GPT-4 et Google Gemini Ultra utilisent également des architectures MoE selon les analyses de la communauté. Pour les équipes de déploiement, le Sparse MoE pose des défis spécifiques : tous les experts doivent résider en mémoire (d'où 4 GPU × 24GB pour Mixtral 8x7B en FP16), même si seuls 2 sont actifs par token. Les frameworks vLLM et llama.cpp gèrent nativement les MoE avec des stratégies d'offloading expert pour les configurations à faible VRAM.

Architecture et routage

Dans un bloc Transformer MoE, la couche FFN dense est remplacée par :

  1. Un router (réseau linéaire léger) qui produit des scores softmax sur N experts
  2. Sélection Top-K experts (K=2 pour Mixtral, K=6 pour DeepSeek V3)
  3. Calcul pondéré : sortie = Σᵢ gate(xᵢ) × Expert_i(x)

Load Balancing

Sans contrainte, le routeur s'effondre (collapse) vers toujours les mêmes experts. Solutions :

  • Auxiliary loss : pénalise les déséquilibres de charge dans la loss d'entraînement
  • Expert choice routing : chaque expert choisit ses tokens (non top-k par token)
  • DeepSeek V3 : load balancing sans auxiliary loss via "sequence-level balance"

Modèles Sparse MoE disponibles

  • Mixtral 8x7B / 8x22B (Mistral AI) — disponibles sur HuggingFace
  • DeepSeek V3 (671B total, 37B actifs) — Apache 2.0
  • Qwen2.5-MoE (94B total, 22B actifs)
  • Arctic (Snowflake, 480B total, 17B actifs)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis