Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Dense Model (vs MoE)

ia

Définition

Un Dense Model (modele dense) est un LLM ou l'integralite des parametres du modele est activee et utilise pour traiter chaque token, en opposition aux modeles Mixture of Experts (MoE) qui n'activent qu'une fraction des poids pour chaque token. LLaMA, Mistral, Gemma, Phi, et probablement GPT-4 (non confirme) sont des modeles denses. Les avantages des Dense Models par rapport aux MoE : (1) Latence d'inference predictible — pas de variabilite selon le routing des experts, (2) Implementation plus simple — pas de mecanisme de routing, pas de load balancing, (3) Moins de VRAM totale pour les petits modeles (un modele 7B dense necessite ~14GB BF16, vs ~47GB pour Mixtral 8x7B MoE), (4) Convergence plus stable lors de l'entrainement. Les inconvenients des Dense Models : pour atteindre la meme qualite qu'un MoE de meme cout d'inference, un modele dense doit etre plus petit (et donc potentiellement de moindre qualite), car les MoE beneficient de la capacite superieure des experts specialises sans cout d'inference proportionnel. La frontieres Dense vs MoE est parfois floue : les Hyper Sparse MoE (comme DeepSeek V3 avec 256 experts, 8 actifs) sont tres proches de modeles denses en termes de comportement practique, mais avec un overhead de routage. Des architectures hybrides (quelques couches MoE dans un modele majoritairement dense) emergent comme compromis. Pour les deployments enterprise, les Dense Models sont generalement preferes pour la predictibilite et la simplicite d'infrastructure : pas besoin de hardware specifique pour le routage des experts, pas de problemes de load balancing entre GPUs, et de meilleures garanties de latence pour les applications temps-reel.

Dense vs MoE : comparatif

CritereDense ModelMoE Model
Params actifs100%10-25%
Params totaux=actifs4-20x actifs
VRAM inferenceFaible (proportionnel)Eleve (tous params charges)
Cout computeEleveFaible (par token)
Complexite deploySimpleComplexe (routing)
ExemplesLLaMA 3, Gemma, Phi-3Mixtral, DeepSeek V3, GPT-4

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis