Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Parallélisme de données distribué (DDP)

ia

Définition

Le parallélisme de données distribué (DDP, Distributed Data Parallelism) est une méthode d'entraînement qui réplique un même modèle sur plusieurs accélérateurs (GPU ou TPU) et répartit les lots de données entre ces répliques. Chaque copie calcule ses propres gradients sur un sous-lot, puis une opération de synchronisation, typiquement un all-reduce, agrège les gradients de toutes les répliques avant la mise à jour des poids. Cette approche est native dans PyTorch via torch.nn.parallel.DistributedDataParallel et constitue la brique de base de tout entraînement multi-GPU ou multi-nœud. Elle diffère du parallélisme de modèle, où c'est le modèle lui-même qui est découpé entre les dispositifs. Le DDP scale bien tant que le modèle tient en mémoire sur un seul accélérateur ; au-delà, il se combine avec le parallélisme tensoriel ou ZeRO pour réduire l'empreinte mémoire par GPU. Les enjeux pratiques concernent la bande passante réseau entre nœuds (InfiniBand, NVLink), la taille du lot global qui croît avec le nombre de répliques et peut nécessiter un ajustement du taux d'apprentissage, et la tolérance aux pannes lors d'entraînements de plusieurs semaines. Pour un DSI, le DDP conditionne le dimensionnement des clusters GPU et le coût d'un projet de fine-tuning ou de pré-entraînement de modèles de fondation.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis