Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Accumulation de gradient

ia

Définition

L'accumulation de gradient est une technique d'entraînement qui simule un lot de données de grande taille sans nécessiter la mémoire GPU correspondante. Plutôt que de calculer les gradients sur un seul lot puis de mettre à jour immédiatement les poids, le modèle traite plusieurs mini-lots successifs, additionne leurs gradients dans un buffer, et n'effectue la mise à jour des poids qu'après un nombre défini d'itérations. Le résultat est mathématiquement proche d'un entraînement avec un lot effectif égal à la somme des mini-lots traités. Cette méthode est essentielle lorsque la mémoire d'un GPU limite la taille de lot possible, par exemple pour le fine-tuning de grands modèles de langage sur du matériel contraint. Elle est disponible nativement dans les frameworks comme PyTorch, Hugging Face Transformers ou DeepSpeed, généralement via un simple paramètre gradient_accumulation_steps. L'accumulation de gradient a un coût : le temps d'entraînement augmente car le nombre de passes avant est plus élevé pour un même volume de données, même si la mémoire requise reste faible. Elle se distingue du parallélisme de données, qui répartit le calcul entre plusieurs GPU au lieu de l'étaler dans le temps sur un seul. Pour des équipes disposant de ressources GPU limitées, c'est souvent le premier levier utilisé avant d'investir dans du parallélisme multi-GPU.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis