Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Continuous Training (ML)

ia

Définition

Le Continuous Training, ou entraînement continu, désigne la pratique consistant à réentraîner régulièrement et automatiquement un modèle de machine learning en production à partir de nouvelles données, afin de compenser la dérive naturelle de performance survenant lorsque la distribution des données réelles évolue par rapport aux données d'entraînement initiales, phénomène connu sous le nom de dérive de données ou de concept. Cette pratique s'intègre dans des pipelines MLOps automatisés déclenchant un nouveau cycle d'entraînement selon un calendrier fixe ou en réponse à une dégradation mesurée de la performance du modèle en production, suivie d'une phase de validation avant promotion via le model registry. Cette automatisation introduit un risque spécifique : si les nouvelles données d'entraînement ne sont pas rigoureusement validées, un attaquant capable d'influencer le flux de données de production, par exemple via des retours utilisateurs manipulés, peut progressivement empoisonner le modèle sans compromission directe de l'infrastructure d'entraînement, technique documentée dans le référentiel MITRE ATLAS. En défense, la validation automatisée de la qualité et de la cohérence statistique des nouvelles données avant intégration au cycle d'entraînement, la conservation d'un jeu de test de référence indépendant pour détecter toute dégradation anormale, l'approbation humaine avant promotion en production de toute nouvelle version, et la traçabilité complète des données utilisées à chaque cycle constituent des garde-fous indispensables.

Description

Le Continuous Training est la pratique MLOps de réentraîner automatiquement et périodiquement un modèle ML sur de nouvelles données pour contrer le data drift et le concept drift. Sans réentraînement continu, les performances des modèles se dégradent progressivement à mesure que la distribution des données réelles évolue.

Fonctionnement

Des pipelines automatisés (Kubeflow, Vertex AI Pipelines, MLflow) déclenchent le réentraînement selon des triggers définis : dérive statistique détectée, seuil de performance dégradé, ou fenêtre temporelle fixe. Les nouveaux modèles passent par une validation automatisée avant promotion en production.

Points clés

  • Le data drift (évolution de la distribution des entrées) et le concept drift (évolution des relations) nécessitent des stratégies différentes
  • Les systèmes de détection d'intrusions doivent être réentraînés face aux nouvelles techniques d'attaque émergentes
  • Le continuous training introduit des risques de data poisoning si les nouvelles données ne sont pas validées

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis