Continuous Training (ML)
iaDéfinition
Le Continuous Training, ou entraînement continu, désigne la pratique consistant à réentraîner régulièrement et automatiquement un modèle de machine learning en production à partir de nouvelles données, afin de compenser la dérive naturelle de performance survenant lorsque la distribution des données réelles évolue par rapport aux données d'entraînement initiales, phénomène connu sous le nom de dérive de données ou de concept. Cette pratique s'intègre dans des pipelines MLOps automatisés déclenchant un nouveau cycle d'entraînement selon un calendrier fixe ou en réponse à une dégradation mesurée de la performance du modèle en production, suivie d'une phase de validation avant promotion via le model registry. Cette automatisation introduit un risque spécifique : si les nouvelles données d'entraînement ne sont pas rigoureusement validées, un attaquant capable d'influencer le flux de données de production, par exemple via des retours utilisateurs manipulés, peut progressivement empoisonner le modèle sans compromission directe de l'infrastructure d'entraînement, technique documentée dans le référentiel MITRE ATLAS. En défense, la validation automatisée de la qualité et de la cohérence statistique des nouvelles données avant intégration au cycle d'entraînement, la conservation d'un jeu de test de référence indépendant pour détecter toute dégradation anormale, l'approbation humaine avant promotion en production de toute nouvelle version, et la traçabilité complète des données utilisées à chaque cycle constituent des garde-fous indispensables.
Description
Le Continuous Training est la pratique MLOps de réentraîner automatiquement et périodiquement un modèle ML sur de nouvelles données pour contrer le data drift et le concept drift. Sans réentraînement continu, les performances des modèles se dégradent progressivement à mesure que la distribution des données réelles évolue.
Fonctionnement
Des pipelines automatisés (Kubeflow, Vertex AI Pipelines, MLflow) déclenchent le réentraînement selon des triggers définis : dérive statistique détectée, seuil de performance dégradé, ou fenêtre temporelle fixe. Les nouveaux modèles passent par une validation automatisée avant promotion en production.
Points clés
- Le data drift (évolution de la distribution des entrées) et le concept drift (évolution des relations) nécessitent des stratégies différentes
- Les systèmes de détection d'intrusions doivent être réentraînés face aux nouvelles techniques d'attaque émergentes
- Le continuous training introduit des risques de data poisoning si les nouvelles données ne sont pas validées
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h