Attaque par porte dérobée sur réseau de neurones
iaDéfinition
Une attaque par porte derobee sur reseau de neurones, ou backdoor attack, consiste a entrainer ou modifier un modele pour qu'il se comporte normalement sur la grande majorite des entrees, tout en produisant une sortie choisie par l'attaquant lorsqu'un declencheur specifique est present. Ce declencheur, appele trigger, peut etre un motif visuel discret dans une image, une phrase precise dans un texte, ou un pattern de bruit dans un signal audio. Le modele reussit tous les tests de validation classiques car sa performance globale reste inchangee, ce qui rend la porte derobee particulierement difficile a detecter sans tests cibles. L'attaque s'installe generalement via l'empoisonnement du jeu d'entrainement, la compromission d'un modele pre-entraine partage publiquement, ou la manipulation du processus de fine-tuning chez un fournisseur tiers. Des methodes de detection existent, comme Neural Cleanse, STRIP ou l'analyse d'activations neuronales anormales, mais elles restent couteuses en calcul et imparfaites face a des triggers sophistiques. Cette menace figure parmi les risques prioritaires identifies par le NIST AI RMF et l'OWASP LLM Top 10 pour les modeles issus de chaines d'approvisionnement non maitrisees. En audit de securite IA, la recherche de portes derobees fait partie des tests obligatoires avant le deploiement de modeles pre-entraines externes dans un contexte sensible.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.