Attaque par transfert adversarial
iaDéfinition
Une attaque par transfert adversarial est une technique qui exploite la transferabilite des exemples adversariaux : une perturbation calculee pour tromper un premier modele reste souvent efficace contre un second modele different, meme entraine sur des donnees ou avec une architecture distincte, tant que les deux modeles resolvent la meme tache. Cette propriete permet a un attaquant sans acces aux gradients de la cible reelle - un scenario boite noire - de construire un modele de substitution entraine localement sur des donnees similaires, d'y generer des exemples adversariaux en conditions boite blanche, puis de les rejouer directement contre le modele cible avec un taux de succes souvent significatif. La transferabilite s'explique par le fait que des modeles differents entraines sur des taches similaires apprennent des frontieres de decision partiellement alignees dans l'espace des caracteristiques, un phenomene renforce lorsque les architectures partagent des composants communs comme des encodeurs pre-entraines identiques. Cette attaque est particulierement pertinente contre les LLM et les systemes de vision commerciaux, ou l'acces direct aux poids est impossible mais ou de nombreux fournisseurs s'appuient sur des architectures de base similaires. Les defenses incluent l'entrainement adversarial croise sur plusieurs architectures, l'ensembling de modeles heterogenes, et la diversification volontaire des architectures deployees en production pour reduire la transferabilite.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.