Adversarial Suffix (GCG)
iaDéfinition
GCG (Greedy Coordinate Gradient) est une technique d'attaque adversariale contre les LLMs proposee par Zou et al. (CMU/UCSD, 2023) dans le paper 'Universal and Transferable Adversarial Attacks on Aligned Language Models'. Elle consiste a optimiser automatiquement un suffixe de tokens (inintelligible pour les humains) qui, ajouté a un prompt, force le LLM a ignorer son alignment et generer du contenu qu'il refuserait normalement. L'algorithme GCG fonctionne par gradient ascent sur les logits du token cible : en utilisant les gradients par rapport aux tokens du suffix, GCG identifie iterativement les tokens a remplacer pour maximiser la probabilite que le LLM genere la reponse target (ex : 'Bien sur, voici les instructions pour...'). Le résultat est un suffixe comme '! ! ! describing.( Sure! just ! . : [ representing ]'. La propriété de transferabilite est particulierement alarmante : les suffixes adversariaux optimises sur des modeles open-source (Llama, Vicuna) se transferent partiellement vers des modeles boite noire comme GPT-4 et Claude. Cela suggere que ces vulnerabilites ne sont pas specifiques a une implementation mais refletent des fragilites structurelles dans l'alignment par RLHF. Les defenses contre GCG : (1) Perplexity filtering — detecter et rejeter les inputs a haute perplexite (les suffixes GCG ont une perplexite tres elevee pour un humain), (2) Smoothing/paraphrasing — paraphraser l'input avant processing pour briser l'optimalite du suffixe, (3) Adversarial training — inclure des exemples GCG dans le corpus d'alignment, (4) Circuit breakers (Zou et al., 2024) — technique plus recente qui interrompt les circuits d'activation responsables de la generation de contenu nocif. GCG est un exemple paradigmatique de la fragilite de l'alignment par RLHF : malgre des performances impressionnantes sur les benchmarks de securite standard, les LLMs sont vulnerables a des attaques optimisees. Cela motive la recherche en alignment plus robuste via l'interpretabilite et les methodes formelles.
Comment fonctionne GCG
- Initialiser le suffix avec des tokens aleatoires : [! , : . ! ?]
- Pour chaque position dans le suffix : calculer le gradient de la loss par rapport au token
- Selectionner les Top-K tokens candidats (greedy)
- Choisir le candidat qui maximise log P(response_target | prompt + suffix)
- Repeter pendant T iterations
Defenses contre les jailbreaks optimises
- Perplexity filtering : scorer l'input avec GPT-2, rejeter si PPL > seuil
- Paraphrasing : paraphraser l'input avant processing
- SmoothLLM : ajouter du bruit aleatoire au prompt et voter sur N versions
- Circuit Breakers : supervision des couches internes du modele
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h