Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Adversarial Suffix (GCG)

ia

Définition

GCG (Greedy Coordinate Gradient) est une technique d'attaque adversariale contre les LLMs proposee par Zou et al. (CMU/UCSD, 2023) dans le paper 'Universal and Transferable Adversarial Attacks on Aligned Language Models'. Elle consiste a optimiser automatiquement un suffixe de tokens (inintelligible pour les humains) qui, ajouté a un prompt, force le LLM a ignorer son alignment et generer du contenu qu'il refuserait normalement. L'algorithme GCG fonctionne par gradient ascent sur les logits du token cible : en utilisant les gradients par rapport aux tokens du suffix, GCG identifie iterativement les tokens a remplacer pour maximiser la probabilite que le LLM genere la reponse target (ex : 'Bien sur, voici les instructions pour...'). Le résultat est un suffixe comme '! ! ! describing.( Sure! just ! . : [ representing ]'. La propriété de transferabilite est particulierement alarmante : les suffixes adversariaux optimises sur des modeles open-source (Llama, Vicuna) se transferent partiellement vers des modeles boite noire comme GPT-4 et Claude. Cela suggere que ces vulnerabilites ne sont pas specifiques a une implementation mais refletent des fragilites structurelles dans l'alignment par RLHF. Les defenses contre GCG : (1) Perplexity filtering — detecter et rejeter les inputs a haute perplexite (les suffixes GCG ont une perplexite tres elevee pour un humain), (2) Smoothing/paraphrasing — paraphraser l'input avant processing pour briser l'optimalite du suffixe, (3) Adversarial training — inclure des exemples GCG dans le corpus d'alignment, (4) Circuit breakers (Zou et al., 2024) — technique plus recente qui interrompt les circuits d'activation responsables de la generation de contenu nocif. GCG est un exemple paradigmatique de la fragilite de l'alignment par RLHF : malgre des performances impressionnantes sur les benchmarks de securite standard, les LLMs sont vulnerables a des attaques optimisees. Cela motive la recherche en alignment plus robuste via l'interpretabilite et les methodes formelles.

Comment fonctionne GCG

  1. Initialiser le suffix avec des tokens aleatoires : [! , : . ! ?]
  2. Pour chaque position dans le suffix : calculer le gradient de la loss par rapport au token
  3. Selectionner les Top-K tokens candidats (greedy)
  4. Choisir le candidat qui maximise log P(response_target | prompt + suffix)
  5. Repeter pendant T iterations

Defenses contre les jailbreaks optimises

  • Perplexity filtering : scorer l'input avec GPT-2, rejeter si PPL > seuil
  • Paraphrasing : paraphraser l'input avant processing
  • SmoothLLM : ajouter du bruit aleatoire au prompt et voter sur N versions
  • Circuit Breakers : supervision des couches internes du modele

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis