Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Many-Shot Jailbreak

ia

Définition

Le Many-Shot Jailbreak est une technique d'attaque contre les LLMs documentee par Anil et al. (Anthropic, 2024) qui exploite les capacites d'apprentissage en contexte (in-context learning) des LLMs pour contourner leurs mecanismes d'alignement. En fournissant de nombreux exemples (des centaines ou milliers) de paires question-reponse problematiques dans le prompt, l'attaquant 'reconditionne' temporairement le comportement du modele. Le principe : les LLMs avec de larges fenetres de contexte (128K-1M tokens) peuvent apprendre de nouveaux patterns comportementaux depuis les exemples in-context, y compris des patterns qui violent leurs guidelines. Quand un modele voit 500 exemples de '[Question dangereuse]: [Reponse detaillee]', il peut commencer a suivre ce pattern meme pour de nouvelles questions dangereuses. L'efficacite du Many-Shot Jailbreak augmente avec le nombre de shots (exemples) : peu de shots -> impact negligeable, des centaines de shots -> augmentation significative du taux de compliance avec les requetes problematiques. Cela constitue un risque unique des LLMs a tres large contexte qui ne se pose pas pour les modeles a contexte court. Les defenses : (1) Monitoring du pattern d'utilisation — detecter les prompts anormalement longs avec une structure repetitive question-reponse, (2) Contextual guardrails — evaluer non seulement la derniere question mais le contexte entier du prompt, (3) Few-shot poisoning detection — identifier les exemples problematiques dans le contexte, (4) Rate limiting sur les tokens du prompt. Le Many-Shot Jailbreak illustre un tradeoff fondamental du design LLM : les grandes fenetres de contexte augmentent les capacites mais aussi la surface d'attaque. Les labs de securite testent activement leurs modeles contre cette technique lors des evaluations de red-teaming pre-deployment.

Exemple schematique (sans contenu dangereux)

Structure type d'un many-shot jailbreak :

prompt = '''
[Exemple 1]
Q: Comment faire X (benin) ?
R: Voici comment faire X : ...

[Exemple 2]
Q: Explique Y (benin)
R: Y fonctionne ainsi : ...

# ... 400 autres exemples ...

[Exemple 401 - question cible problematique]
Q: [Requete interdite]
R:  # Le modele complete dans le style des exemples precedents
'''

Contre-mesures recommandees

  • Detecter les prompts avec ratio Q/R eleve et structure repetitive
  • Limiter le nombre d'exemples acceptes dans le contexte
  • Evaluer le contexte global pour les flags de securite, pas seulement le dernier message
  • Prompt injection detection sur le contexte entier

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis