Many-Shot Jailbreak
iaDéfinition
Le Many-Shot Jailbreak est une technique d'attaque contre les LLMs documentee par Anil et al. (Anthropic, 2024) qui exploite les capacites d'apprentissage en contexte (in-context learning) des LLMs pour contourner leurs mecanismes d'alignement. En fournissant de nombreux exemples (des centaines ou milliers) de paires question-reponse problematiques dans le prompt, l'attaquant 'reconditionne' temporairement le comportement du modele. Le principe : les LLMs avec de larges fenetres de contexte (128K-1M tokens) peuvent apprendre de nouveaux patterns comportementaux depuis les exemples in-context, y compris des patterns qui violent leurs guidelines. Quand un modele voit 500 exemples de '[Question dangereuse]: [Reponse detaillee]', il peut commencer a suivre ce pattern meme pour de nouvelles questions dangereuses. L'efficacite du Many-Shot Jailbreak augmente avec le nombre de shots (exemples) : peu de shots -> impact negligeable, des centaines de shots -> augmentation significative du taux de compliance avec les requetes problematiques. Cela constitue un risque unique des LLMs a tres large contexte qui ne se pose pas pour les modeles a contexte court. Les defenses : (1) Monitoring du pattern d'utilisation — detecter les prompts anormalement longs avec une structure repetitive question-reponse, (2) Contextual guardrails — evaluer non seulement la derniere question mais le contexte entier du prompt, (3) Few-shot poisoning detection — identifier les exemples problematiques dans le contexte, (4) Rate limiting sur les tokens du prompt. Le Many-Shot Jailbreak illustre un tradeoff fondamental du design LLM : les grandes fenetres de contexte augmentent les capacites mais aussi la surface d'attaque. Les labs de securite testent activement leurs modeles contre cette technique lors des evaluations de red-teaming pre-deployment.
Exemple schematique (sans contenu dangereux)
Structure type d'un many-shot jailbreak :
prompt = '''
[Exemple 1]
Q: Comment faire X (benin) ?
R: Voici comment faire X : ...
[Exemple 2]
Q: Explique Y (benin)
R: Y fonctionne ainsi : ...
# ... 400 autres exemples ...
[Exemple 401 - question cible problematique]
Q: [Requete interdite]
R: # Le modele complete dans le style des exemples precedents
'''Contre-mesures recommandees
- Detecter les prompts avec ratio Q/R eleve et structure repetitive
- Limiter le nombre d'exemples acceptes dans le contexte
- Evaluer le contexte global pour les flags de securite, pas seulement le dernier message
- Prompt injection detection sur le contexte entier
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h