Contournement de garde-fou par encodage
iaDéfinition
Le contournement de garde-fou par encodage est une technique de jailbreak qui consiste a transformer une requete malveillante destinee a un grand modele de langage - via base64, ROT13, langage leet, traduction dans une langue rare, ou insertion de caracteres unicode invisibles - afin de contourner les filtres de moderation qui analysent generalement le texte en clair et en langue courante. Le modele, capable de decoder ces representations grace a ses capacites multilingues et multimodales entrainees sur des corpus tres varies, execute la requete originale une fois decodee, alors que le systeme de garde-fou en amont n'a pas reconnu le contenu dangereux dans sa forme encodee. Cette technique exploite un decalage architectural frequent entre le filtre de moderation, souvent un modele plus leger et plus rigide, et le modele principal, plus flexible et capable d'interpretation contextuelle. L'OWASP LLM Top 10 classe cette technique parmi les vecteurs de prompt injection et de jailbreak les plus documentes en 2024-2025. Les contre-mesures efficaces incluent l'analyse de la sortie decodee plutot que de l'entree brute, la detection heuristique des formats d'encodage suspects, et surtout l'application de garde-fous a la fois en entree et en sortie du modele, une approche dite de defense en profondeur recommandee dans les architectures LLM securisees.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.