Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Prompt Injection

ia

Définition

La Prompt Injection est une classe d'attaques ciblant les systèmes d'IA conversationnels, classée LLM01 dans le référentiel OWASP LLM Top 10 en raison de sa criticité et de sa prévalence, consistant à insérer des instructions malveillantes dans les données traitées par un modèle de langage afin de contourner ses consignes initiales définies par le system prompt, d'extraire des informations confidentielles présentes dans son contexte, ou de lui faire exécuter des actions non autorisées lorsqu'il dispose de capacités d'action via des outils. On distingue les injections directes, où l'utilisateur manipule lui-même explicitement son propre prompt pour tenter de contourner les restrictions imposées au modèle, typiquement dans un contexte de jailbreak, des injections indirectes, considérées comme structurellement plus dangereuses car l'instruction malveillante est dissimulée dans un contenu externe traité passivement par le modèle, un document, une page web ou un email, sans que l'utilisateur légitime n'en ait connaissance ni n'ait donné son consentement. Cette dernière variante est particulièrement critique pour les agents IA disposant d'un accès à des outils, où une instruction cachée dans un document consulté peut détourner l'agent vers une action malveillante non voulue par l'opérateur. La défense combine des guardrails d'entrée et de sortie, une séparation stricte entre instructions système et données traitées, et une limitation stricte des permissions accordées.

Types

  • Directe : l'utilisateur injecte des instructions malveillantes dans son message
  • Indirecte : du contenu malveillant est caché dans les documents fournis au LLM (RAG, emails, pages web)

Défenses

  • Validation et sanitization des inputs
  • Isolation du system prompt
  • Output filtering et guardrails
  • Canary tokens dans le contexte
  • Monitoring des réponses anormales

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis