Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Attaque par epuisement de ressources d'inference

ia

Définition

L'attaque par epuisement de ressources d'inference est une forme de deni de service specifique aux systemes d'IA generative, qui vise a saturer les capacites de calcul allouees a l'etape d'inference, c'est-a-dire la generation de reponse par le modele deploye. L'attaquant construit des entrees deliberement couteuses : prompts tres longs proches de la limite de fenetre de contexte, requetes provoquant des chaines de raisonnement etendues dans un modele a raisonnement explicite, appels d'outils recursifs dans un agent, ou generation de sorties tres longues via des instructions de repetition. Ce type d'attaque differe du deni de service reseau classique car il exploite la nature meme du calcul du modele, notamment l'usage intensif de GPU ou de TPU et la memoire consommee par le cache d'attention. Les impacts touchent directement les couts d'infrastructure cloud, souvent factures a la seconde de calcul ou au token, et peuvent degrader la qualite de service pour l'ensemble des utilisateurs d'une plateforme partagee. Les organisations exposant des API d'inference publiques ou des agents autonomes sont les plus vulnerables. Les mesures de protection incluent le plafonnement du nombre de tokens en entree et en sortie, la limitation du nombre d'iterations d'un agent, le monitoring de la consommation par cle d'API et les mecanismes de coupure automatique en cas de derive.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis