Les attaques Denial-of-Wallet ciblent les pipelines IA et RAG pour générer des factures API astronomiques. L'outil CREEP automatise ces attaques, responsables de pertes atteignant 500 millions de dollars en un seul incident en 2026.
En bref
- Les attaques Denial-of-Wallet (DoW) ciblent les pipelines IA et RAG pour épuiser les crédits API et générer des factures astronomiques, sans nécessiter de compromission de compte.
- L'outil CREEP, développé par des chercheurs en sécurité, automatise ces attaques en générant des requêtes qui semblent légitimes mais forcent les LLM sur leurs chemins de traitement les plus coûteux.
- En 2026, plusieurs grandes entreprises ont subi des dépassements budgétaires massifs : un groupe non nommé a dépensé 500 millions de dollars en un seul incident impliquant Claude.
Ce qui s'est passé
Une nouvelle catégorie d'attaques a émergé comme l'une des menaces les plus préoccupantes pour les entreprises qui déploient des systèmes d'intelligence artificielle en production : le Denial-of-Wallet (DoW), ou déni de portefeuille. Contrairement aux attaques DDoS classiques qui visent à rendre un service indisponible par saturation de la bande passante ou des ressources serveur, les attaques DoW ne cherchent pas à provoquer une coupure de service. Leur objectif est plus insidieux : faire exploser les coûts d'utilisation de l'API au point de mettre en péril la santé financière de l'organisation cible, tout en maintenant le service apparent en état de fonctionnement.
Le mécanisme technique repose sur une caractéristique fondamentale de la tarification des grands modèles de langage. Les fournisseurs d'API comme OpenAI, Anthropic, Google ou Mistral facturent à l'usage, exprimé en tokens — les unités de base d'entrée et de sortie d'un LLM. Un token représente environ quatre caractères de texte en anglais. Une requête courte comme « Quelle est la capitale de la France ? » consomme une poignée de tokens ; une requête complexe qui force le modèle à effectuer plusieurs étapes de raisonnement, à récupérer de nombreux documents dans un système RAG, puis à synthétiser une réponse longue et structurée, peut consommer des centaines ou des milliers de tokens. Les attaquants DoW ont compris que la surface d'attaque n'est pas le débit réseau, mais le coût par requête.
Des chercheurs en sécurité ont développé et présenté un outil baptisé CREEP — acronyme de Computational Resource Exhaustion via External Poisoning — qui automatise et optimise ces attaques. CREEP utilise lui-même des agents LLM pour générer des textes sémantiquement très proches des requêtes légitimes d'un système RAG cible, mais conçus pour maximiser le nombre de documents récupérés à chaque requête, la profondeur du raisonnement requis du modèle, et la longueur des réponses générées. Le résultat est un flux de requêtes qui traverse sans difficulté les filtres de détection d'abus basés sur la fréquence ou la similarité, tout en consommant dix à cent fois plus de ressources de calcul qu'une requête normale.
Les exemples documentés en 2026 illustrent la gravité du phénomène. Uber a épuisé la totalité de son budget annuel alloué aux API d'IA dès le mois d'avril 2026, lors d'un incident qui a nécessité une intervention d'urgence pour limiter les appels. Plus spectaculaire encore, une entreprise non identifiée dont le nom a été volontairement omis dans les rapports publiés par Kaspersky et Haxoris a déboursé 500 millions de dollars en un seul incident impliquant l'API Claude d'Anthropic, faute d'avoir configuré des plafonds de dépenses (spending limits) sur son compte. Ces chiffres, qui semblaient impossibles il y a encore deux ans, reflètent la réalité d'architectures IA qui peuvent traiter des millions de requêtes par heure sans intervention humaine.
Le vecteur d'entrée privilégié des attaques DoW documentées passe principalement par deux chemins. Le premier est l'exposition publique d'endpoints RAG sans authentification suffisante ou sans limitation de débit adaptée : des pipelines de questions-réponses sur des bases documentaires internes, des chatbots de service client alimentés par des LLM, ou des API de génération de contenu accessibles via une simple clé API partagée. Le second chemin est l'injection de contenu dans les sources de données ingérées par un système RAG — une technique parfois appelée RAG poisoning — où l'attaquant insère dans des documents indexés des contenus spécialement formatés pour déclencher des récupérations massives ou des boucles de raisonnement lorsqu'un utilisateur pose une question innocente.
Au-delà du coût financier immédiat, les attaques DoW peuvent avoir des conséquences opérationnelles en cascade. Lorsque les plafonds budgétaires sont atteints, les fournisseurs d'API suspendent automatiquement l'accès, rendant inopérants tous les services qui en dépendent. Dans les organisations qui ont intégré des LLM dans des processus critiques — assistance au diagnostic médical, analyse de risques financiers, monitoring de sécurité — une coupure soudaine peut avoir des impacts qui vont bien au-delà de la ligne budgétaire IA. Ce couplage entre risque financier et risque opérationnel est caractéristique des menaces systémiques que l'architecture des services cloud modernes peut générer.
Les mesures de défense recommandées par les chercheurs de Kaspersky et les équipes de sécurité des principaux fournisseurs IA s'articulent autour de plusieurs niveaux. Au niveau du compte, la définition de spending limits stricts avec alertes en temps réel sur les écarts statistiques est la première ligne de défense ; Anthropic, OpenAI et Google Cloud proposent tous des mécanismes natifs à cet effet. Au niveau applicatif, la mise en place d'un rate limiting par utilisateur authentifié, d'une validation stricte des entrées, et d'un plafonnement du nombre de documents récupérés par requête RAG réduit significativement la surface exploitable. Au niveau de l'architecture, la séparation des pipelines publics et internes avec des quotas distincts limite la propagation d'un incident.
La recherche autour de CREEP s'inscrit dans un contexte plus large d'évolution des menaces DDoS. Le rapport annuel Cloudflare 2026 sur les menaces fait état de 47 millions d'attaques DDoS détectées sur la plateforme, avec une intensité maximale de 31,4 Tbps — un record absolu. Mais la tendance la plus significative est la bifurcation des stratégies d'attaque : d'un côté des attaques volumétriques de couche réseau qui continuent de battre des records en termes de débit ; de l'autre, des attaques de précision applicatives qui ciblent des endpoints spécifiques, des handlers de session ou désormais des pipelines IA pour maximiser le coût par paquet pour la victime.
Pourquoi c'est important
Les attaques Denial-of-Wallet représentent un changement de paradigme fondamental dans la menace cyber pour les entreprises qui adoptent l'IA générative. Le modèle économique du cloud à la consommation, qui a rendu l'IA accessible à presque toutes les organisations, crée simultanément un nouveau vecteur de risque financier qui n'existait pas dans les architectures on-premise. Contrairement à une attaque ransomware qui chiffre des données ou une attaque DDoS qui coupe un service, une attaque DoW peut passer complètement sous le radar des outils de sécurité traditionnels car elle ne génère ni comportement malveillant reconnaissable ni perte de données.
Pour les RSSI et les directeurs financiers, l'émergence de ce vecteur impose de repenser le modèle de risque lié à l'adoption de l'IA. Les analyses coût-bénéfice qui ont présidé aux décisions d'investissement IA en 2024-2025 n'intégraient généralement pas de scenarii de risque DoW. Or, un incident de l'ampleur de celui subi par l'entreprise anonyme citée — 500 millions de dollars en un seul incident — peut représenter plusieurs fois le budget annuel de cybersécurité d'une grande organisation, et transformer une initiative d'innovation en catastrophe financière.
La problématique est d'autant plus complexe à gérer que les systèmes IA les plus exposés sont souvent les plus récents, déployés par des équipes produit ou data qui n'ont pas nécessairement intégré les réflexes de sécurité des équipes infrastructure. Les plateformes de développement low-code et no-code d'agents IA permettent de créer en quelques heures des pipelines RAG exposés à Internet, avec des paramètres de sécurité par défaut rarement optimaux. Cette démocratisation de l'accès aux LLM multiplie mécaniquement le nombre de cibles potentielles pour les attaques DoW.
Du point de vue réglementaire, les incidents DoW soulèvent des questions inédites en matière de responsabilité. Lorsqu'une attaque exploite un pipeline RAG public pour générer des coûts, qui en est responsable : le fournisseur d'API pour ne pas avoir imposé des limites par défaut, l'opérateur du service pour ne pas avoir configuré ces limites, ou l'attaquant qui a certes agi malicieusement mais n'a fait qu'utiliser le service comme prévu ? Ces questions ne sont pas encore tranchées par la jurisprudence ou la réglementation, et il est probable que le développement de normes sectorielles — comme celles que la Frontier AI Standards Agency vise à établir — inclura à terme des exigences minimales de protection contre les abus de ressources.
Ce qu'il faut retenir
- Les attaques Denial-of-Wallet (DoW) visent à épuiser les crédits API IA via des requêtes coûteuses indétectables ; l'outil CREEP automatise ces attaques contre les systèmes RAG.
- Configurer impérativement des spending limits et des alertes de dépassement sur tous les comptes API IA, et limiter le rate des endpoints RAG exposés par authentification et quotas.
- Un incident DoW non contenu peut atteindre des centaines de millions de dollars en quelques heures, sans compromission de données ni interruption visible du service.
Comment protéger un système RAG public contre les attaques Denial-of-Wallet ?
Quatre mesures fondamentales : (1) Définir un spending limit sur le compte API avec alerte email ou webhook dès 50 % du budget mensuel atteint — tous les grands fournisseurs (Anthropic, OpenAI, Google Cloud) proposent cette fonctionnalité nativement. (2) Plafonner le nombre de chunks récupérés par requête RAG à un maximum raisonnable (typiquement 5 à 10 documents) et filtrer les requêtes dont la longueur dépasse un seuil défini. (3) Mettre en place un rate limiting par utilisateur authentifié ou par adresse IP avec backoff exponentiel. (4) Monitorer les métriques de coût par requête en temps réel via des outils d'observabilité LLM pour détecter les anomalies statistiques avant qu'elles ne se traduisent en dépassements budgétaires.
Besoin d'un accompagnement expert ?
Ayi NEDJIMI vous accompagne sur vos projets cybersécurité et IA.
Prendre contactÀ propos de l'auteur
Ayi NEDJIMI
Auditeur Senior Cybersécurité & Consultant IA
Expert Judiciaire — Cour d'Appel de Paris
Habilitation Confidentiel Défense
ayi@ayinedjimi-consultants.fr
Ayi NEDJIMI est un vétéran de la cybersécurité avec plus de 25 ans d'expérience sur des missions critiques. Ancien développeur Microsoft à Redmond sur le module GINA (Windows NT4) et co-auteur de la version française du guide de sécurité Windows NT4 pour la NSA.
À la tête d'Ayi NEDJIMI Consultants, il réalise des audits Lead Auditor ISO 42001 et ISO 27001, des pentests d'infrastructures critiques, du forensics et des missions de conformité NIS2 / AI Act.
Conférencier international (Europe & US), il a formé plus de 10 000 professionnels.
Domaines d'expertise
Ressources & Outils de l'auteur
Articles connexes
Check Point Security Gateway : RCE CVSS 9.8 en exploitation
CVE-2026-85102, une RCE pré-authentification CVSS 9.8 dans Check Point Security Gateway, est activement exploitée depuis le 12 septembre 2026. La CISA impose un correctif d'urgence avant le 25 septembre.
OpenAI, Google et Anthropic lancent une agence de normes IA
Google, OpenAI et Anthropic négocient la création de la Frontier AI Standards Agency, un organisme indépendant chargé d'auditer les modèles IA frontier, avec Sriram Krishnan comme directeur pressenti.
ShinyHunters pirate Cl0p et exige une rançon à 8 chiffres
Le 18 septembre 2026, ShinyHunters a défacé le site dark web de Cl0p via une faille Grav CMS, volé ses données internes et exigé un paiement à 8 chiffres, ouvrant un conflit inédit entre deux groupes cybercriminels majeurs.
Un projet cybersécurité ? Parlons-en.
Pentest, conformité NIS 2, ISO 27001, audit IA, RSSI externalisé… nos experts répondent sous 24h pour évaluer votre besoin et vous proposer un accompagnement sur mesure.
Commentaires
Aucun commentaire pour le moment. Soyez le premier à commenter !
Laisser un commentaire