En bref

  • Les attaques Denial-of-Wallet (DoW) ciblent les pipelines IA et RAG pour épuiser les crédits API et générer des factures astronomiques, sans nécessiter de compromission de compte.
  • L'outil CREEP, développé par des chercheurs en sécurité, automatise ces attaques en générant des requêtes qui semblent légitimes mais forcent les LLM sur leurs chemins de traitement les plus coûteux.
  • En 2026, plusieurs grandes entreprises ont subi des dépassements budgétaires massifs : un groupe non nommé a dépensé 500 millions de dollars en un seul incident impliquant Claude.

Ce qui s'est passé

Une nouvelle catégorie d'attaques a émergé comme l'une des menaces les plus préoccupantes pour les entreprises qui déploient des systèmes d'intelligence artificielle en production : le Denial-of-Wallet (DoW), ou déni de portefeuille. Contrairement aux attaques DDoS classiques qui visent à rendre un service indisponible par saturation de la bande passante ou des ressources serveur, les attaques DoW ne cherchent pas à provoquer une coupure de service. Leur objectif est plus insidieux : faire exploser les coûts d'utilisation de l'API au point de mettre en péril la santé financière de l'organisation cible, tout en maintenant le service apparent en état de fonctionnement.

Le mécanisme technique repose sur une caractéristique fondamentale de la tarification des grands modèles de langage. Les fournisseurs d'API comme OpenAI, Anthropic, Google ou Mistral facturent à l'usage, exprimé en tokens — les unités de base d'entrée et de sortie d'un LLM. Un token représente environ quatre caractères de texte en anglais. Une requête courte comme « Quelle est la capitale de la France ? » consomme une poignée de tokens ; une requête complexe qui force le modèle à effectuer plusieurs étapes de raisonnement, à récupérer de nombreux documents dans un système RAG, puis à synthétiser une réponse longue et structurée, peut consommer des centaines ou des milliers de tokens. Les attaquants DoW ont compris que la surface d'attaque n'est pas le débit réseau, mais le coût par requête.

Des chercheurs en sécurité ont développé et présenté un outil baptisé CREEP — acronyme de Computational Resource Exhaustion via External Poisoning — qui automatise et optimise ces attaques. CREEP utilise lui-même des agents LLM pour générer des textes sémantiquement très proches des requêtes légitimes d'un système RAG cible, mais conçus pour maximiser le nombre de documents récupérés à chaque requête, la profondeur du raisonnement requis du modèle, et la longueur des réponses générées. Le résultat est un flux de requêtes qui traverse sans difficulté les filtres de détection d'abus basés sur la fréquence ou la similarité, tout en consommant dix à cent fois plus de ressources de calcul qu'une requête normale.

Les exemples documentés en 2026 illustrent la gravité du phénomène. Uber a épuisé la totalité de son budget annuel alloué aux API d'IA dès le mois d'avril 2026, lors d'un incident qui a nécessité une intervention d'urgence pour limiter les appels. Plus spectaculaire encore, une entreprise non identifiée dont le nom a été volontairement omis dans les rapports publiés par Kaspersky et Haxoris a déboursé 500 millions de dollars en un seul incident impliquant l'API Claude d'Anthropic, faute d'avoir configuré des plafonds de dépenses (spending limits) sur son compte. Ces chiffres, qui semblaient impossibles il y a encore deux ans, reflètent la réalité d'architectures IA qui peuvent traiter des millions de requêtes par heure sans intervention humaine.

Le vecteur d'entrée privilégié des attaques DoW documentées passe principalement par deux chemins. Le premier est l'exposition publique d'endpoints RAG sans authentification suffisante ou sans limitation de débit adaptée : des pipelines de questions-réponses sur des bases documentaires internes, des chatbots de service client alimentés par des LLM, ou des API de génération de contenu accessibles via une simple clé API partagée. Le second chemin est l'injection de contenu dans les sources de données ingérées par un système RAG — une technique parfois appelée RAG poisoning — où l'attaquant insère dans des documents indexés des contenus spécialement formatés pour déclencher des récupérations massives ou des boucles de raisonnement lorsqu'un utilisateur pose une question innocente.

Au-delà du coût financier immédiat, les attaques DoW peuvent avoir des conséquences opérationnelles en cascade. Lorsque les plafonds budgétaires sont atteints, les fournisseurs d'API suspendent automatiquement l'accès, rendant inopérants tous les services qui en dépendent. Dans les organisations qui ont intégré des LLM dans des processus critiques — assistance au diagnostic médical, analyse de risques financiers, monitoring de sécurité — une coupure soudaine peut avoir des impacts qui vont bien au-delà de la ligne budgétaire IA. Ce couplage entre risque financier et risque opérationnel est caractéristique des menaces systémiques que l'architecture des services cloud modernes peut générer.

Les mesures de défense recommandées par les chercheurs de Kaspersky et les équipes de sécurité des principaux fournisseurs IA s'articulent autour de plusieurs niveaux. Au niveau du compte, la définition de spending limits stricts avec alertes en temps réel sur les écarts statistiques est la première ligne de défense ; Anthropic, OpenAI et Google Cloud proposent tous des mécanismes natifs à cet effet. Au niveau applicatif, la mise en place d'un rate limiting par utilisateur authentifié, d'une validation stricte des entrées, et d'un plafonnement du nombre de documents récupérés par requête RAG réduit significativement la surface exploitable. Au niveau de l'architecture, la séparation des pipelines publics et internes avec des quotas distincts limite la propagation d'un incident.

La recherche autour de CREEP s'inscrit dans un contexte plus large d'évolution des menaces DDoS. Le rapport annuel Cloudflare 2026 sur les menaces fait état de 47 millions d'attaques DDoS détectées sur la plateforme, avec une intensité maximale de 31,4 Tbps — un record absolu. Mais la tendance la plus significative est la bifurcation des stratégies d'attaque : d'un côté des attaques volumétriques de couche réseau qui continuent de battre des records en termes de débit ; de l'autre, des attaques de précision applicatives qui ciblent des endpoints spécifiques, des handlers de session ou désormais des pipelines IA pour maximiser le coût par paquet pour la victime.

Pourquoi c'est important

Les attaques Denial-of-Wallet représentent un changement de paradigme fondamental dans la menace cyber pour les entreprises qui adoptent l'IA générative. Le modèle économique du cloud à la consommation, qui a rendu l'IA accessible à presque toutes les organisations, crée simultanément un nouveau vecteur de risque financier qui n'existait pas dans les architectures on-premise. Contrairement à une attaque ransomware qui chiffre des données ou une attaque DDoS qui coupe un service, une attaque DoW peut passer complètement sous le radar des outils de sécurité traditionnels car elle ne génère ni comportement malveillant reconnaissable ni perte de données.

Pour les RSSI et les directeurs financiers, l'émergence de ce vecteur impose de repenser le modèle de risque lié à l'adoption de l'IA. Les analyses coût-bénéfice qui ont présidé aux décisions d'investissement IA en 2024-2025 n'intégraient généralement pas de scenarii de risque DoW. Or, un incident de l'ampleur de celui subi par l'entreprise anonyme citée — 500 millions de dollars en un seul incident — peut représenter plusieurs fois le budget annuel de cybersécurité d'une grande organisation, et transformer une initiative d'innovation en catastrophe financière.

La problématique est d'autant plus complexe à gérer que les systèmes IA les plus exposés sont souvent les plus récents, déployés par des équipes produit ou data qui n'ont pas nécessairement intégré les réflexes de sécurité des équipes infrastructure. Les plateformes de développement low-code et no-code d'agents IA permettent de créer en quelques heures des pipelines RAG exposés à Internet, avec des paramètres de sécurité par défaut rarement optimaux. Cette démocratisation de l'accès aux LLM multiplie mécaniquement le nombre de cibles potentielles pour les attaques DoW.

Du point de vue réglementaire, les incidents DoW soulèvent des questions inédites en matière de responsabilité. Lorsqu'une attaque exploite un pipeline RAG public pour générer des coûts, qui en est responsable : le fournisseur d'API pour ne pas avoir imposé des limites par défaut, l'opérateur du service pour ne pas avoir configuré ces limites, ou l'attaquant qui a certes agi malicieusement mais n'a fait qu'utiliser le service comme prévu ? Ces questions ne sont pas encore tranchées par la jurisprudence ou la réglementation, et il est probable que le développement de normes sectorielles — comme celles que la Frontier AI Standards Agency vise à établir — inclura à terme des exigences minimales de protection contre les abus de ressources.

Ce qu'il faut retenir

  • Les attaques Denial-of-Wallet (DoW) visent à épuiser les crédits API IA via des requêtes coûteuses indétectables ; l'outil CREEP automatise ces attaques contre les systèmes RAG.
  • Configurer impérativement des spending limits et des alertes de dépassement sur tous les comptes API IA, et limiter le rate des endpoints RAG exposés par authentification et quotas.
  • Un incident DoW non contenu peut atteindre des centaines de millions de dollars en quelques heures, sans compromission de données ni interruption visible du service.

Comment protéger un système RAG public contre les attaques Denial-of-Wallet ?

Quatre mesures fondamentales : (1) Définir un spending limit sur le compte API avec alerte email ou webhook dès 50 % du budget mensuel atteint — tous les grands fournisseurs (Anthropic, OpenAI, Google Cloud) proposent cette fonctionnalité nativement. (2) Plafonner le nombre de chunks récupérés par requête RAG à un maximum raisonnable (typiquement 5 à 10 documents) et filtrer les requêtes dont la longueur dépasse un seuil défini. (3) Mettre en place un rate limiting par utilisateur authentifié ou par adresse IP avec backoff exponentiel. (4) Monitorer les métriques de coût par requête en temps réel via des outils d'observabilité LLM pour détecter les anomalies statistiques avant qu'elles ne se traduisent en dépassements budgétaires.

Besoin d'un accompagnement expert ?

Ayi NEDJIMI vous accompagne sur vos projets cybersécurité et IA.

Prendre contact