Augmentation de données textuelles (Text Data Augmentation)
iaDéfinition
L'augmentation de données textuelles désigne l'ensemble des techniques qui génèrent des variantes artificielles d'exemples existants afin d'accroître la taille et la diversité d'un jeu d'entraînement sans collecter de nouvelles données réelles. Les méthodes classiques incluent la substitution de synonymes, la rétro-traduction, qui traduit un texte vers une langue pivot puis le retraduit, le mélange de phrases ou l'insertion et la suppression aléatoire de mots. Avec les grands modèles de langage, l'augmentation s'appuie de plus en plus sur la génération synthétique : un LLM produit des paraphrases, des exemples de raisonnement ou des données d'instruction supplémentaires, une approche popularisée par des méthodes comme Self-Instruct ou Evol-Instruct. L'augmentation de données est particulièrement utile pour les tâches où les données annotées sont rares ou coûteuses, comme la détection d'incidents de cybersécurité peu fréquents, ou pour équilibrer des classes sous-représentées dans un jeu de classification. Elle comporte un risque de dérive : un usage excessif de données synthétiques générées par un modèle peut introduire des biais répétitifs ou dégrader la diversité stylistique, un phénomène parfois appelé effondrement de modèle lorsque plusieurs générations successives s'entraînent sur leurs propres sorties sans contrôle qualité.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.