Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Déduplication sémantique de corpus (Semantic Deduplication)

ia

Définition

La déduplication sémantique de corpus est une technique de nettoyage des données d'entraînement qui identifie et retire les documents proches en sens, même lorsqu'ils ne sont pas identiques au niveau du texte brut. Contrairement à la déduplication exacte, basée sur des empreintes de hachage, ou à la déduplication approximative par MinHash et LSH sur des n-grammes, la déduplication sémantique s'appuie sur des embeddings vectoriels : chaque document est projeté dans un espace vectoriel dense, puis les paires dont la similarité cosinus dépasse un seuil sont considérées comme quasi-doublons et l'une d'elles est écartée. Cette méthode capture les reformulations, les traductions automatiques d'un même contenu ou les versions légèrement modifiées d'une page web, que les approches lexicales manquent. Des travaux comme SemDeDup, appliqués à des corpus massifs tels que C4 ou LAION, montrent qu'un retrait de 20 à 50 pour cent des données quasi-redondantes peut maintenir, voire améliorer, les performances du modèle tout en réduisant le coût de calcul. La déduplication sémantique limite aussi la mémorisation involontaire de contenus par le modèle, un enjeu de confidentialité et de propriété intellectuelle, en réduisant la sur-représentation de certains passages dans le corpus d'entraînement final utilisé.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis