Data Curation
iaDéfinition
La Data Curation (curation des donnees) est l'ensemble des processus de selection, nettoyage, filtrage et validation des donnees d'entrainement des LLMs. La qualite des donnees est reconnue comme le facteur le plus determinant dans la performance des modeles, souvent plus important que leur taille — principe resumi par la formule 'quality over quantity'. Les principales etapes de la curation de donnees pour les LLMs incluent : (1) Collection depuis des sources diverses (Common Crawl, GitHub, Wikipedia, ArXiv, Stack Overflow, livres), (2) Deduplication exacte (MinHash) et floue pour eliminer les contenus en double qui coutent du compute sans apporter de nouveauté, (3) Filtrage qualite via des classifieurs de qualite (ex: classifier entraine sur les perplexites d'un modele de qualite), (4) Filtrage de contenu (removal de contenus nocifs, NSFW, spam), (5) Decontamination des benchmarks d'evaluation pour eviter le data leakage. FineWeb (HuggingFace, 2024) est un exemple de dataset public issu d'une curation rigoureuse de Common Crawl. En appliquant des filtres de qualite de pointe (cc_net filters, deduplication MinHash, filtrage URL/langage), FineWeb a produit un dataset de 15T tokens avec des performances superieures a The Pile et Red Pajama sur les benchmarks standards. La decontamination des benchmarks est particulierement importante : si les donnees de test de MMLU, HumanEval ou GSM8K se retrouvent dans le corpus d'entrainement, les scores du modele sur ces benchmarks seront artificiellement gonfles (data contamination). Les labs IA sérieux appliquent un filtrage N-gram ou embedding-based pour detecter et retirer ces overlaps. Pour les modeles d'entreprise, la curation inclut une dimension supplementaire : confidentialite (retirer les donnees personnelles, secrets d'affaires), droit d'auteur (verifier les licences des sources), et biais (assurer la diversite demographique et geographique du corpus).
Pipeline de curation FineWeb-style
from datatrove.pipeline.filters import (
GopherQualityFilter, C4QualityFilter,
LanguageFilter, URLFilter
)
from datatrove.pipeline.dedup import MinhashDedupSignature
# Pipeline datatrove (HuggingFace)
pipeline = [
LanguageFilter(languages=['fr', 'en']),
URLFilter(exclusion_writer=blocked_urls_writer),
GopherQualityFilter(
min_stop_words=2,
max_symbol_word_ratio=0.1,
max_ellipsis_lines=0.3
),
C4QualityFilter(filter_no_terminal_punct=True),
MinhashDedupSignature(output_folder='./minhash-sigs/')
]Metriques de qualite cles
- Perplexite PPL : un modele de reference evalue la perplexite sur chaque document — les docs a haute perplexite (incoherents) sont filtres
- Ratio mots/caracteres : detecte les contenus non-textuels (code binaire, spam)
- Repetition N-gram : detecte le contenu repetitif (listes SEO, spam)
- Fraction de stop-words : detecte le texte naturel vs artificiel
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h