Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Data Curation

ia

Définition

La Data Curation (curation des donnees) est l'ensemble des processus de selection, nettoyage, filtrage et validation des donnees d'entrainement des LLMs. La qualite des donnees est reconnue comme le facteur le plus determinant dans la performance des modeles, souvent plus important que leur taille — principe resumi par la formule 'quality over quantity'. Les principales etapes de la curation de donnees pour les LLMs incluent : (1) Collection depuis des sources diverses (Common Crawl, GitHub, Wikipedia, ArXiv, Stack Overflow, livres), (2) Deduplication exacte (MinHash) et floue pour eliminer les contenus en double qui coutent du compute sans apporter de nouveauté, (3) Filtrage qualite via des classifieurs de qualite (ex: classifier entraine sur les perplexites d'un modele de qualite), (4) Filtrage de contenu (removal de contenus nocifs, NSFW, spam), (5) Decontamination des benchmarks d'evaluation pour eviter le data leakage. FineWeb (HuggingFace, 2024) est un exemple de dataset public issu d'une curation rigoureuse de Common Crawl. En appliquant des filtres de qualite de pointe (cc_net filters, deduplication MinHash, filtrage URL/langage), FineWeb a produit un dataset de 15T tokens avec des performances superieures a The Pile et Red Pajama sur les benchmarks standards. La decontamination des benchmarks est particulierement importante : si les donnees de test de MMLU, HumanEval ou GSM8K se retrouvent dans le corpus d'entrainement, les scores du modele sur ces benchmarks seront artificiellement gonfles (data contamination). Les labs IA sérieux appliquent un filtrage N-gram ou embedding-based pour detecter et retirer ces overlaps. Pour les modeles d'entreprise, la curation inclut une dimension supplementaire : confidentialite (retirer les donnees personnelles, secrets d'affaires), droit d'auteur (verifier les licences des sources), et biais (assurer la diversite demographique et geographique du corpus).

Pipeline de curation FineWeb-style

from datatrove.pipeline.filters import (
    GopherQualityFilter, C4QualityFilter,
    LanguageFilter, URLFilter
)
from datatrove.pipeline.dedup import MinhashDedupSignature

# Pipeline datatrove (HuggingFace)
pipeline = [
    LanguageFilter(languages=['fr', 'en']),
    URLFilter(exclusion_writer=blocked_urls_writer),
    GopherQualityFilter(
        min_stop_words=2,
        max_symbol_word_ratio=0.1,
        max_ellipsis_lines=0.3
    ),
    C4QualityFilter(filter_no_terminal_punct=True),
    MinhashDedupSignature(output_folder='./minhash-sigs/')
]

Metriques de qualite cles

  • Perplexite PPL : un modele de reference evalue la perplexite sur chaque document — les docs a haute perplexite (incoherents) sont filtres
  • Ratio mots/caracteres : detecte les contenus non-textuels (code binaire, spam)
  • Repetition N-gram : detecte le contenu repetitif (listes SEO, spam)
  • Fraction de stop-words : detecte le texte naturel vs artificiel

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis