Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Pré-entraînement (Pretraining)

ia

Définition

Le pré-entraînement, ou pretraining, désigne la phase initiale et la plus coûteuse en ressources de l'entraînement d'un grand modèle de langage, réalisée sur des corpus textuels massifs et non annotés, mêlant contenu web crawlé, livres, code source et encyclopédies comme Wikipedia, dans le but d'apprendre des représentations linguistiques générales et une vaste base de connaissances encyclopédiques implicites, avant toute spécialisation ultérieure vers une tâche ou un usage précis. Pour la majorité des LLM actuels, l'objectif d'entraînement poursuivi durant cette phase est la modélisation causale du langage, popularisée notamment par la famille GPT, consistant à prédire le token suivant d'une séquence à partir uniquement des tokens qui le précèdent, une tâche d'apparence simple mais qui, appliquée à une échelle massive de données, force le modèle à développer implicitement une compréhension syntaxique, sémantique et factuelle profonde du langage. Une approche alternative, le masquage de tokens popularisée par BERT, consiste à masquer aléatoirement certains tokens d'une séquence et à entraîner le modèle à les reconstituer à partir du contexte environnant, une approche particulièrement adaptée aux tâches de compréhension plutôt que de génération pure. Le coût computationnel du pré-entraînement, mesuré en unités de calcul flottant, constitue aujourd'hui la barrière économique majeure à l'entrée pour développer un modèle de fondation compétitif.

Description

Le pré-entraînement est la phase initiale d'entraînement d'un LLM sur des corpus massifs non annotés (texte web, livres, code, Wikipedia) pour apprendre des représentations linguistiques générales. Cette phase établit les capacités de base du modèle avant l'instruction tuning et le RLHF.

Fonctionnement

L'objectif de pré-entraînement des LLM est la modélisation causale du langage (prédire le prochain token). Sur des milliards à trillions de tokens, le modèle développe des capacités émergentes : raisonnement, traduction, génération de code. Cette phase représente 90%+ du coût de développement d'un LLM.

Points clés

  • La mémorisation involontaire de données sensibles (PII, secrets) dans le corpus est extractible par membership inference attacks
  • La qualité et la diversité du corpus déterminent plus les capacités du modèle que la seule taille en paramètres
  • La loi de Chinchilla établit le ratio optimal tokens/paramètres pour un budget de calcul donné

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis