Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Continual Pre-training

ia

Définition

Le Continual Pre-training (aussi appele Domain-Adaptive Pre-training ou DAPT) est la technique consistant a reprendre le pre-entrainement d'un LLM de base sur un corpus de donnees domaine-specifiques (textes medicaux, juridiques, cybersecurite, code specifique), avant tout SFT ou alignment. L'objectif est d'injecter des connaissances specialisees dans les poids du modele sans partir de zero. Contrairement au fine-tuning qui enseigne au modele 'comment se comporter' (format, style, instructions), le continual pre-training lui enseigne 'quoi savoir' : les concepts, terminologies, regulations et patterns specifiques a un domaine. Un LLM de cybersecurite necessite par exemple d'etre expose a des millions de rapports de vulnerabilites, analyses de malwares, logs de securite et publications de threat intelligence. La technique est utilisee par les modeles domaine-specialises les plus performants : MedPaLM (Google) sur des donnees medicales, CodeLLaMA (Meta) sur du code supplementaire, BioMedLM sur des textes biomedicaux, et SecLLaMA sur des corpus de securite. Ces modeles demarrent depuis Llama ou Mistral et continuent le pre-entrainement sur des corpus specifiques. Un risque majeur est le catastrophic forgetting : en apprenant de nouvelles informations, le modele peut 'oublier' ses capacites generales. Des strategies comme le data mixing (melanger les nouvelles donnees avec une fraction de donnees generales) et des learning rates tres bas (1e-5 a 5e-6) permettent d'attenuer ce phenomene. Pour les entreprises, le continual pre-training est justifie quand le SFT seul ne suffit pas a injecter suffisamment de connaissances domaine (ex: domaine tres technique avec nomenclature specifique, corpus volumineux de documents internes). Il necessite typiquement plusieurs GPU-jours a GPU-semaines selon la taille du modele et du corpus.

Configuration recommandee

from transformers import Trainer, TrainingArguments, DataCollatorForLanguageModeling

training_args = TrainingArguments(
    output_dir='./continual-pretrain-output',
    num_train_epochs=1,
    per_device_train_batch_size=2,
    gradient_accumulation_steps=16,
    learning_rate=2e-5,       # Bas pour eviter catastrophic forgetting
    lr_scheduler_type='cosine',
    warmup_ratio=0.03,
    fp16=True,
    # Data collator CLM : next-token prediction
)

collator = DataCollatorForLanguageModeling(tokenizer=tokenizer, mlm=False)
# mlm=False : Causal LM (CLM) = next-token prediction = standard pre-training

Data mixing anti-catastrophic-forgetting

  • Ratio recommande : 80-90% donnees domaine + 10-20% donnees generales
  • Sources generales : The Pile, C4, RedPajama (subset)
  • Deduplication obligatoire pour eviter l'over-fitting

Modeles domaine-specifiques notables

  • CodeLLaMA 7B/13B/34B (Meta) : Llama 2 + 500B tokens code supplementaires
  • MedAlpaca (medecine) : LLaMA + corpus medical PubMed
  • SecLLaMA : cybersecurite (CVE, rapports DFIR, logs)
  • LegalBench-LLaMA : droit et jurisprudence

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis