Continual Pre-training
iaDéfinition
Le Continual Pre-training (aussi appele Domain-Adaptive Pre-training ou DAPT) est la technique consistant a reprendre le pre-entrainement d'un LLM de base sur un corpus de donnees domaine-specifiques (textes medicaux, juridiques, cybersecurite, code specifique), avant tout SFT ou alignment. L'objectif est d'injecter des connaissances specialisees dans les poids du modele sans partir de zero. Contrairement au fine-tuning qui enseigne au modele 'comment se comporter' (format, style, instructions), le continual pre-training lui enseigne 'quoi savoir' : les concepts, terminologies, regulations et patterns specifiques a un domaine. Un LLM de cybersecurite necessite par exemple d'etre expose a des millions de rapports de vulnerabilites, analyses de malwares, logs de securite et publications de threat intelligence. La technique est utilisee par les modeles domaine-specialises les plus performants : MedPaLM (Google) sur des donnees medicales, CodeLLaMA (Meta) sur du code supplementaire, BioMedLM sur des textes biomedicaux, et SecLLaMA sur des corpus de securite. Ces modeles demarrent depuis Llama ou Mistral et continuent le pre-entrainement sur des corpus specifiques. Un risque majeur est le catastrophic forgetting : en apprenant de nouvelles informations, le modele peut 'oublier' ses capacites generales. Des strategies comme le data mixing (melanger les nouvelles donnees avec une fraction de donnees generales) et des learning rates tres bas (1e-5 a 5e-6) permettent d'attenuer ce phenomene. Pour les entreprises, le continual pre-training est justifie quand le SFT seul ne suffit pas a injecter suffisamment de connaissances domaine (ex: domaine tres technique avec nomenclature specifique, corpus volumineux de documents internes). Il necessite typiquement plusieurs GPU-jours a GPU-semaines selon la taille du modele et du corpus.
Configuration recommandee
from transformers import Trainer, TrainingArguments, DataCollatorForLanguageModeling
training_args = TrainingArguments(
output_dir='./continual-pretrain-output',
num_train_epochs=1,
per_device_train_batch_size=2,
gradient_accumulation_steps=16,
learning_rate=2e-5, # Bas pour eviter catastrophic forgetting
lr_scheduler_type='cosine',
warmup_ratio=0.03,
fp16=True,
# Data collator CLM : next-token prediction
)
collator = DataCollatorForLanguageModeling(tokenizer=tokenizer, mlm=False)
# mlm=False : Causal LM (CLM) = next-token prediction = standard pre-trainingData mixing anti-catastrophic-forgetting
- Ratio recommande : 80-90% donnees domaine + 10-20% donnees generales
- Sources generales : The Pile, C4, RedPajama (subset)
- Deduplication obligatoire pour eviter l'over-fitting
Modeles domaine-specifiques notables
- CodeLLaMA 7B/13B/34B (Meta) : Llama 2 + 500B tokens code supplementaires
- MedAlpaca (medecine) : LLaMA + corpus medical PubMed
- SecLLaMA : cybersecurite (CVE, rapports DFIR, logs)
- LegalBench-LLaMA : droit et jurisprudence
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h