Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Distillation de modèle

ia

Définition

La distillation de modèle, ou knowledge distillation, est une technique de compression dans laquelle un petit modèle, dit élève, apprend à reproduire le comportement d'un grand modèle pré-entraîné, dit enseignant, afin de conserver l'essentiel de ses performances à un coût de calcul et de mémoire nettement réduit. Introduite par Geoffrey Hinton en 2015, la méthode entraîne le modèle élève non seulement sur les labels réels d'un jeu de données mais aussi sur les distributions de probabilité complètes, les logits adoucis par un paramètre de température, produites par l'enseignant, ce qui transmet une information plus riche que de simples étiquettes binaires. Des modèles comme DistilBERT, réduisant de 40 % la taille de BERT tout en conservant environ 97 % de ses performances, ou les variantes distillées des familles Llama et Qwen, illustrent cette approche appliquée aux grands modèles de langage. La distillation permet de déployer des modèles performants sur des environnements contraints, edge computing, mobile ou serveurs sans GPU, tout en réduisant la latence d'inférence et les coûts d'exploitation. Pour un RSSI, elle pose un enjeu de propriété intellectuelle et de sécurité : distiller un modèle propriétaire via ses seules réponses en API, sans accès aux poids, constitue une forme de vol de modèle de plus en plus surveillée par les éditeurs.

Description

La distillation de modèle est une technique de compression où un petit modèle (élève/student) apprend à imiter les sorties d'un grand modèle (enseignant/teacher). Le student reproduit les distributions de probabilité du teacher (soft labels) plutôt que les labels durs, capturant ainsi les nuances de la connaissance.

Fonctionnement

L'entraînement du student minimise la divergence KL entre ses probabilités de sortie et celles du teacher, pondérée par une température de distillation T. Des variantes incluent la distillation de features intermédiaires et la data-free distillation générant des données synthétiques via le teacher.

Points clés

  • DistilBERT atteint 97% des performances de BERT avec 40% moins de paramètres et 60% plus rapide
  • Rend possible le déploiement de LLM performants sur des endpoints ou systèmes air-gapped en cybersécurité
  • Des modèles comme Phi-2 (Microsoft) démontrent que la distillation produit des petits modèles très performants

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis