Modèle brouillon pour décodage spéculatif
iaDéfinition
Un modèle brouillon, ou draft model, est un modèle de langage de petite taille utilisé dans le cadre du décodage spéculatif pour générer rapidement des suites de tokens candidats, ensuite vérifiées par le modèle cible principal, plus grand et plus coûteux à exécuter. Le modèle brouillon doit être suffisamment rapide, généralement dix à vingt fois plus petit que le modèle cible, pour que le gain de temps sur la génération dépasse le coût de la vérification, tout en produisant des prédictions suffisamment proches du modèle cible pour obtenir un taux d'acceptation élevé. Le choix du modèle brouillon est déterminant pour l'efficacité globale du décodage spéculatif : un modèle trop faible génère des tokens souvent rejetés, annulant le gain de vitesse, tandis qu'un modèle trop proche du modèle cible en taille réduit l'intérêt économique de l'approche. Deux stratégies courantes existent : utiliser un modèle distinct de la même famille, par exemple une version plus petite du même modèle, ou utiliser des têtes de prédiction additionnelles entraînées sur le modèle cible lui-même, comme dans la méthode Medusa. Certains moteurs d'inférence, comme TensorRT-LLM ou vLLM, prennent en charge nativement la configuration d'un modèle brouillon. Pour une équipe MLOps, ce choix fait partie des leviers d'optimisation du coût d'inférence en production.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.