Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Inférence LLM

ia

Définition

L'inférence LLM désigne le processus opérationnel par lequel un modèle de langage préalablement entraîné génère une prédiction ou une réponse à partir d'une entrée fournie, le prompt, par opposition à la phase d'entraînement au cours de laquelle les poids du modèle sont eux-mêmes ajustés et modifiés, l'inférence n'impliquant aucune modification des paramètres du modèle, uniquement l'exploitation de ceux déjà fixés. Lors de l'inférence, le modèle génère sa réponse de manière autorégressive : chaque token de sortie est prédit successivement en fonction de l'ensemble des tokens précédents déjà générés ou fournis en entrée, puis ce nouveau token est immédiatement ajouté au contexte disponible pour conditionner la prédiction du token suivant, ce processus se répétant jusqu'à l'atteinte d'un token de fin de séquence ou d'une limite de longueur définie. Plusieurs paramètres clés influencent directement le comportement et la qualité de la génération produite : la température, qui contrôle le degré d'aléatoire introduit dans le choix du token suivant parmi les candidats les plus probables, le top-p, restreignant l'échantillonnage à un sous-ensemble cumulatif de probabilité donné, et le nombre maximal de tokens de sortie autorisé. Le coût computationnel de l'inférence, distinct de celui de l'entraînement, constitue un enjeu économique et écologique croissant pour les fournisseurs exploitant ces modèles à très grande échelle en production.

Description

L'inférence LLM désigne le processus par lequel un modèle génère une prédiction ou réponse à partir d'un prompt. Lors de l'inférence, le modèle génère des tokens de manière autorégressive : chaque token est prédit en fonction de tous les tokens précédents dans le contexte courant.

Fonctionnement

Les paramètres clés de l'inférence incluent la température, top-p et top-k (sampling), ainsi que les optimisations : KV Cache (réutilisation des calculs précédents), batching dynamique, quantization et Speculative Decoding. Des frameworks dédiés (vLLM, TGI, llama.cpp) maximisent les throughputs.

Points clés

  • Le coût d'inférence (latence, tokens/seconde, GPU) est souvent la contrainte principale pour les déploiements production
  • Le KV Cache réduit la latence de génération en évitant de recalculer les vecteurs clé-valeur des tokens précédents
  • vLLM avec PagedAttention optimise l'utilisation mémoire pour servir de nombreuses requêtes concurrentes efficacement

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis