Ordonnancement des requêtes d'inférence
iaDéfinition
L'ordonnancement des requêtes d'inférence désigne l'ensemble des politiques et mécanismes qui déterminent l'ordre et le regroupement dans lequel un serveur de modèles d'IA traite les requêtes entrantes, afin d'optimiser des critères souvent contradictoires comme la latence par requête, le débit global du système et l'équité entre utilisateurs. Un ordonnanceur d'inférence doit décider quelles requêtes intégrer à un lot en cours de traitement, via le décodage par lots continus, dans quel ordre les servir, par exemple premier arrivé premier servi ou selon une priorité métier, et comment allouer la mémoire GPU disponible, notamment le cache de valeurs-clés, entre séquences concurrentes. Des stratégies avancées différencient la phase de préremplissage, ou prefill, qui traite le prompt initial et est intensive en calcul, de la phase de décodage, qui génère les tokens un par un et est limitée par la bande passante mémoire ; certains ordonnanceurs séparent ces deux phases sur des GPU distincts pour optimiser chacune indépendamment, une approche dite disaggregated serving. Des moteurs comme vLLM, avec son algorithme PagedAttention, ou Sarathi-Serve intègrent ces logiques d'ordonnancement. Pour une DSI opérant des modèles en production à grande échelle, un ordonnancement efficace réduit directement le coût par requête et améliore l'expérience utilisateur en limitant les pics de latence lors des périodes de forte charge.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.