Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Compilateur TensorRT

ia

Définition

TensorRT est un compilateur et moteur d'exécution développé par NVIDIA pour optimiser l'inférence de modèles de deep learning sur les GPU NVIDIA. Il prend en entrée un modèle entraîné, souvent au format ONNX, et applique une série d'optimisations spécifiques au matériel cible, comme la fusion de couches successives en une seule opération, l'élimination de calculs redondants, la sélection automatique des noyaux de calcul les plus performants pour l'architecture GPU précise, et la quantification en précision réduite, FP16 ou INT8, voire FP8 sur les architectures récentes. Le résultat est un moteur d'inférence compilé et spécialisé pour une configuration matérielle donnée, offrant des gains de latence et de débit significatifs par rapport à une exécution directe du modèle non optimisé. Pour les grands modèles de langage, NVIDIA propose une extension dédiée, TensorRT-LLM, qui intègre également des optimisations spécifiques comme le décodage par lots continus, le décodage spéculatif et le parallélisme tensoriel multi-GPU. Le principal compromis de TensorRT est la spécificité matérielle du moteur compilé : un moteur optimisé pour une génération de GPU donnée n'est généralement pas portable vers une autre sans recompilation. Pour une DSI opérant exclusivement sur infrastructure NVIDIA, TensorRT est souvent l'option la plus performante pour réduire le coût par requête en production à grande échelle.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis