Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

TGI (Text Generation Inference)

ia

Définition

Text Generation Inference (TGI) est un serveur d'inférence haute performance pour les LLMs développé et maintenu par HuggingFace. C'est la solution d'inférence officielle de HuggingFace Inference Endpoints et une référence dans l'écosystème pour servir des LLMs en production avec Docker. TGI expose une API REST/gRPC optimisée compatible avec les clients HuggingFace InferenceClient et partiellement avec l'API OpenAI. TGI implémente le Continuous Batching (traitement continu des requêtes), le Flash Attention 2 (attention optimisée pour GPU), la quantification à la volée (bitsandbytes int8/int4, GPTQ, AWQ), le tensor parallelism multi-GPU, et la génération guidée via grammar-based sampling (JSON schema, regex). Depuis la version 2.0, TGI supporte également les modèles multimodaux (vision-langage comme LLaVA, IDEFICS) et le function calling. Une caractéristique distincte de TGI est son serveur gRPC interne qui sépare le router HTTP (Rust) du worker d'inférence Python/Torch. Cette architecture améliore les performances sous haute concurrence et facilite le scaling horizontal. Le router gère la file d'attente, le batching dynamique et le load balancing entre workers, tandis que le worker Python gère l'inférence GPU proprement dite. Pour le déploiement enterprise, TGI s'intègre nativement avec l'écosystème HuggingFace (Inference Endpoints, Hub), ce qui simplifie le déploiement de modèles HuggingFace en production. Son packaging Docker officiel (ghcr.io/huggingface/text-generation-inference) inclut toutes les dépendances CUDA et permet un déploiement en quelques minutes sur AWS, GCP, Azure ou on-premise. Comparé à vLLM, TGI a l'avantage d'un meilleur support des modèles HuggingFace "exotiques" (architectures non-mainstream) et d'une gestion plus fine des tokens spéciaux, mais vLLM surpasse généralement TGI en throughput pur sur les architectures standards.

Déploiement Docker TGI

# LLaMA 3.1 8B avec 1 GPU A100
docker run --gpus all   -v $HOME/.cache/huggingface:/data   -p 8080:80   ghcr.io/huggingface/text-generation-inference:2.3.0   --model-id meta-llama/Meta-Llama-3.1-8B-Instruct   --num-shard 1   --max-input-length 8192   --max-total-tokens 16384   --quantize awq

# Test
curl http://localhost:8080/v1/chat/completions   -H "Content-Type: application/json"   -d '{"model":"tgi","messages":[{"role":"user","content":"Hello"}]}'

Multi-GPU tensor parallelism

# LLaMA 3.1 70B sur 4× A100 80GB
docker run --gpus '"device=0,1,2,3"'   ghcr.io/huggingface/text-generation-inference:2.3.0   --model-id meta-llama/Meta-Llama-3.1-70B-Instruct   --num-shard 4   --max-input-length 32768

Fonctionnalités enterprise

  • Token streaming (Server-Sent Events)
  • Messages API compatible OpenAI
  • Guided decoding (JSON, regex, EBNF grammar)
  • Watermarking (détection contenu IA)
  • Métriques Prometheus (latency p50/p99, queue size, batch size)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis