ExLlamaV2
iaDéfinition
ExLlamaV2 est un moteur d'inference LLM open-source developpe par turboderp, optimise pour les GPU NVIDIA et utilisant un format de quantisation proprietaire EXL2 (ExLlama quantization v2). Il est connu pour etre l'un des moteurs les plus rapides pour l'inference de modeles GGUF-like sur GPU, surpassant llama.cpp CUDA et Transformers HuggingFace en tokens/seconde. Le format EXL2 est la cle d'ExLlamaV2 : il utilise une quantisation mixte par groupe et par couche ou differentes couches du modele peuvent etre quantifiees a differents niveaux de bits (3.0, 3.5, 4.0, 4.5, 5.0, 5.5, 6.0, 8.0 bits par poids). Une calibration automatique determines quelles couches sont plus sensibles et meritent plus de bits, maximisant la qualite pour un budget memoire donne. Les performances typiques d'ExLlamaV2 vs alternatives sur RTX 4090 (24GB) : LLaMA 3.1 8B Q4 (EXL2 4bpw) : ~210 tokens/s ExLlamaV2 vs ~120 tokens/s llama.cpp CUDA, ~130 tokens/s vLLM. Pour LLaMA 3.1 70B (4bpw) sur 2x RTX 4090 : ~35 tokens/s ExLlamaV2 vs ~20 tokens/s llama.cpp. TabbyAPI est une interface serveur API compatible OpenAI construite sur ExLlamaV2, permettant d'utiliser ExLlamaV2 comme backend pour n'importe quelle application OpenAI-compatible. TextGeneration WebUI (oobabooga) supporte aussi ExLlamaV2 comme backend optionnel. ExLlamaV2 est particulierement utilise dans la communaute de l'IA locale pour maximiser la vitesse sur les GPU gaming (RTX 3090/4090). Le format EXL2 est cree en quantisant depuis les poids originaux BF16 via le script quantize.py de ExLlamaV2, en specifiant le bits per weight cible (typiquement 4.0-5.0 bpw pour un bon equilibre).
Inference rapide avec ExLlamaV2
from exllamav2 import ExLlamaV2, ExLlamaV2Cache, ExLlamaV2Config
from exllamav2.generator import ExLlamaV2DynamicGenerator, ExLlamaV2Sampler
config = ExLlamaV2Config('./LLaMA-3.1-8B-Instruct-EXL2-4.0bpw/')
model = ExLlamaV2(config)
cache = ExLlamaV2Cache(model, lazy=True)
model.load_autosplit(cache)
generator = ExLlamaV2DynamicGenerator(model=model, cache=cache)
settings = ExLlamaV2Sampler.Settings(token_repetition_penalty=1.1, temperature=0.8)
output = generator.generate(
prompt='Explique le Zero-Trust en 3 points cles.',
max_new_tokens=300, gen_settings=settings
)
print(output)Comparatif vitesse inference (RTX 4090)
| Moteur | 7B Q4 | 13B Q4 |
|---|---|---|
| ExLlamaV2 | ~210 tok/s | ~110 tok/s |
| llama.cpp (CUDA) | ~120 tok/s | ~65 tok/s |
| HF Transformers | ~60 tok/s | ~35 tok/s |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h