Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

ExLlamaV2

ia

Définition

ExLlamaV2 est un moteur d'inference LLM open-source developpe par turboderp, optimise pour les GPU NVIDIA et utilisant un format de quantisation proprietaire EXL2 (ExLlama quantization v2). Il est connu pour etre l'un des moteurs les plus rapides pour l'inference de modeles GGUF-like sur GPU, surpassant llama.cpp CUDA et Transformers HuggingFace en tokens/seconde. Le format EXL2 est la cle d'ExLlamaV2 : il utilise une quantisation mixte par groupe et par couche ou differentes couches du modele peuvent etre quantifiees a differents niveaux de bits (3.0, 3.5, 4.0, 4.5, 5.0, 5.5, 6.0, 8.0 bits par poids). Une calibration automatique determines quelles couches sont plus sensibles et meritent plus de bits, maximisant la qualite pour un budget memoire donne. Les performances typiques d'ExLlamaV2 vs alternatives sur RTX 4090 (24GB) : LLaMA 3.1 8B Q4 (EXL2 4bpw) : ~210 tokens/s ExLlamaV2 vs ~120 tokens/s llama.cpp CUDA, ~130 tokens/s vLLM. Pour LLaMA 3.1 70B (4bpw) sur 2x RTX 4090 : ~35 tokens/s ExLlamaV2 vs ~20 tokens/s llama.cpp. TabbyAPI est une interface serveur API compatible OpenAI construite sur ExLlamaV2, permettant d'utiliser ExLlamaV2 comme backend pour n'importe quelle application OpenAI-compatible. TextGeneration WebUI (oobabooga) supporte aussi ExLlamaV2 comme backend optionnel. ExLlamaV2 est particulierement utilise dans la communaute de l'IA locale pour maximiser la vitesse sur les GPU gaming (RTX 3090/4090). Le format EXL2 est cree en quantisant depuis les poids originaux BF16 via le script quantize.py de ExLlamaV2, en specifiant le bits per weight cible (typiquement 4.0-5.0 bpw pour un bon equilibre).

Inference rapide avec ExLlamaV2

from exllamav2 import ExLlamaV2, ExLlamaV2Cache, ExLlamaV2Config
from exllamav2.generator import ExLlamaV2DynamicGenerator, ExLlamaV2Sampler

config = ExLlamaV2Config('./LLaMA-3.1-8B-Instruct-EXL2-4.0bpw/')
model = ExLlamaV2(config)
cache = ExLlamaV2Cache(model, lazy=True)
model.load_autosplit(cache)

generator = ExLlamaV2DynamicGenerator(model=model, cache=cache)
settings = ExLlamaV2Sampler.Settings(token_repetition_penalty=1.1, temperature=0.8)

output = generator.generate(
    prompt='Explique le Zero-Trust en 3 points cles.',
    max_new_tokens=300, gen_settings=settings
)
print(output)

Comparatif vitesse inference (RTX 4090)

Moteur7B Q413B Q4
ExLlamaV2~210 tok/s~110 tok/s
llama.cpp (CUDA)~120 tok/s~65 tok/s
HF Transformers~60 tok/s~35 tok/s

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis