Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

GGUF

ia

Définition

GGUF (GPT-Generated Unified Format) est un format de fichier binaire pour les modèles de langage quantifiés, créé par Georgi Gerganov (auteur de llama.cpp) et introduit en août 2023 comme successeur de GGML. GGUF est aujourd'hui le format standard de facto pour l'inférence LLM en local, supporté par llama.cpp, Ollama, LM Studio, GPT4All, jan.ai, et des centaines d'autres outils. La principale innovation de GGUF par rapport à son prédécesseur GGML est son extensibilité : le format inclut un système de métadonnées key-value permettant d'incorporer directement dans le fichier toutes les informations nécessaires à l'inférence (architecture, hyperparamètres, template de prompt, tokenizer, etc.). Un seul fichier .gguf est donc auto-suffisant, éliminant le besoin de fichiers de configuration séparés. GGUF supporte une variété de schémas de quantification (Q-types) avec différents compromis qualité/taille : Q4_K_M (4-bit, quantiles mixtes) est le gold standard offrant le meilleur équilibre, Q5_K_M pour une meilleure qualité, Q2_K pour les configurations très contraintes, et IQ (importance-quantized) pour des variantes encore plus précises. La notation K (k-quants) indique une quantification adaptative par groupes, significativement meilleure que la quantification Q fixe. L'avantage majeur de GGUF via llama.cpp est la flexibilité de déploiement : CPU-only, GPU partiel (offloading d'une partie des couches vers GPU avec --n-gpu-layers), ou GPU-full. Cette capacité d'inférence "hybride CPU+GPU" est unique à GGUF et permet de faire tourner des modèles de 70B sur des machines avec 24GB de VRAM + 64GB RAM, en offloadant les couches qui tiennent en VRAM et calculant le reste sur CPU. Sur HuggingFace, TheBloke puis bartowski sont les principaux distributeurs de modèles GGUF, avec des dizaines de milliers de versions quantifiées de pratiquement tous les modèles open-source majeurs.

Types de quantification GGUF

TypeBits effectifsTaille 7BQualité
Q2_K2.6~2.7 GBDégradée
Q3_K_M3.35~3.5 GBCorrecte
Q4_K_M4.8~4.8 GBTrès bonne ✓
Q5_K_M5.7~5.7 GBExcellente
Q8_08.5~8.5 GBQuasi-native
F1616~14 GBNative

Utilisation avec llama.cpp

# Téléchargement (huggingface-hub)
huggingface-cli download bartowski/Mistral-7B-Instruct-v0.3-GGUF   --include "Mistral-7B-Instruct-v0.3-Q4_K_M.gguf"   --local-dir ./models

# Inférence server (compatible OpenAI API)
./llama-server -m ./models/Mistral-7B-Instruct-v0.3-Q4_K_M.gguf   --n-gpu-layers 35 \   # Offloader 35 couches sur GPU
  --ctx-size 32768 \    # Contexte 32K
  --port 8080

Conversion vers GGUF

# Depuis un modèle HuggingFace
python3 llama.cpp/convert_hf_to_gguf.py   --outtype f16   --outfile model-f16.gguf   path/to/model/

# Quantification
./llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis