GGUF
iaDéfinition
GGUF (GPT-Generated Unified Format) est un format de fichier binaire pour les modèles de langage quantifiés, créé par Georgi Gerganov (auteur de llama.cpp) et introduit en août 2023 comme successeur de GGML. GGUF est aujourd'hui le format standard de facto pour l'inférence LLM en local, supporté par llama.cpp, Ollama, LM Studio, GPT4All, jan.ai, et des centaines d'autres outils. La principale innovation de GGUF par rapport à son prédécesseur GGML est son extensibilité : le format inclut un système de métadonnées key-value permettant d'incorporer directement dans le fichier toutes les informations nécessaires à l'inférence (architecture, hyperparamètres, template de prompt, tokenizer, etc.). Un seul fichier .gguf est donc auto-suffisant, éliminant le besoin de fichiers de configuration séparés. GGUF supporte une variété de schémas de quantification (Q-types) avec différents compromis qualité/taille : Q4_K_M (4-bit, quantiles mixtes) est le gold standard offrant le meilleur équilibre, Q5_K_M pour une meilleure qualité, Q2_K pour les configurations très contraintes, et IQ (importance-quantized) pour des variantes encore plus précises. La notation K (k-quants) indique une quantification adaptative par groupes, significativement meilleure que la quantification Q fixe. L'avantage majeur de GGUF via llama.cpp est la flexibilité de déploiement : CPU-only, GPU partiel (offloading d'une partie des couches vers GPU avec --n-gpu-layers), ou GPU-full. Cette capacité d'inférence "hybride CPU+GPU" est unique à GGUF et permet de faire tourner des modèles de 70B sur des machines avec 24GB de VRAM + 64GB RAM, en offloadant les couches qui tiennent en VRAM et calculant le reste sur CPU. Sur HuggingFace, TheBloke puis bartowski sont les principaux distributeurs de modèles GGUF, avec des dizaines de milliers de versions quantifiées de pratiquement tous les modèles open-source majeurs.
Types de quantification GGUF
| Type | Bits effectifs | Taille 7B | Qualité |
|---|---|---|---|
| Q2_K | 2.6 | ~2.7 GB | Dégradée |
| Q3_K_M | 3.35 | ~3.5 GB | Correcte |
| Q4_K_M | 4.8 | ~4.8 GB | Très bonne ✓ |
| Q5_K_M | 5.7 | ~5.7 GB | Excellente |
| Q8_0 | 8.5 | ~8.5 GB | Quasi-native |
| F16 | 16 | ~14 GB | Native |
Utilisation avec llama.cpp
# Téléchargement (huggingface-hub)
huggingface-cli download bartowski/Mistral-7B-Instruct-v0.3-GGUF --include "Mistral-7B-Instruct-v0.3-Q4_K_M.gguf" --local-dir ./models
# Inférence server (compatible OpenAI API)
./llama-server -m ./models/Mistral-7B-Instruct-v0.3-Q4_K_M.gguf --n-gpu-layers 35 \ # Offloader 35 couches sur GPU
--ctx-size 32768 \ # Contexte 32K
--port 8080
Conversion vers GGUF
# Depuis un modèle HuggingFace
python3 llama.cpp/convert_hf_to_gguf.py --outtype f16 --outfile model-f16.gguf path/to/model/
# Quantification
./llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h