Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Format de poids GGUF

ia

Définition

Le format GGUF, pour GPT-Generated Unified Format, est un format de fichier binaire conçu pour stocker et distribuer les poids de modèles de langage quantifiés, principalement utilisé par le moteur d'inférence llama.cpp et son écosystème. Successeur du format GGML, GGUF a été introduit pour améliorer l'extensibilité et la compatibilité ascendante, en intégrant dans un seul fichier les poids du modèle, les métadonnées nécessaires à son exécution, comme le tokenizer et les hyperparamètres d'architecture, et les informations de quantification. GGUF propose de nombreuses variantes de quantification, désignées par des noms comme Q4_K_M, Q5_K_S ou Q8_0, offrant différents compromis entre taille de fichier et qualité de génération, du 2 bits au 8 bits par poids. Ce format est massivement utilisé par la communauté open source, notamment sur la plateforme Hugging Face, pour distribuer des versions compressées de modèles comme Llama, Mistral ou Qwen, exécutables sur ordinateurs personnels sans GPU dédié, en s'appuyant sur le CPU et une mémoire vive standard. Le format GGUF se distingue d'ONNX, davantage orienté interopérabilité entre frameworks et matériels industriels, et de safetensors, format de référence pour les poids non quantifiés sur Hugging Face. Pour une équipe souhaitant déployer un modèle en local ou en périphérie, le format GGUF est souvent le point d'entrée le plus simple.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis