Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Quantification en 4 bits

ia

Définition

La quantification en 4 bits est une technique de compression qui représente les poids d'un modèle d'IA avec seulement 4 bits par valeur, au lieu des 16 ou 32 bits habituels des formats flottants classiques, réduisant l'empreinte mémoire d'un modèle d'un facteur de quatre à huit selon le format de référence. Cette réduction rend possible le chargement de grands modèles de langage, par exemple des modèles de 70 milliards de paramètres, sur des GPU disposant de moins de 24 gigaoctets de mémoire, voire sur du matériel grand public. Des méthodes comme GPTQ, AWQ ou la quantification NF4, associée à la technique QLoRA pour le fine-tuning, ont démontré qu'une précision de 4 bits conserve une qualité de sortie proche du modèle en précision native pour de nombreuses tâches, avec toutefois une dégradation mesurable sur certaines tâches de raisonnement complexe. Le format GGUF, utilisé notamment par le moteur llama.cpp, propose plusieurs variantes de quantification en 4 bits avec différents compromis entre taille et qualité, comme Q4_0 ou Q4_K_M. La quantification en 4 bits est aujourd'hui la référence pour le déploiement local ou embarqué de modèles de langage, y compris sur ordinateurs personnels. Pour une DSI, elle permet d'envisager des déploiements on-premise à moindre coût matériel, un enjeu de souveraineté pour les données sensibles.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis