PEFT (Parameter-Efficient Fine-Tuning)
iaDéfinition
PEFT, Parameter-Efficient Fine-Tuning, désigne une famille de techniques d'adaptation de grands modèles de langage pré-entraînés à des tâches ou domaines spécifiques, qui n'ajustent qu'une fraction réduite des paramètres du modèle plutôt que de réentraîner l'intégralité de son architecture, une approche complète devenue impraticable pour les modèles de plusieurs milliards de paramètres compte tenu du coût en mémoire GPU et en temps de calcul qu'elle représenterait. LoRA (Low-Rank Adaptation), technique la plus répandue de cette famille, insère de petites matrices de décomposition de rang réduit en parallèle des couches du modèle original gelées, entraînant uniquement ces matrices additionnelles représentant typiquement moins de un pour cent des paramètres totaux. Le Prefix Tuning ajoute des vecteurs entraînables préfixés à chaque couche d'attention du Transformer, influençant le comportement du modèle sans modifier ses poids d'origine. Le Prompt Tuning, approche encore plus légère, n'entraîne qu'un ensemble réduit de tokens virtuels ajoutés en entrée du modèle. Ces approches réduisent drastiquement les coûts de calcul et de stockage comparés à un fine-tuning complet, tout en limitant significativement le risque de catastrophic forgetting, phénomène par lequel un modèle réentraîné intégralement perd des capacités générales acquises lors de son pré-entraînement initial, un compromis particulièrement recherché pour des déploiements multi-domaines en production.
Description
Le PEFT (Parameter-Efficient Fine-Tuning) est une famille de techniques de fine-tuning n'ajustant qu'une fraction des paramètres d'un LLM pré-entraîné. LoRA, Prefix Tuning, Prompt Tuning et Adapter Tuning permettent une spécialisation efficace sans le coût du full fine-tuning.
Fonctionnement
LoRA (Low-Rank Adaptation) est la technique PEFT dominante : elle approxime les mises à jour de poids par le produit de deux matrices de faible rang (r = 4 à 64), réduisant les paramètres entraînables de 99%. Les matrices LoRA sont fusionnées avec les poids originaux à l'inférence sans overhead.
Points clés
- LoRA permet de fine-tuner LLaMA-3 70B sur un seul GPU A100 là où le full fine-tuning nécessiterait 16+ GPU
- QLoRA combine quantization 4-bit et LoRA pour fine-tuner des LLM de 70B sur des GPU grand public
- Le catastrophic forgetting est minimisé par PEFT car les poids originaux restent gelés pendant le fine-tuning
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h