Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Alignement par preference directe DPO

ia

Définition

L'alignement par preference directe (Direct Preference Optimization, DPO) est une methode d'alignement des modeles de langage sur les preferences humaines, proposee par Rafailov et al. en 2023, qui optimise directement le modele a partir de paires de reponses classees (preferee versus rejetee) sans passer par l'entrainement intermediaire d'un modele de recompense separe ni par l'apprentissage par renforcement, contrairement au RLHF (Reinforcement Learning from Human Feedback) classique base sur PPO. DPO reformule mathematiquement le probleme d'alignement comme une simple perte de classification binaire derivee directement de la formulation du RLHF, ce qui simplifie considerablement le pipeline d'entrainement : plus besoin d'entrainer, stocker et executer un modele de recompense distinct, ni de gerer l'instabilite d'entrainement caracteristique de l'apprentissage par renforcement. Cette simplification reduit significativement le cout de calcul et la complexite d'ingenierie pour aligner un modele, tout en obtenant des resultats comparables voire superieurs a PPO sur plusieurs benchmarks selon les auteurs. DPO est desormais largement adopte pour l'alignement de modeles open source (Mistral, Zephyr, Llama derives). Pour un DSI souhaitant aligner un modele sur les valeurs et le ton de son entreprise avec des ressources limitees, DPO represente une option plus accessible que le RLHF complet, a condition de disposer d'un jeu de donnees de preferences de qualite suffisante.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis