Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

RLHF (Reinforcement Learning from Human Feedback)

ia

Définition

Le RLHF, Reinforcement Learning from Human Feedback, est la technique d'alignement de référence permettant d'ajuster le comportement d'un grand modèle de langage pré-entraîné pour le rendre conforme aux préférences humaines réelles en matière d'utilité, d'honnêteté et d'innocuité, au-delà de la simple capacité à générer un texte statistiquement plausible acquise durant le pré-entraînement. Le processus se déroule classiquement en trois phases successives : une phase de fine-tuning supervisé (SFT) initiale, où le modèle est affiné sur un jeu de démonstrations rédigées par des annotateurs humains illustrant le comportement souhaité en réponse à diverses instructions, l'entraînement d'un modèle de récompense (reward model) distinct, entraîné à partir de comparaisons humaines entre plusieurs réponses générées pour une même requête, ces annotateurs classant les réponses par ordre de préférence plutôt que de les noter dans l'absolu, une tâche jugée plus fiable et cohérente pour des évaluateurs humains, et enfin une phase d'optimisation par apprentissage par renforcement, généralement via l'algorithme PPO (Proximal Policy Optimization), où le modèle de langage est ajusté itérativement pour maximiser le score attribué par le modèle de récompense entraîné à l'étape précédente. Des variantes plus récentes comme DPO (Direct Preference Optimization) simplifient ce pipeline en supprimant l'étape explicite d'apprentissage par renforcement.

Description

Le RLHF (Reinforcement Learning from Human Feedback) est la technique d'alignement des LLM sur les préférences humaines. Elle combine le fine-tuning supervisé initial, l'entraînement d'un modèle de récompense sur des comparaisons humaines, et l'optimisation par renforcement (PPO) pour maximiser ce reward.

Fonctionnement

Le processus en 3 phases : SFT (Supervised Fine-Tuning), entraînement du reward model sur des préférences annotées, puis optimisation PPO du LLM pour maximiser le reward tout en maintenant la régularisation KL avec le modèle SFT. Les variantes DPO et RLAIF simplifiient ce processus.

Points clés

  • Base de l'alignement de GPT-4, Claude et Gemini : indispensable pour passer d'un modèle completion à un assistant
  • Un reward model mal calibré induit du reward hacking (l'agent optimise le proxy au lieu de l'objectif réel)
  • DPO (Direct Preference Optimization) remplace avantageusement PPO dans de nombreuses implémentations récentes

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis