Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Optimisation de politique par proximite PPO

ia

Définition

L'optimisation de politique par proximite (Proximal Policy Optimization, PPO) est un algorithme d'apprentissage par renforcement propose par Schulman et al. (OpenAI, 2017), largement utilise pour aligner les grands modeles de langage sur les preferences humaines dans le cadre du RLHF (Reinforcement Learning from Human Feedback). PPO optimise la politique du modele (sa maniere de generer du texte) en maximisant une recompense estimee par un modele de recompense entraine sur des jugements humains, tout en contraignant chaque mise a jour a rester proche de la politique precedente via une fonction objectif ecretee (clipped surrogate objective), ce qui evite les changements brutaux et destabilisants typiques des methodes de gradient de politique plus anciennes. Le pipeline RLHF complet avec PPO implique generalement quatre modeles distincts en memoire durant l'entrainement : le modele de politique, un modele de reference fige, le modele de recompense et un modele de valeur, ce qui en fait une methode couteuse en calcul et complexe a stabiliser en pratique. PPO a ete utilise pour aligner GPT-3.5, GPT-4 et d'autres modeles commerciaux majeurs. Pour un DSI, il est utile de savoir que PPO reste la reference historique de l'alignement par RLHF, mais que des alternatives plus simples comme le DPO gagnent du terrain pour les projets internes disposant de moins de ressources d'ingenierie ML dediees.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis