Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Modèle de récompense de processus (Process Reward Model)

ia

Définition

Un modèle de récompense de processus, ou Process Reward Model (PRM), est un modèle entraîné à évaluer chaque étape intermédiaire d'un raisonnement produit par un LLM, plutôt que de noter uniquement la réponse finale comme le fait un modèle de récompense classique, dit orienté résultat. Il attribue un score à chaque étape d'une chaîne de raisonnement, permettant de détecter précisément où un raisonnement dévie, même lorsque la conclusion finale s'avère correcte par coïncidence. Cette granularité rend les PRM particulièrement utiles pour les tâches de mathématiques et de programmation, où un raisonnement correct étape par étape est un meilleur signal d'entraînement qu'une simple vérification du résultat. OpenAI a documenté cette approche dans des travaux sur la vérification de raisonnement pas à pas, montrant qu'elle surpasse les modèles de récompense orientés résultat sur des benchmarks comme MATH. L'entraînement d'un PRM nécessite des annotations humaines coûteuses au niveau de chaque étape, ce qui a motivé le développement de méthodes semi-automatiques pour générer ces labels à grande échelle. Les PRM sont utilisés à la fois pour guider l'apprentissage par renforcement lors de l'entraînement d'un modèle et pour re-classer plusieurs chaînes de raisonnement candidates au moment de l'inférence, une technique appelée best-of-N couramment employée.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis