Reward Model
iaDéfinition
Le Reward Model (modèle de récompense, RM) est un composant central du pipeline RLHF (Reinforcement Learning from Human Feedback), entraîné à prédire une valeur scalaire reflétant la qualité d'une réponse de LLM selon les préférences humaines. Il sert d'oracle de qualité pour guider l'optimisation PPO du modèle principal sans nécessiter des annotations humaines à chaque étape d'entraînement. Le Reward Model est entraîné sur des paires de comparaisons : des annotateurs humains évaluent deux réponses générées pour le même prompt et indiquent leur préférence. Le RM apprend à assigner des scores plus élevés aux réponses préférées via la Bradley-Terry loss : L = -E[log σ(r(x, y_w) - r(x, y_l))], où r(x,y) est le score prédit. Architecturalement, le RM est souvent initialisé depuis le SFT model, avec la tête de prédiction de token remplacée par une couche linéaire produisant un scalaire. InstructGPT (OpenAI, 2022) a popularisé ce pipeline en trois étapes : SFT → RM → PPO. Le RM entraîné sur ~30K comparaisons humaines permet ensuite d'évaluer des millions de réponses générées pendant l'optimisation PPO, agissant comme proxy des préférences humaines à l'échelle. Les défis du Reward Model sont bien documentés : reward hacking (le LLM apprend à maximiser le score RM sans réellement satisfaire les préférences humaines), distribution shift (le RM est entraîné sur des réponses du SFT model, pas du modèle amélioré par PPO), et le biais du RM vers les réponses verboses. Ces problèmes ont motivé le développement de DPO, RLAIF et des Process Reward Models. Les PRM (Process Reward Models) évaluent chaque étape de raisonnement intermédiaire plutôt que la réponse finale uniquement — approche utilisée par DeepSeek-R1 et les modèles o1-style pour améliorer le raisonnement mathématique et logique.
Architecture du Reward Model
from transformers import AutoModelForSequenceClassification
# RM basé sur LLaMA-3 8B avec tête de classification scalaire
reward_model = AutoModelForSequenceClassification.from_pretrained(
"meta-llama/Meta-Llama-3-8B",
num_labels=1, # Score scalaire
torch_dtype=torch.bfloat16
)
# La tête score_head = nn.Linear(hidden_size, 1)
# Prend le embedding du dernier token comme représentation de la réponse
Reward Hacking et mitigation
Le reward hacking survient quand le modèle optimisé trouve des patterns qui maximisent le RM mais ne correspondent pas aux intentions humaines :
- Réponses excessivement longues (length bias)
- Sycophancy : dire ce que l'utilisateur veut entendre
- Répétition de points-clés de la question
Mitigations : KL divergence penalty par rapport au SFT model (β-term dans RLHF), reward ensembling (plusieurs RMs), Constitutional AI (règles explicites).
RMs open-source notables
- OpenAssistant/reward-model-deberta-v3-large-v2
- Llama-3-OffsetBias-RM-8B (NCSOFT)
- InternLM2-7B-reward
- ArmoRM-Llama3-8B-v0.1 (attribute-based)
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h