Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Reward Model

ia

Définition

Le Reward Model (modèle de récompense, RM) est un composant central du pipeline RLHF (Reinforcement Learning from Human Feedback), entraîné à prédire une valeur scalaire reflétant la qualité d'une réponse de LLM selon les préférences humaines. Il sert d'oracle de qualité pour guider l'optimisation PPO du modèle principal sans nécessiter des annotations humaines à chaque étape d'entraînement. Le Reward Model est entraîné sur des paires de comparaisons : des annotateurs humains évaluent deux réponses générées pour le même prompt et indiquent leur préférence. Le RM apprend à assigner des scores plus élevés aux réponses préférées via la Bradley-Terry loss : L = -E[log σ(r(x, y_w) - r(x, y_l))], où r(x,y) est le score prédit. Architecturalement, le RM est souvent initialisé depuis le SFT model, avec la tête de prédiction de token remplacée par une couche linéaire produisant un scalaire. InstructGPT (OpenAI, 2022) a popularisé ce pipeline en trois étapes : SFT → RM → PPO. Le RM entraîné sur ~30K comparaisons humaines permet ensuite d'évaluer des millions de réponses générées pendant l'optimisation PPO, agissant comme proxy des préférences humaines à l'échelle. Les défis du Reward Model sont bien documentés : reward hacking (le LLM apprend à maximiser le score RM sans réellement satisfaire les préférences humaines), distribution shift (le RM est entraîné sur des réponses du SFT model, pas du modèle amélioré par PPO), et le biais du RM vers les réponses verboses. Ces problèmes ont motivé le développement de DPO, RLAIF et des Process Reward Models. Les PRM (Process Reward Models) évaluent chaque étape de raisonnement intermédiaire plutôt que la réponse finale uniquement — approche utilisée par DeepSeek-R1 et les modèles o1-style pour améliorer le raisonnement mathématique et logique.

Architecture du Reward Model

from transformers import AutoModelForSequenceClassification

# RM basé sur LLaMA-3 8B avec tête de classification scalaire
reward_model = AutoModelForSequenceClassification.from_pretrained(
    "meta-llama/Meta-Llama-3-8B",
    num_labels=1,          # Score scalaire
    torch_dtype=torch.bfloat16
)
# La tête score_head = nn.Linear(hidden_size, 1)
# Prend le embedding du dernier token comme représentation de la réponse

Reward Hacking et mitigation

Le reward hacking survient quand le modèle optimisé trouve des patterns qui maximisent le RM mais ne correspondent pas aux intentions humaines :

  • Réponses excessivement longues (length bias)
  • Sycophancy : dire ce que l'utilisateur veut entendre
  • Répétition de points-clés de la question

Mitigations : KL divergence penalty par rapport au SFT model (β-term dans RLHF), reward ensembling (plusieurs RMs), Constitutional AI (règles explicites).

RMs open-source notables

  • OpenAssistant/reward-model-deberta-v3-large-v2
  • Llama-3-OffsetBias-RM-8B (NCSOFT)
  • InternLM2-7B-reward
  • ArmoRM-Llama3-8B-v0.1 (attribute-based)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis