RLVR (Reinforcement Learning with Verifiable Rewards)
iaDéfinition
RLVR (Reinforcement Learning with Verifiable Rewards) est une methode d'alignement et d'amelioration des LLMs qui utilise des recompenses automatiquement verifiables (plutot qu'un reward model appris depuis des preferences humaines) pour entrainer les modeles. Le principe : dans les domaines ou la reponse peut etre verifiee objectivement — mathematiques (la solution peut etre verifiee par calcul), code (tests unitaires automatises), jeux a regles fixes — on peut utiliser cette verification comme signal de recompense direct. DeepSeek-R1 (DeepSeek AI, 2025) a popularise le RLVR comme methode centrale d'entrainement des modeles de raisonnement. L'entrainement de DeepSeek-R1 utilise principalement des donnees mathematiques et de code avec verification automatique, sans necessiter de annotateurs humains pour les preferences. Cette approche a produit des modeles competitifs avec o1 d'OpenAI a un cout d'entrainement dramatiquement inferieur. Le RLVR est particulierement puissant car il elimine le goulot d'etranglement des annotations humaines et le probleme de reward hacking inherent aux reward models appris : si la reponse est correcte selon un verifieur fiable, le reward est 1 ; sinon 0 (ou une valeur continue pour les partiellement correctes). Il n'y a pas de moyen de 'tricher' sur un verifieur mathematique. Les domaines naturellement adaptes au RLVR : mathematiques (verification par calcul formel ou execution), code (execution des tests unitaires), logique formelle (verification par solveur SAT/SMT), jeux a regles completes (Go, Echecs, Atari). Pour d'autres domaines (ecriture, raisonnement naturel), des proxis de verifiabilite sont developpes (LLM-as-verifier avec criteres objectifs). RLVR combiné avec des grandes quantites de donnees de raisonnement synthétiques (generes par les modeles eux-memes, filtrés par verification) est actuellement le paradigme dominant pour l'amelioration des modeles de raisonnement. Process Reward Models (PRMs) peuvent etre vus comme une forme plus granulaire de RLVR ou chaque etape du raisonnement est verifiee.
Pipeline RLVR pour les mathematiques
from trl import GRPOTrainer, GRPOConfig # Group Relative Policy Optimization
def math_verifier(completions, ground_truths):
rewards = []
for comp, gt in zip(completions, ground_truths):
predicted = extract_boxed_answer(comp)
# Verifier par evaluation symbolique ou numerique
is_correct = symbolic_eval(predicted) == symbolic_eval(gt)
rewards.append(1.0 if is_correct else 0.0)
return rewards
config = GRPOConfig(
model_name='deepseek-ai/DeepSeek-R1-Distill-Qwen-7B',
reward_funcs=[math_verifier, format_verifier], # Plusieurs verifieus
num_generations=8, # Echantillons par prompt (GRPO)
temperature=0.7,
)
trainer = GRPOTrainer(model=model, args=config, train_dataset=math_dataset)RLVR vs RLHF
| Aspect | RLHF | RLVR |
|---|---|---|
| Source reward | Preferences humaines | Verifieur automatique |
| Reward hacking | Risque eleve | Risque faible (verif. objective) |
| Domaines | Universel | Maths, code, logique |
| Cout annotations | Eleve | Nul |
| Scalabilite | Limitee par humains | Illimitee |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h