Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

RLVR (Reinforcement Learning with Verifiable Rewards)

ia

Définition

RLVR (Reinforcement Learning with Verifiable Rewards) est une methode d'alignement et d'amelioration des LLMs qui utilise des recompenses automatiquement verifiables (plutot qu'un reward model appris depuis des preferences humaines) pour entrainer les modeles. Le principe : dans les domaines ou la reponse peut etre verifiee objectivement — mathematiques (la solution peut etre verifiee par calcul), code (tests unitaires automatises), jeux a regles fixes — on peut utiliser cette verification comme signal de recompense direct. DeepSeek-R1 (DeepSeek AI, 2025) a popularise le RLVR comme methode centrale d'entrainement des modeles de raisonnement. L'entrainement de DeepSeek-R1 utilise principalement des donnees mathematiques et de code avec verification automatique, sans necessiter de annotateurs humains pour les preferences. Cette approche a produit des modeles competitifs avec o1 d'OpenAI a un cout d'entrainement dramatiquement inferieur. Le RLVR est particulierement puissant car il elimine le goulot d'etranglement des annotations humaines et le probleme de reward hacking inherent aux reward models appris : si la reponse est correcte selon un verifieur fiable, le reward est 1 ; sinon 0 (ou une valeur continue pour les partiellement correctes). Il n'y a pas de moyen de 'tricher' sur un verifieur mathematique. Les domaines naturellement adaptes au RLVR : mathematiques (verification par calcul formel ou execution), code (execution des tests unitaires), logique formelle (verification par solveur SAT/SMT), jeux a regles completes (Go, Echecs, Atari). Pour d'autres domaines (ecriture, raisonnement naturel), des proxis de verifiabilite sont developpes (LLM-as-verifier avec criteres objectifs). RLVR combiné avec des grandes quantites de donnees de raisonnement synthétiques (generes par les modeles eux-memes, filtrés par verification) est actuellement le paradigme dominant pour l'amelioration des modeles de raisonnement. Process Reward Models (PRMs) peuvent etre vus comme une forme plus granulaire de RLVR ou chaque etape du raisonnement est verifiee.

Pipeline RLVR pour les mathematiques

from trl import GRPOTrainer, GRPOConfig  # Group Relative Policy Optimization

def math_verifier(completions, ground_truths):
    rewards = []
    for comp, gt in zip(completions, ground_truths):
        predicted = extract_boxed_answer(comp)
        # Verifier par evaluation symbolique ou numerique
        is_correct = symbolic_eval(predicted) == symbolic_eval(gt)
        rewards.append(1.0 if is_correct else 0.0)
    return rewards

config = GRPOConfig(
    model_name='deepseek-ai/DeepSeek-R1-Distill-Qwen-7B',
    reward_funcs=[math_verifier, format_verifier],  # Plusieurs verifieus
    num_generations=8,  # Echantillons par prompt (GRPO)
    temperature=0.7,
)
trainer = GRPOTrainer(model=model, args=config, train_dataset=math_dataset)

RLVR vs RLHF

AspectRLHFRLVR
Source rewardPreferences humainesVerifieur automatique
Reward hackingRisque eleveRisque faible (verif. objective)
DomainesUniverselMaths, code, logique
Cout annotationsEleveNul
ScalabiliteLimitee par humainsIllimitee

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis