Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Outcome Reward Model (ORM)

ia

Définition

Un Outcome Reward Model (ORM) est un modele de recompense qui evalue uniquement le resultat final (la reponse complete) plutot que les etapes intermediaires du raisonnement. C'est la forme la plus simple de reward model dans le pipeline RLHF : donner une reponse au modele, l'ORm la score bonne/mauvaise, ce score guide l'optimisation. L'ORM s'oppose au Process Reward Model (PRM) qui evalue chaque etape du raisonnement. L'avantage de l'ORM est sa simplicite : pas besoin d'annoter les etapes intermediaires, seulement le resultat final. Dans des domaines ou la correcteur finale est verifiable (maths, code), l'ORM peut etre un simple verifieur (la solution est-elle correcte ?) sans necessiter de modele appris. Les limites de l'ORM dans le contexte du raisonnement multi-etapes : un ORM ne peut pas distinguer une bonne reponse arrivee par un bon raisonnement d'une bonne reponse arrivee par chance ou par un raisonnement errone accidentellement correct. Cela limite sa capacite a ameliorer la qualite du raisonnement : le modele peut apprendre a deviner correctement sans ameliorer son raisonnement. Comparaison ORM vs PRM pour le raisonnement : Lightman et al. (OpenAI, 2023) ont montre que les PRMs surpassent les ORMs pour l'amelioration de GPT-4 sur GSM8K (+10%) et MATH (+8%), car les PRMs peuvent corriger les erreurs au milieu du raisonnement avant qu'elles ne compromettent la reponse finale. En pratique, une approche hybride est souvent utilisee : ORM pour le filtrage initial des solutions incorrectes (rapide et peu couteux), PRM pour le reranking fin des solutions candidates correctes (plus precis mais plus couteux). RLVR utilise essentiellement un ORM automatique (verifieur de correction) combine avec Best-of-N sampling.

ORM vs PRM : comparatif

AspectORMPRM
Ce qu'il evalueReponse finaleChaque etape
AnnotationFacile (correct/incorrect)Difficile (etapes)
DatasetsResponses + binairePRM800K (OpenAI)
Performance GSM8KBonneMeilleure
RobustesseVulnerable a la trichePlus robuste

ORM comme verifieur RLVR

def outcome_reward(model_output, ground_truth, task='math'):
    if task == 'math':
        # Extraire et evaluer la reponse finale
        answer = extract_boxed_answer(model_output)
        return 1.0 if symbolic_eq(answer, ground_truth) else 0.0
    elif task == 'code':
        # Executer les tests unitaires
        return run_tests(model_output) / total_tests
    elif task == 'general':
        # LLM juge pour les reponses non verifiables
        return llm_judge(model_output, ground_truth)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis