Outcome Reward Model (ORM)
iaDéfinition
Un Outcome Reward Model (ORM) est un modele de recompense qui evalue uniquement le resultat final (la reponse complete) plutot que les etapes intermediaires du raisonnement. C'est la forme la plus simple de reward model dans le pipeline RLHF : donner une reponse au modele, l'ORm la score bonne/mauvaise, ce score guide l'optimisation. L'ORM s'oppose au Process Reward Model (PRM) qui evalue chaque etape du raisonnement. L'avantage de l'ORM est sa simplicite : pas besoin d'annoter les etapes intermediaires, seulement le resultat final. Dans des domaines ou la correcteur finale est verifiable (maths, code), l'ORM peut etre un simple verifieur (la solution est-elle correcte ?) sans necessiter de modele appris. Les limites de l'ORM dans le contexte du raisonnement multi-etapes : un ORM ne peut pas distinguer une bonne reponse arrivee par un bon raisonnement d'une bonne reponse arrivee par chance ou par un raisonnement errone accidentellement correct. Cela limite sa capacite a ameliorer la qualite du raisonnement : le modele peut apprendre a deviner correctement sans ameliorer son raisonnement. Comparaison ORM vs PRM pour le raisonnement : Lightman et al. (OpenAI, 2023) ont montre que les PRMs surpassent les ORMs pour l'amelioration de GPT-4 sur GSM8K (+10%) et MATH (+8%), car les PRMs peuvent corriger les erreurs au milieu du raisonnement avant qu'elles ne compromettent la reponse finale. En pratique, une approche hybride est souvent utilisee : ORM pour le filtrage initial des solutions incorrectes (rapide et peu couteux), PRM pour le reranking fin des solutions candidates correctes (plus precis mais plus couteux). RLVR utilise essentiellement un ORM automatique (verifieur de correction) combine avec Best-of-N sampling.
ORM vs PRM : comparatif
| Aspect | ORM | PRM |
|---|---|---|
| Ce qu'il evalue | Reponse finale | Chaque etape |
| Annotation | Facile (correct/incorrect) | Difficile (etapes) |
| Datasets | Responses + binaire | PRM800K (OpenAI) |
| Performance GSM8K | Bonne | Meilleure |
| Robustesse | Vulnerable a la triche | Plus robuste |
ORM comme verifieur RLVR
def outcome_reward(model_output, ground_truth, task='math'):
if task == 'math':
# Extraire et evaluer la reponse finale
answer = extract_boxed_answer(model_output)
return 1.0 if symbolic_eq(answer, ground_truth) else 0.0
elif task == 'code':
# Executer les tests unitaires
return run_tests(model_output) / total_tests
elif task == 'general':
# LLM juge pour les reponses non verifiables
return llm_judge(model_output, ground_truth)
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h