Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Evaluation reference-free

ia

Définition

L'evaluation reference-free note la qualite d'une reponse d'un modele de langage sans reponse de reference preetablie. Contrairement aux metriques classiques comme BLEU ou ROUGE, qui mesurent un chevauchement textuel avec une reponse ideale ecrite a l'avance par un humain, l'evaluation reference-free juge la reponse directement selon des criteres intrinseques : coherence interne, pertinence par rapport au prompt, exactitude factuelle verifiable independamment, ou qualite de raisonnement. Cette approche s'appuie generalement sur un modele juge (LLM-as-a-judge) auquel on fournit uniquement le prompt et la reponse a evaluer, avec des instructions detaillees sur les criteres a appliquer,. L'interet principal est de s'affranchir du cout et des limites de la creation d'un jeu de references humaines de qualite, souvent le goulot d'etranglement des campagnes d'evaluation a grande echelle, et de permettre l'evaluation de taches ouvertes n'ayant pas de reponse unique correcte, comme la redaction creative ou le conseil personnalise. Les limites tiennent aux biais connus du modele juge : preference pour les reponses plus longues, sensibilite a l'ordre de presentation lors de comparaisons, et risque de partager les memes angles morts que le modele evalue si juge et evalue proviennent de la meme famille de modeles. Pour un DSI, ce type d'evaluation permet un suivi continu en production sans reconstituer un jeu de references a chaque mise a jour de modele.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis