Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

MT-Bench

ia

Définition

MT-Bench (Multi-Turn Benchmark) est un benchmark d'evaluation des LLMs conversationnels developpe par Zheng et al. (LMSYS, 2023) dans le paper 'Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena'. Il se compose de 80 questions en 8 categories (raisonnement, mathematiques, code, extraction, ecriture, roleplay, STEM, humanites) et evalue les capacites de chat multi-tour en utilisant GPT-4 comme juge automatique. Le format MT-Bench est unique : chaque question comporte un premier tour puis un second tour qui necessite de s'appuyer sur la reponse du premier. Cela teste la coherence conversationnelle et la memoire a court terme. GPT-4 evalue chaque reponse sur une echelle de 1 a 10, resultant en un score global de 1-10. MT-Bench a ete crucial pour demontrer la viabilite du 'LLM-as-a-Judge' : les evaluations de GPT-4 correspondent aux preferences humaines dans 80% des cas, rendant l'evaluation automatique a grande echelle fiable. Cette methodologie a influence des frameworks d'evaluation comme AlpacaEval, Arena-Hard, et les evaluations internes de nombreux labs. Les scores MT-Bench sont devenus une reference standard dans les publications de modeles : GPT-4 score environ 8.99/10, Claude 3.5 Sonnet ~8.7/10, Llama 3.1 70B Instruct ~8.1/10, Mistral 7B Instruct ~6.8/10. Ces scores permettent de situer rapidement un nouveau modele dans le paysage. Des limitations notables : MT-Bench est relativement petit (80 questions), ce qui le rend sensible aux fluctuations stochastiques. Les categories mathematiques et code sont jugees par GPT-4 qui peut lui-meme faire des erreurs. Des alternatives plus robustes comme Arena-Hard et AlpacaEval 2.0 LC ont ete developpees pour adresser ces limites.

Categories MT-Bench

  • Raisonnement : problemes logiques, puzzles, deduction
  • Mathematiques : calcul, algebre, geometrie
  • Code : ecriture et debug de code
  • Extraction : NER, QA sur documents
  • Ecriture : emails, essais, resumes
  • Roleplay : jeux de roles et scenarios
  • STEM : physique, chimie, biologie
  • Humanites : philosophie, histoire, litterature

Scores MT-Bench reference

ModeleScore /10
GPT-4 Turbo9.32
Claude 3.5 Sonnet8.70
Llama 3.1 70B Instruct8.10
Mistral 7B Instruct v0.36.84
Llama 2 7B Chat6.27

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis