MT-Bench
iaDéfinition
MT-Bench (Multi-Turn Benchmark) est un benchmark d'evaluation des LLMs conversationnels developpe par Zheng et al. (LMSYS, 2023) dans le paper 'Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena'. Il se compose de 80 questions en 8 categories (raisonnement, mathematiques, code, extraction, ecriture, roleplay, STEM, humanites) et evalue les capacites de chat multi-tour en utilisant GPT-4 comme juge automatique. Le format MT-Bench est unique : chaque question comporte un premier tour puis un second tour qui necessite de s'appuyer sur la reponse du premier. Cela teste la coherence conversationnelle et la memoire a court terme. GPT-4 evalue chaque reponse sur une echelle de 1 a 10, resultant en un score global de 1-10. MT-Bench a ete crucial pour demontrer la viabilite du 'LLM-as-a-Judge' : les evaluations de GPT-4 correspondent aux preferences humaines dans 80% des cas, rendant l'evaluation automatique a grande echelle fiable. Cette methodologie a influence des frameworks d'evaluation comme AlpacaEval, Arena-Hard, et les evaluations internes de nombreux labs. Les scores MT-Bench sont devenus une reference standard dans les publications de modeles : GPT-4 score environ 8.99/10, Claude 3.5 Sonnet ~8.7/10, Llama 3.1 70B Instruct ~8.1/10, Mistral 7B Instruct ~6.8/10. Ces scores permettent de situer rapidement un nouveau modele dans le paysage. Des limitations notables : MT-Bench est relativement petit (80 questions), ce qui le rend sensible aux fluctuations stochastiques. Les categories mathematiques et code sont jugees par GPT-4 qui peut lui-meme faire des erreurs. Des alternatives plus robustes comme Arena-Hard et AlpacaEval 2.0 LC ont ete developpees pour adresser ces limites.
Categories MT-Bench
- Raisonnement : problemes logiques, puzzles, deduction
- Mathematiques : calcul, algebre, geometrie
- Code : ecriture et debug de code
- Extraction : NER, QA sur documents
- Ecriture : emails, essais, resumes
- Roleplay : jeux de roles et scenarios
- STEM : physique, chimie, biologie
- Humanites : philosophie, histoire, litterature
Scores MT-Bench reference
| Modele | Score /10 |
|---|---|
| GPT-4 Turbo | 9.32 |
| Claude 3.5 Sonnet | 8.70 |
| Llama 3.1 70B Instruct | 8.10 |
| Mistral 7B Instruct v0.3 | 6.84 |
| Llama 2 7B Chat | 6.27 |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h