Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

LMSYS Chatbot Arena

ia

Définition

LMSYS Chatbot Arena est une plateforme d'evaluation collaborative des LLMs developpee par l'equipe LMSYS (Large Model Systems Organization) de UC Berkeley. Les utilisateurs soumettent une question a deux LLMs anonymes, recoivent deux reponses en parallele, et votent pour la meilleure. Les votes agreges permettent de calculer des scores ELO. L'approche Chatbot Arena resout un probleme fondamental : les benchmarks automatises mesurent des capacites specifiques mais ne refletent pas necessairement la satisfaction utilisateur dans des cas d'usage reels. Le palmarès agrege des millions de comparaisons humaines (plus de 2 millions a fin 2024) sur des requetes reelles et diversifiees. Le scoring ELO (adapte des classements aux echecs) permet de comparer des modeles meme sans comparaison directe. Les intervalles de confiance sur les scores indiquent la fiabilite statistique du classement. L'Arena a revele plusieurs insights : les modeles sycophants obtiennent des scores Arena eleves, la longueur des reponses correlait avec le vote humain, et les styles de formatage (markdown, listes) influencent les preferences. Des sous-categories ont ete ajoutees : Arena pour le code, les maths, les taches multimodales, les langues non-anglaises. Le classement est accessible sur lmarena.ai et est consulte quotidiennement par les equipes IA.

Formule de scoring ELO

  • E_A = 1 / (1 + 10^((ELO_B - ELO_A)/400)) = probabilite attendue de victoire de A
  • ELO_A_nouveau = ELO_A + K x (Score - E_A), K=32 pour Chatbot Arena
  • Score : 1 (victoire), 0.5 (tie), 0 (defaite)

Classement Chatbot Arena (approximatif 2026)

RangModeleELO approximatif
1GPT-4o / o3~1380
2Claude 3.5 Sonnet~1370
3Gemini 1.5 Pro~1350
4LLaMA 3.1 405B~1320

Limitations

  • Biais vers les reponses plus longues et mieux formatees
  • Population de votants non-representative (techies anglophones)
  • Sycophancy reward : modeles flatteurs peuvent surperformer

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis