Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

MTEB (Massive Text Embedding Benchmark)

ia

Définition

MTEB (Massive Text Embedding Benchmark, Muennighoff et al., HuggingFace 2022) est le benchmark de reference pour evaluer la qualite des modeles d'embedding de texte sur un large eventail de taches. Il couvre 56 taches en 8 categories et 112 langues, permettant de comparer objectivement les modeles d'embedding pour les differents cas d'usage RAG, recherche semantique, et classification. Les 8 categories de taches MTEB : (1) Retrieval — trouver les documents pertinents pour une requete (BEIR, MIRACL), (2) Semantic Textual Similarity (STS) — mesurer la similarite entre paires de phrases, (3) Classification — encoder les textes pour la classification downstream, (4) Clustering — regrouper des textes similaires, (5) Pair Classification — identifier si deux textes sont duplicates ou contradictoires, (6) Reranking — reranger des resultats de recherche, (7) Summarization — evaluer la qualite d'un resume via la distance aux references, (8) Bitext Mining — aligner des textes paralleles multilingues. Le MTEB Leaderboard sur HuggingFace est la reference pour choisir un modele d'embedding : les modeles sont classés par leur score moyen sur toutes les taches (MTEB Score). Les leaders en 2024 incluent text-embedding-3-large (OpenAI), voyage-3 (Voyage AI), et des modeles open-source comme E5-Mistral-7B, GTE-Qwen2, et BGE-M3. L'importance de MTEB pour le choix d'embedding dans les pipelines RAG : le score de retrieval (sous-ensemble du MTEB) est le plus pertinent pour le RAG. Un modele avec un excellent score de classification mais mediocre en retrieval sera un mauvais choix pour un pipeline RAG. Les modeles BGE (BAAI) et E5 (Microsoft) sont generalement recommandes pour le RAG francophone. MTEB Multilingual : le sous-ensemble multilingue de MTEB teste les embeddings sur des paires de langues croisees (cross-lingual retrieval). Pour les applications francaises, il est important de verifier la performance sur le sous-ensemble francophone de MTEB, car certains modeles excellents en anglais degradent significativement sur le francais.

Evaluer un modele d'embedding sur MTEB

# pip install mteb sentence-transformers
from mteb import MTEB
from sentence_transformers import SentenceTransformer

model = SentenceTransformer('BAAI/bge-m3')  # Excellent bilingue

# Evaluer sur un sous-ensemble MTEB pertinent
evaluation = MTEB(tasks=['NFCorpus', 'FiQA2018', 'TRECCOVID'])  # Taches retrieval
results = evaluation.run(model, output_folder='mteb_results/')

# Scores indicatifs MTEB (nDCG@10 sur retrieval)
# text-embedding-3-large (OpenAI): 59.0
# BGE-M3 (BAAI, open-source): 54.9
# E5-Mistral-7B (Microsoft): 56.9
# text-embedding-ada-002 (OpenAI): 49.3 (ancien modele)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis