MTEB (Massive Text Embedding Benchmark)
iaDéfinition
MTEB (Massive Text Embedding Benchmark, Muennighoff et al., HuggingFace 2022) est le benchmark de reference pour evaluer la qualite des modeles d'embedding de texte sur un large eventail de taches. Il couvre 56 taches en 8 categories et 112 langues, permettant de comparer objectivement les modeles d'embedding pour les differents cas d'usage RAG, recherche semantique, et classification. Les 8 categories de taches MTEB : (1) Retrieval — trouver les documents pertinents pour une requete (BEIR, MIRACL), (2) Semantic Textual Similarity (STS) — mesurer la similarite entre paires de phrases, (3) Classification — encoder les textes pour la classification downstream, (4) Clustering — regrouper des textes similaires, (5) Pair Classification — identifier si deux textes sont duplicates ou contradictoires, (6) Reranking — reranger des resultats de recherche, (7) Summarization — evaluer la qualite d'un resume via la distance aux references, (8) Bitext Mining — aligner des textes paralleles multilingues. Le MTEB Leaderboard sur HuggingFace est la reference pour choisir un modele d'embedding : les modeles sont classés par leur score moyen sur toutes les taches (MTEB Score). Les leaders en 2024 incluent text-embedding-3-large (OpenAI), voyage-3 (Voyage AI), et des modeles open-source comme E5-Mistral-7B, GTE-Qwen2, et BGE-M3. L'importance de MTEB pour le choix d'embedding dans les pipelines RAG : le score de retrieval (sous-ensemble du MTEB) est le plus pertinent pour le RAG. Un modele avec un excellent score de classification mais mediocre en retrieval sera un mauvais choix pour un pipeline RAG. Les modeles BGE (BAAI) et E5 (Microsoft) sont generalement recommandes pour le RAG francophone. MTEB Multilingual : le sous-ensemble multilingue de MTEB teste les embeddings sur des paires de langues croisees (cross-lingual retrieval). Pour les applications francaises, il est important de verifier la performance sur le sous-ensemble francophone de MTEB, car certains modeles excellents en anglais degradent significativement sur le francais.
Evaluer un modele d'embedding sur MTEB
# pip install mteb sentence-transformers
from mteb import MTEB
from sentence_transformers import SentenceTransformer
model = SentenceTransformer('BAAI/bge-m3') # Excellent bilingue
# Evaluer sur un sous-ensemble MTEB pertinent
evaluation = MTEB(tasks=['NFCorpus', 'FiQA2018', 'TRECCOVID']) # Taches retrieval
results = evaluation.run(model, output_folder='mteb_results/')
# Scores indicatifs MTEB (nDCG@10 sur retrieval)
# text-embedding-3-large (OpenAI): 59.0
# BGE-M3 (BAAI, open-source): 54.9
# E5-Mistral-7B (Microsoft): 56.9
# text-embedding-ada-002 (OpenAI): 49.3 (ancien modele)
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h