LM-Eval-Harness
iaDéfinition
LM-Eval-Harness (ou lm-evaluation-harness) est un framework d'evaluation des LLMs open-source developpe par Eleuther AI. Il standardise l'evaluation sur 200+ benchmarks NLP (ARC, HellaSwag, MMLU, TruthfulQA, GSM8K, HumanEval, etc.) en garantissant des conditions reproductibles : memes prompts, memes tokenisations, meme decoding pour tous les modeles. C'est la reference de facto pour l'evaluation comparative dans la communaute open-source. La valeur de LM-Eval-Harness est la reproductibilite : les scores publiés dans les papers et sur HuggingFace Open LLM Leaderboard sont obtenus avec ce framework, permettant des comparaisons fiables entre modeles. Sans standardisation, de petites differences dans la tokenisation du prompt ou le format de scoring peuvent changer les scores de plusieurs points. Le framework supporte plusieurs modes d'evaluation : few-shot (N exemples dans le prompt), zero-shot, et chain-of-thought. Il calcule le score de plusieurs manieres selon le benchmark : accuracy sur les choix multiples (logprobs des options), exact match pour les reponses courtes, pass@k pour le code, et des metriques specifiques comme BLEU/ROUGE pour la traduction. LM-Eval-Harness supporte les backends d'inference les plus courants : HuggingFace Transformers (local), vLLM (production), OpenAI API, Anthropic API, et tout backend compatible OpenAI. Cela permet d'evaluer aussi bien des modeles open-source locaux que des modeles proprietaires sous API. En pratique, LM-Eval-Harness est l'outil standard pour : comparer vos modeles fine-tunes aux baselines, reproduire les evaluations de papers, preparer une soumission au Open LLM Leaderboard, et monitorer la regression des performances lors de l'itération sur les donnees d'entrainement.
Evaluation avec LM-Eval-Harness
# Installation
pip install lm-eval
# Evaluer Llama 3.1 8B sur ARC, HellaSwag, MMLU
lm-eval --model hf \
--model_args pretrained=meta-llama/Meta-Llama-3.1-8B-Instruct \
--tasks arc_challenge,hellaswag,mmlu \
--num_fewshot 25 \
--device cuda:0 \
--output_path ./eval_results/ \
--batch_size auto
# Evaluer via API OpenAI
lm-eval --model openai-chat-completions \
--model_args model=gpt-4o-mini \
--tasks gpqa_diamond --num_fewshot 0Benchmarks disponibles (selection)
- arc_challenge, arc_easy, hellaswag, winogrande
- mmlu (57 sous-categories), mmlu_pro, gpqa, gpqa_diamond
- truthfulqa_mc1, truthfulqa_mc2
- gsm8k, math (MATH dataset), aime_2024
- humaneval, mbpp, swe_bench_lite
- longbench, ruler, needle_in_haystack
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés. 2.1.7
Un projet cybersécurité ?
Expert dispo · Réponse 24h