Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

LM-Eval-Harness

ia

Définition

LM-Eval-Harness (ou lm-evaluation-harness) est un framework d'evaluation des LLMs open-source developpe par Eleuther AI. Il standardise l'evaluation sur 200+ benchmarks NLP (ARC, HellaSwag, MMLU, TruthfulQA, GSM8K, HumanEval, etc.) en garantissant des conditions reproductibles : memes prompts, memes tokenisations, meme decoding pour tous les modeles. C'est la reference de facto pour l'evaluation comparative dans la communaute open-source. La valeur de LM-Eval-Harness est la reproductibilite : les scores publiés dans les papers et sur HuggingFace Open LLM Leaderboard sont obtenus avec ce framework, permettant des comparaisons fiables entre modeles. Sans standardisation, de petites differences dans la tokenisation du prompt ou le format de scoring peuvent changer les scores de plusieurs points. Le framework supporte plusieurs modes d'evaluation : few-shot (N exemples dans le prompt), zero-shot, et chain-of-thought. Il calcule le score de plusieurs manieres selon le benchmark : accuracy sur les choix multiples (logprobs des options), exact match pour les reponses courtes, pass@k pour le code, et des metriques specifiques comme BLEU/ROUGE pour la traduction. LM-Eval-Harness supporte les backends d'inference les plus courants : HuggingFace Transformers (local), vLLM (production), OpenAI API, Anthropic API, et tout backend compatible OpenAI. Cela permet d'evaluer aussi bien des modeles open-source locaux que des modeles proprietaires sous API. En pratique, LM-Eval-Harness est l'outil standard pour : comparer vos modeles fine-tunes aux baselines, reproduire les evaluations de papers, preparer une soumission au Open LLM Leaderboard, et monitorer la regression des performances lors de l'itération sur les donnees d'entrainement.

Evaluation avec LM-Eval-Harness

# Installation
pip install lm-eval

# Evaluer Llama 3.1 8B sur ARC, HellaSwag, MMLU
lm-eval --model hf \
  --model_args pretrained=meta-llama/Meta-Llama-3.1-8B-Instruct \
  --tasks arc_challenge,hellaswag,mmlu \
  --num_fewshot 25 \
  --device cuda:0 \
  --output_path ./eval_results/ \
  --batch_size auto

# Evaluer via API OpenAI
lm-eval --model openai-chat-completions \
  --model_args model=gpt-4o-mini \
  --tasks gpqa_diamond --num_fewshot 0

Benchmarks disponibles (selection)

  • arc_challenge, arc_easy, hellaswag, winogrande
  • mmlu (57 sous-categories), mmlu_pro, gpqa, gpqa_diamond
  • truthfulqa_mc1, truthfulqa_mc2
  • gsm8k, math (MATH dataset), aime_2024
  • humaneval, mbpp, swe_bench_lite
  • longbench, ruler, needle_in_haystack

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis