Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

SWE-Bench

ia

Définition

SWE-Bench (Software Engineering Benchmark) est un benchmark pour evaluer la capacite des LLMs et agents IA a resoudre de vrais bugs dans des projets open-source Python populaires (Django, Flask, NumPy, Pandas, Scikit-learn). Developpe par Princeton NLP (Jimenez et al., 2023), il est considere comme le benchmark le plus realiste pour mesurer les capacites d'ingenierie logicielle. Chaque instance SWE-Bench correspond a un vrai issue GitHub resolu par un developpeur humain : le modele recoit la description du bug et l'etat du repository, et doit produire un patch (diff) qui fait passer les tests de verification. Contrairement a HumanEval, SWE-Bench requiert de comprendre une base de code reelle et d'ecrire un patch coherent avec l'architecture existante. SWE-Bench original (2294 instances) s'est avere tres difficile (GPT-4 atteignait ~1.7% sans agent). SWE-Bench Verified (2024, 500 instances verifiees manuellement) est le nouveau standard : les meilleurs agents atteignent 40-72%. Les architectures les plus performantes utilisent des agents multi-etapes : localisation du fichier fautif, comprehension du contexte, generation et application du patch, execution des tests. Des outils comme SWE-agent (Princeton), Moatless Tools et OpenHands fournissent ces pipelines optimises. Pour les equipes de developpement souhaitant automatiser la resolution de bugs, SWE-Bench Verified est la reference. Les scores actuels indiquent que les agents IA peuvent resoudre automatiquement 50-72% des bugs de complexite moyenne dans des projets Python bien testes.

Structure SWE-Bench

  • Repos couverts : Django, Flask, Matplotlib, NumPy, Pandas, Pillow, PyTest, Requests, Scikit-learn, SciPy
  • Format : issue GitHub text + repository snapshot → patch diff attendu
  • Evaluation : le patch est applique, les tests de verification sont executes dans un Docker isole

Scores SWE-Bench Verified (2025)

SystemeScore %Architecture
o3 (OpenAI)~72%Raisonnement etendu
Claude 3.7 Sonnet + agent~70%Extended thinking
SWE-agent + GPT-4o~48%Agent multi-etapes
GPT-4 naif (no agent)~1.7%Single call

Implications pour DevOps

Les agents IA peuvent resoudre automatiquement 50-70% des bugs dans des projets Python bien testes, ce qui permet : triage automatique de bugs en CI/CD, reduction du backlog GitHub, patches pour dependances obsoletes.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis