Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Benchmark d'agents SWE-bench

ia

Définition

SWE-bench est un benchmark qui evalue la capacite d'un agent IA a resoudre des problemes logiciels reels extraits de depots GitHub open source. Chaque tache correspond a une issue reelle documentee, accompagnee du commit de correction effectivement merge par les mainteneurs du projet, qui sert de reference de validation. L'agent recoit la description du probleme et l'acces au code source du depot ; il doit produire un patch qui, une fois applique, fait passer la suite de tests associee a l'issue. Contrairement aux benchmarks de generation de fonctions isolees comme HumanEval, SWE-bench teste des capacites d'agent complet : navigation dans une base de code volumineuse et inconnue, comprehension de dependances entre fichiers, localisation du bug, et generation d'un patch coherent avec les conventions du projet. La variante SWE-bench Verified, filtree et validee manuellement, corrige des problemes de qualite identifies dans la version originale (taches mal specifiees ou non reproductibles). Les scores restent significativement inferieurs a 100 pour les meilleurs agents publies, ce qui traduit la difficulte reelle de l'ingenierie logicielle autonome par rapport aux taches de generation de code isolees. Pour un DSI, SWE-bench constitue une reference credible pour comparer des agents de codage destines a une integration en environnement de developpement reel.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis