GSM8K
iaDéfinition
GSM8K (Grade School Math 8K) est un dataset de 8 500 problemes de mathematiques de niveau lycee, developpe par Cobbe et al. (OpenAI, 2021). C'est l'un des benchmarks les plus influents pour mesurer les capacites de raisonnement mathematique multi-etapes des LLMs. Les problemes GSM8K sont des problemes textuels necessitant 2 a 8 etapes de calcul. Exemple : 'Jack a 5 pommes. Il en donne 2 a sa soeur et en achete 3 de plus. Combien a-t-il de pommes en tout ?' La solution exige des operations arithmetiques sequentielles et le suivi de l'etat entre les etapes. GSM8K a joue un role fondamental dans le developpement du Chain-of-Thought (CoT) prompting : Wei et al. (2022) ont montre que demander au modele de reflechir etape par etape ameliorait spectaculairement les scores (GPT-3 passait de 17% a 57% avec CoT). Cette decouverte a lance une vague de recherche sur le raisonnement explicite. Les scores GSM8K ont progresse rapidement : GPT-3.5 ~57%, GPT-4 ~92%, LLaMA 3 70B ~93%, puis les modeles de raisonnement comme o1 et DeepSeek-R1 atteignent 99%+. Cette saturation a conduit vers des benchmarks plus difficiles : MATH (niveau concours), AIME, Omni-MATH. Pour les praticiens, GSM8K est utile pour evaluer les capacites de base en raisonnement d'un modele fine-tune. Si un modele perd des points sur GSM8K apres fine-tuning, cela indique un catastrophic forgetting du raisonnement general.
Chain-of-Thought avec GSM8K
# Prompt 5-shot CoT pour GSM8K
# Fournir 4-8 exemples resolus etape par etape avant la question cible
# Exemple de solution:
# Etape 1: Cout des cahiers = 3 x 2 = 6 EUR
# Etape 2: Cout des stylos = 2 x 1.50 = 3 EUR
# Etape 3: Depense totale = 6 + 3 = 9 EUR
# Etape 4: Argent restant = 15 - 9 = 6 EUR
# Reponse: 6 EURBenchmark Mathematiques : progression de difficulte
| Benchmark | Niveau | GPT-4o score |
|---|---|---|
| GSM8K | Lycee basique | ~96% |
| MATH | Concours lycee | ~76% |
| AIME | AMC competition | ~60% |
| Olympiad Math | IMO niveau | ~20% |
Utilisation pour le fine-tuning
GSM8K est souvent inclus comme benchmark de regression dans les pipelines de fine-tuning. Si le score baisse apres fine-tuning sur un domaine specifique, cela revele un catastrophic forgetting. La solution : inclure des exemples GSM8K dans le mix de fine-tuning (data mixing).
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h