MATH (Benchmark)
iaDéfinition
MATH est un benchmark de mathematiques avancees publie par Hendrycks et al. (2021) comprenant 12500 problemes de niveau lycee a olympiade issus de competitions de maths (AMC, AIME, etc.). Il couvre 7 categories : algebra, intermediate algebra, counting & probability, geometry, number theory, precalculus et prealgebra, avec 5 niveaux de difficulte. MATH a ete conçu pour tester les capacites de raisonnement mathematique avance des LLMs, un domaine ou les modeles de l'epoque (2021) echouaient massivment. GPT-3 obtenait ~5% en 2021, ce qui semblait plafond ; aujourd'hui GPT-4o obtient ~76%, o1 ~94%, et o3 ~96%. Cette progression illustre l'impact du Chain-of-Thought et du Test-Time Compute. La difference entre MATH et GSM8K : GSM8K (grade school math) contient des problemes arithmetiques scolaires que les LLMs modernes resolvent a >95%. MATH contient des problemes de niveau competition qui necessitent un raisonnement profond en algebre, trigonometrie, combinatoire et theorie des nombres. MATH reste discriminant pour les meilleurs modeles. MATH est aussi utilise pour evaluer les Process Reward Models : PRM800K (OpenAI) est un dataset de 800K etapes de solutions MATH annotees avec des labels correct/incorrect, permettant d'entrainer des PRMs qui evaluent la qualite du raisonnement mathematique etape par etape. Pour les entreprises ayant des cas d'usage de calcul ou d'analyse quantitative (finance, ingenierie, sciences), le score MATH est un indicateur pertinent de la fiabilite du LLM pour le raisonnement numerique et algebrique complexe.
Exemples par niveau MATH
- Niveau 1 (facile) : 'Simplifie (x^2 + 2x) / x pour x != 0' -> x + 2
- Niveau 3 (moyen) : 'Combien de nombres entiers entre 1 et 100 sont divisibles par 3 ou par 7 ?'
- Niveau 5 (difficile) : 'Prouve que pour tout entier n > 0, n^3 - n est divisible par 6'
Progression historique sur MATH
| Modele | Score % | Annee |
|---|---|---|
| GPT-3 | 5.2% | 2021 |
| GPT-4 (CoT) | 42.5% | 2023 |
| GPT-4o | 76.6% | 2024 |
| DeepSeek-R1 | 92.3% | 2025 |
| o3 | ~96% | 2025 |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h