Chain-of-Thought Scaling
iaDéfinition
Le Chain-of-Thought Scaling (mise a l'echelle du raisonnement) est le phenomene selon lequel les performances des LLMs sur des taches complexes s'ameliorent de maniere mesurable avec la longueur (et la qualite) de la chaine de pensee generee. Ce phenomene, formalise par des travaux de Google DeepMind et OpenAI (2024), constitue le fondement theorique des modeles de raisonnement etendu comme o1, DeepSeek-R1 et Claude Extended Thinking. Les evidence empiriques : Snell et al. (2024) ont montre que pour des problemes MATH et AIME, la performance de GPT-4o avec Best-of-N sampling scale en sqrt(N) avec le budget de compute d'inference, mais que des strategies plus sophistiquees (MCTS avec PRM, iterative critique) scale encore mieux. O1 a demontre que des chaines de pensee tres longues (10K-100K tokens) permettent des gains significatifs sur les taches de raisonnement difficile. Le scaling du CoT est different du scaling des parametres : augmenter la taille du modele (plus de parametres) ameliore les performances sur toutes les taches. Augmenter le budget de CoT n'ameliore que les taches necessitant un raisonnement profond (maths, code, logique), sans ameliorer les taches ou la premiere reponse est suffisante (classification simple, QA factuelle directe). La relation est approximativement logarithmique : doubler les tokens de CoT apporte un gain de quelques points percentages. Pour passer de 70% a 90% sur MATH, il faut passer de ~1K a ~10K tokens de CoT (x10 de compute). Pour passer de 90% a 95%, il faut encore x10. Cette asymptote progressive explique les couts eleves des modeles de raisonnement avance. Les implications pour le design des systemes IA en production : le CoT Scaling suggere qu'il est plus efficient d'utiliser un modele plus petit avec plus de CoT pour les problemes difficiles, plutot qu'un grand modele avec peu de CoT. Un pipeline optimal 'route' les requetes simples vers des modeles rapides sans CoT, et les requetes complexes vers des modeles avec CoT etendu.
Strategies de CoT Scaling
| Strategie | Compute | Gain typique |
|---|---|---|
| Greedy (n=1) | 1x | baseline |
| Best-of-N (n=8) | 8x | +5-10% |
| Best-of-N (n=64) | 64x | +10-20% |
| MCTS avec PRM | 100x | +20-30% |
| o1-style (CoT long) | 50-500x | +30-50% |
Quand utiliser le CoT Scaling
- Problemes de mathematiques et logique avec solution verifiable
- Code avec tests unitaires automatises
- Raisonnement multi-etapes ou chaque etape peut etre critique
- Ne pas utiliser pour : questions factuelles directes, generation creative, summarization
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h