Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Chain-of-Thought Scaling

ia

Définition

Le Chain-of-Thought Scaling (mise a l'echelle du raisonnement) est le phenomene selon lequel les performances des LLMs sur des taches complexes s'ameliorent de maniere mesurable avec la longueur (et la qualite) de la chaine de pensee generee. Ce phenomene, formalise par des travaux de Google DeepMind et OpenAI (2024), constitue le fondement theorique des modeles de raisonnement etendu comme o1, DeepSeek-R1 et Claude Extended Thinking. Les evidence empiriques : Snell et al. (2024) ont montre que pour des problemes MATH et AIME, la performance de GPT-4o avec Best-of-N sampling scale en sqrt(N) avec le budget de compute d'inference, mais que des strategies plus sophistiquees (MCTS avec PRM, iterative critique) scale encore mieux. O1 a demontre que des chaines de pensee tres longues (10K-100K tokens) permettent des gains significatifs sur les taches de raisonnement difficile. Le scaling du CoT est different du scaling des parametres : augmenter la taille du modele (plus de parametres) ameliore les performances sur toutes les taches. Augmenter le budget de CoT n'ameliore que les taches necessitant un raisonnement profond (maths, code, logique), sans ameliorer les taches ou la premiere reponse est suffisante (classification simple, QA factuelle directe). La relation est approximativement logarithmique : doubler les tokens de CoT apporte un gain de quelques points percentages. Pour passer de 70% a 90% sur MATH, il faut passer de ~1K a ~10K tokens de CoT (x10 de compute). Pour passer de 90% a 95%, il faut encore x10. Cette asymptote progressive explique les couts eleves des modeles de raisonnement avance. Les implications pour le design des systemes IA en production : le CoT Scaling suggere qu'il est plus efficient d'utiliser un modele plus petit avec plus de CoT pour les problemes difficiles, plutot qu'un grand modele avec peu de CoT. Un pipeline optimal 'route' les requetes simples vers des modeles rapides sans CoT, et les requetes complexes vers des modeles avec CoT etendu.

Strategies de CoT Scaling

StrategieComputeGain typique
Greedy (n=1)1xbaseline
Best-of-N (n=8)8x+5-10%
Best-of-N (n=64)64x+10-20%
MCTS avec PRM100x+20-30%
o1-style (CoT long)50-500x+30-50%

Quand utiliser le CoT Scaling

  • Problemes de mathematiques et logique avec solution verifiable
  • Code avec tests unitaires automatises
  • Raisonnement multi-etapes ou chaque etape peut etre critique
  • Ne pas utiliser pour : questions factuelles directes, generation creative, summarization

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis