Test-Time Compute
iaDéfinition
Le Test-Time Compute (compute au temps d'inference) est l'approche consistant a ameliorer les performances d'un LLM en utilisant davantage de ressources computationnelles lors de la generation d'une reponse, plutot qu'exclusivement pendant l'entrainement. Popularisee par OpenAI o1 (septembre 2024), c'est une nouvelle dimension du scaling complementaire au scaling classique. L'idee : pour des problemes difficiles (mathematiques, code, raisonnement logique), un modele peut beneficier de 'reflechir plus longtemps' avant de donner sa reponse finale. Cela se traduit par la generation de longues chaines de raisonnement interne (scratchpad), parfois de milliers de tokens, avant de produire la reponse visible. Les techniques de Test-Time Compute incluent : Best-of-N (generer N solutions et choisir la meilleure selon un PRM), Beam Search (exploration d'un arbre de solutions), Monte Carlo Tree Search (MCTS), et l'Extended Thinking (tokens de raisonnement caches, dans Claude 3.7 Sonnet et GPT-o1/o3). DeepSeek-R1 (2025) a demontre que le Test-Time Compute peut etre appris via Reinforcement Learning (RLVR) sans supervision humaine : en recompensant simplement les reponses correctes verifiables (maths, code), le modele apprend a generer des chaines de raisonnement longues incluant backtracking et auto-correction. Pour les equipes qui deploient des LLMs, le Test-Time Compute a des implications sur le cout : les modeles o1/o3 consomment 5-100x plus de tokens que les modeles standard pour les problemes difficiles. Il faut arbitrer entre la qualite requise et le budget compute.
Paradigmes de Test-Time Compute
- Best-of-N : generer N reponses independantes, choisir via PRM/ORM ou vote
- Sequential revision : generer, evaluer, reviser iterativement
- Tree search (MCTS/Beam) : explorer un arbre de raisonnement
- Extended Thinking : tokens de reflexion interne caches (o1, Claude 3.7)
RLVR — Entrainement DeepSeek-R1
# RLVR : recompense binaire {0, 1} basee sur la correction verifiable
# Pour les maths : verifier si la reponse finale == solution ground truth
# Pour le code : executer les tests unitaires et verifier les passes
reward = 1 if verify_answer(model_output, ground_truth) else 0
# Le modele apprend a generer des raisonnements menant a des reponses correctes
# Sans jamais avoir ete entraine sur des traces humaines de raisonnementCourbe performance vs compute
Snell et al. (2024) montrent que : pour les problemes faciles, Best-of-N peu profond est optimal. Pour les problemes difficiles, les methodes tree-based surpassent Best-of-N au-dela de ~50 candidats.
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h