Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Test-Time Compute

ia

Définition

Le Test-Time Compute (compute au temps d'inference) est l'approche consistant a ameliorer les performances d'un LLM en utilisant davantage de ressources computationnelles lors de la generation d'une reponse, plutot qu'exclusivement pendant l'entrainement. Popularisee par OpenAI o1 (septembre 2024), c'est une nouvelle dimension du scaling complementaire au scaling classique. L'idee : pour des problemes difficiles (mathematiques, code, raisonnement logique), un modele peut beneficier de 'reflechir plus longtemps' avant de donner sa reponse finale. Cela se traduit par la generation de longues chaines de raisonnement interne (scratchpad), parfois de milliers de tokens, avant de produire la reponse visible. Les techniques de Test-Time Compute incluent : Best-of-N (generer N solutions et choisir la meilleure selon un PRM), Beam Search (exploration d'un arbre de solutions), Monte Carlo Tree Search (MCTS), et l'Extended Thinking (tokens de raisonnement caches, dans Claude 3.7 Sonnet et GPT-o1/o3). DeepSeek-R1 (2025) a demontre que le Test-Time Compute peut etre appris via Reinforcement Learning (RLVR) sans supervision humaine : en recompensant simplement les reponses correctes verifiables (maths, code), le modele apprend a generer des chaines de raisonnement longues incluant backtracking et auto-correction. Pour les equipes qui deploient des LLMs, le Test-Time Compute a des implications sur le cout : les modeles o1/o3 consomment 5-100x plus de tokens que les modeles standard pour les problemes difficiles. Il faut arbitrer entre la qualite requise et le budget compute.

Paradigmes de Test-Time Compute

  • Best-of-N : generer N reponses independantes, choisir via PRM/ORM ou vote
  • Sequential revision : generer, evaluer, reviser iterativement
  • Tree search (MCTS/Beam) : explorer un arbre de raisonnement
  • Extended Thinking : tokens de reflexion interne caches (o1, Claude 3.7)

RLVR — Entrainement DeepSeek-R1

# RLVR : recompense binaire {0, 1} basee sur la correction verifiable
# Pour les maths : verifier si la reponse finale == solution ground truth
# Pour le code : executer les tests unitaires et verifier les passes

reward = 1 if verify_answer(model_output, ground_truth) else 0
# Le modele apprend a generer des raisonnements menant a des reponses correctes
# Sans jamais avoir ete entraine sur des traces humaines de raisonnement

Courbe performance vs compute

Snell et al. (2024) montrent que : pour les problemes faciles, Best-of-N peu profond est optimal. Pour les problemes difficiles, les methodes tree-based surpassent Best-of-N au-dela de ~50 candidats.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis