Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Inference Scaling

ia

Définition

L'Inference Scaling (aussi appele Test-Time Compute Scaling) est le paradigme emergent consistant a ameliorer les performances des LLMs en augmentant les ressources de calcul allouees lors de l'inference, plutot qu'uniquement lors de l'entrainement. La decouverte cle de Snell et al. (Google DeepMind, 2024) est que, pour les problemes difficiles, il peut etre plus efficace d'allouer plus de compute a l'inference (sampling multiple, recherche arborescente, critique iterative) que d'entrainer un plus grand modele. Les strategies d'inference scaling : (1) Best-of-N sampling — generer N solutions et selectionner la meilleure selon un verifieur (Process Reward Model ou verifieur de solution), (2) MCTS (Monte Carlo Tree Search) — explorer l'arbre de raisonnement en evaluant les branches avec un PRM, (3) Beam search sequentiel — maintenir les K meilleures solutions partielles a chaque etape, (4) Self-refinement — le modele genere une solution, la critique, puis la raffine iterativement. OpenAI o1 est la premiere demonstration commerciale d'echelle de l'inference scaling : en allouant plus de 'thinking tokens' (Chain-of-Thought etendue apprise par RLVR), o1 ameliore ses performances sur les problemes de mathematiques et de code de maniere quasi-lineaire avec le budget de calcul d'inference. Plus de tokens de reflexion = meilleure reponse, jusqu'a un plateau. L'inference scaling souleve des questions importantes : le cout d'inference varie dynamiquement selon la difficulte de la requete, rendant la budgetisation API impredictible. Des techniques de compute-optimal routing — envoyer les requetes simples au modele rapide et les complexes au modele avec inference scaling — sont developpees pour optimiser le cout. La combinaison optimal-training + optimal-inference est la frontiere actuelle : des modeles entraines avec RLVR sur des taches verifiables (comme DeepSeek-R1 ou QwQ-32B) et deployes avec des strategies d'inference scaling actives constituent l'etat de l'art sur les benchmarks de raisonnement difficiles (AIME, GPQA Diamond, Codeforces).

Best-of-N avec Process Reward Model

def best_of_n_inference(question, model, prm, n=8, temperature=0.7):
    # Generer N solutions independantes
    solutions = []
    for _ in range(n):
        sol = model.generate(question, temperature=temperature, max_new_tokens=1024)
        solutions.append(sol)

    # Score avec PRM (Process Reward Model)
    scores = [prm.score(question, sol) for sol in solutions]

    # Selectionner la meilleure
    best_idx = max(range(n), key=lambda i: scores[i])
    return solutions[best_idx], scores[best_idx]

Scaling law pour inference

Pour les problemes AIME (maths olympiade) :

  • n=1 (greedy) : Claude 3.5 Sonnet ~30%
  • n=8 best-of-N : ~52%
  • n=64 best-of-N : ~67%
  • o1 (inference scaling integre) : ~83%

La performance s'ameliore en log(N) avec le nombre de samples — chaque doublement de compute d'inference apporte un gain constant.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis