Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Scaling Laws

ia

Définition

Les Scaling Laws (lois d'echelle) sont des relations empiriques qui decrivent comment la performance des LLMs evolue en fonction de trois variables : la taille du modele (nombre de parametres N), le volume de donnees (tokens D), et le compute total (FLOPs C). Decouvertes par Kaplan et al. (OpenAI, 2020), elles ont profondement influence la strategie de developpement de tous les grands labs IA. La decouverte fondamentale est que la perte (cross-entropy) des LLMs suit des lois de puissance par rapport a N, D et C. Cette regularite remarquable suggere que l'entrainement des LLMs est hautement previsible et que l'on peut anticiper la performance d'un modele a grande echelle depuis des runs a petite echelle. Les scaling laws Chinchilla (Hoffmann et al., DeepMind, 2022) ont revise les recommandations de Kaplan : il est optimal d'entrainer un modele N fois plus petit sur N fois plus de tokens. Chinchilla 70B, entraine sur 1.4T tokens, surpasse GPT-3 175B entraine sur 300B tokens. Les LLMs modernes (LLaMA 3, Mistral, Qwen2.5) depassent le 'Chinchilla optimal' car l'inference beneficie de modeles plus petits tres bien entraines. Un modele 7B sur-entraine est moins cher a servir qu'un 70B Chinchilla-optimal avec performances equivalentes. L'Inference Scaling (scaling au temps d'inference) est la nouvelle frontiere : plutot que d'agrandir les modeles, on augmente le compute d'inference via le raisonnement etendu (o1, DeepSeek-R1), le Best-of-N sampling et les arbres de recherche.

Formule Chinchilla

  • Ratio optimal : D/N ~ 20 tokens par parametre
  • Exemple : pour 7B params, Chinchilla recommande ~140B tokens d'entrainement
  • LLaMA 3 8B : 15T tokens (sur-entraine, mais optimise pour l'inference)

Prediction de la performance

# Estimation de la loss via scaling law (Hoffmann et al.)
def predict_loss(N_params, D_tokens):
    A, B, E = 406.4, 410.7, 1.69
    alpha, beta = 0.34, 0.28
    return E + A / N_params**alpha + B / D_tokens**beta

# LLaMA 3 70B sur 15T tokens
print(predict_loss(7e10, 15e12))  # ~1.85 nats

Inference Scaling vs Training Scaling

DimensionTraining ScalingInference Scaling
MethodePlus de params / tokensPlus de tokens de raisonnement
ExemplesGPT-3 → GPT-4o1, DeepSeek-R1, R1-Zero
Cout recurrentAmortissablePar requete

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis