Scaling Laws
iaDéfinition
Les Scaling Laws (lois d'echelle) sont des relations empiriques qui decrivent comment la performance des LLMs evolue en fonction de trois variables : la taille du modele (nombre de parametres N), le volume de donnees (tokens D), et le compute total (FLOPs C). Decouvertes par Kaplan et al. (OpenAI, 2020), elles ont profondement influence la strategie de developpement de tous les grands labs IA. La decouverte fondamentale est que la perte (cross-entropy) des LLMs suit des lois de puissance par rapport a N, D et C. Cette regularite remarquable suggere que l'entrainement des LLMs est hautement previsible et que l'on peut anticiper la performance d'un modele a grande echelle depuis des runs a petite echelle. Les scaling laws Chinchilla (Hoffmann et al., DeepMind, 2022) ont revise les recommandations de Kaplan : il est optimal d'entrainer un modele N fois plus petit sur N fois plus de tokens. Chinchilla 70B, entraine sur 1.4T tokens, surpasse GPT-3 175B entraine sur 300B tokens. Les LLMs modernes (LLaMA 3, Mistral, Qwen2.5) depassent le 'Chinchilla optimal' car l'inference beneficie de modeles plus petits tres bien entraines. Un modele 7B sur-entraine est moins cher a servir qu'un 70B Chinchilla-optimal avec performances equivalentes. L'Inference Scaling (scaling au temps d'inference) est la nouvelle frontiere : plutot que d'agrandir les modeles, on augmente le compute d'inference via le raisonnement etendu (o1, DeepSeek-R1), le Best-of-N sampling et les arbres de recherche.
Formule Chinchilla
- Ratio optimal : D/N ~ 20 tokens par parametre
- Exemple : pour 7B params, Chinchilla recommande ~140B tokens d'entrainement
- LLaMA 3 8B : 15T tokens (sur-entraine, mais optimise pour l'inference)
Prediction de la performance
# Estimation de la loss via scaling law (Hoffmann et al.)
def predict_loss(N_params, D_tokens):
A, B, E = 406.4, 410.7, 1.69
alpha, beta = 0.34, 0.28
return E + A / N_params**alpha + B / D_tokens**beta
# LLaMA 3 70B sur 15T tokens
print(predict_loss(7e10, 15e12)) # ~1.85 natsInference Scaling vs Training Scaling
| Dimension | Training Scaling | Inference Scaling |
|---|---|---|
| Methode | Plus de params / tokens | Plus de tokens de raisonnement |
| Exemples | GPT-3 → GPT-4 | o1, DeepSeek-R1, R1-Zero |
| Cout recurrent | Amortissable | Par requete |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h