Chinchilla Scaling
iaDéfinition
Les Chinchilla Scaling Laws sont des lois d'echelle publiees par Hoffmann et al. (DeepMind, 2022) dans le paper 'Training Compute-Optimal Large Language Models'. En analysant systematiquement la perte d'entrainement de modeles de 70M a 16B parametres entraines sur 5B a 500B tokens, ils ont decouverts que pour un budget de calcul fixe, il est optimal d'entrainer un modele proportionnellement plus petit sur proportionnellement plus de donnees — avec un rapport optimal d'environ 20 tokens par parametre. La decouverte centrale : GPT-3 (175B params, 300B tokens) etait sous-entraine selon ces lois. Le modele 'compute-optimal' pour un budget compute equivalent serait de 70B params entraines sur 1.4T tokens. DeepMind a valide cela en entrainant Chinchilla (70B params, 1.4T tokens) qui surpassait Gopher (280B params, 300B tokens) sur pratiquement tous les benchmarks, malgre etre 4x plus petit. L'impact pratique des Chinchilla Laws a ete considerable : (1) Llama 1 (Meta, 2023) a deliberement entraine des modeles plus petits sur plus de tokens que les lois de Kaplan (2020) ne le suggeraient, obtenant des modeles tres performants a 7B, 13B, 65B params. (2) Mistral 7B (2023) entraine sur 8T tokens a demontre qu'on pouvait depasser Llama 2 13B avec un modele 2x plus petit mais mieux entraine. Les limites des Chinchilla Laws : elles optimisent pour le compute d'entrainement, pas pour le cout d'inference. Un modele 7B est beaucoup moins cher a deployer qu'un 70B, meme si les deux ont le meme cout de pre-training a qualite egale. En pratique, il est souvent plus economique d'entrainer un modele plus petit que Chinchilla-optimal sur encore plus de donnees pour obtenir un modele moins cher a l'inference. Des refinements subsequents ont identifie d'autres dimensions : le 'inference-optimal' frontiere (ou entrainer pour minimiser le cout total de deployment), l'impact de la qualite des donnees (des donnees de meilleure qualite permettent d'atteindre la meme performance avec moins de tokens), et les effets de la duplication des donnees (repetition des donnees lors de l'entrainement).
Formule Chinchilla
Pour un budget compute C (FLOPs), les valeurs optimales sont :
- N* (parametres) = 0.07 * C^0.5 (nombre de parametres)
- D* (tokens) = 1.7 * C^0.5 (nombre de tokens de donnees)
- Ratio D*/N* = 20 tokens par parametre
Evolution des pratiques d'entrainement
| Modele | Params | Tokens | Ratio T/P |
|---|---|---|---|
| GPT-3 (2020) | 175B | 300B | 1.7x |
| Gopher (2021) | 280B | 300B | 1.1x |
| Chinchilla (2022) | 70B | 1.4T | 20x |
| Llama 2 (2023) | 7B-70B | 2T | 28-286x |
| LLaMA 3 (2024) | 8B-70B | 15T | 214-1875x |
| Qwen 2.5 3B (2024) | 3B | 18T | 6000x |
La tendance post-Chinchilla : entrainer de plus en plus de tokens par parametre, bien au-dela du ratio optimal de 20, pour obtenir de petits modeles tres competents a l'inference.
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h