Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Chinchilla Scaling

ia

Définition

Les Chinchilla Scaling Laws sont des lois d'echelle publiees par Hoffmann et al. (DeepMind, 2022) dans le paper 'Training Compute-Optimal Large Language Models'. En analysant systematiquement la perte d'entrainement de modeles de 70M a 16B parametres entraines sur 5B a 500B tokens, ils ont decouverts que pour un budget de calcul fixe, il est optimal d'entrainer un modele proportionnellement plus petit sur proportionnellement plus de donnees — avec un rapport optimal d'environ 20 tokens par parametre. La decouverte centrale : GPT-3 (175B params, 300B tokens) etait sous-entraine selon ces lois. Le modele 'compute-optimal' pour un budget compute equivalent serait de 70B params entraines sur 1.4T tokens. DeepMind a valide cela en entrainant Chinchilla (70B params, 1.4T tokens) qui surpassait Gopher (280B params, 300B tokens) sur pratiquement tous les benchmarks, malgre etre 4x plus petit. L'impact pratique des Chinchilla Laws a ete considerable : (1) Llama 1 (Meta, 2023) a deliberement entraine des modeles plus petits sur plus de tokens que les lois de Kaplan (2020) ne le suggeraient, obtenant des modeles tres performants a 7B, 13B, 65B params. (2) Mistral 7B (2023) entraine sur 8T tokens a demontre qu'on pouvait depasser Llama 2 13B avec un modele 2x plus petit mais mieux entraine. Les limites des Chinchilla Laws : elles optimisent pour le compute d'entrainement, pas pour le cout d'inference. Un modele 7B est beaucoup moins cher a deployer qu'un 70B, meme si les deux ont le meme cout de pre-training a qualite egale. En pratique, il est souvent plus economique d'entrainer un modele plus petit que Chinchilla-optimal sur encore plus de donnees pour obtenir un modele moins cher a l'inference. Des refinements subsequents ont identifie d'autres dimensions : le 'inference-optimal' frontiere (ou entrainer pour minimiser le cout total de deployment), l'impact de la qualite des donnees (des donnees de meilleure qualite permettent d'atteindre la meme performance avec moins de tokens), et les effets de la duplication des donnees (repetition des donnees lors de l'entrainement).

Formule Chinchilla

Pour un budget compute C (FLOPs), les valeurs optimales sont :

  • N* (parametres) = 0.07 * C^0.5 (nombre de parametres)
  • D* (tokens) = 1.7 * C^0.5 (nombre de tokens de donnees)
  • Ratio D*/N* = 20 tokens par parametre

Evolution des pratiques d'entrainement

ModeleParamsTokensRatio T/P
GPT-3 (2020)175B300B1.7x
Gopher (2021)280B300B1.1x
Chinchilla (2022)70B1.4T20x
Llama 2 (2023)7B-70B2T28-286x
LLaMA 3 (2024)8B-70B15T214-1875x
Qwen 2.5 3B (2024)3B18T6000x

La tendance post-Chinchilla : entrainer de plus en plus de tokens par parametre, bien au-dela du ratio optimal de 20, pour obtenir de petits modeles tres competents a l'inference.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis