Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Universal Approximation Theorem

ia

Définition

Le Theoreme d'Approximation Universelle (Universal Approximation Theorem) est un resultat fondamental de la theorie des reseaux de neurones, enonce par Cybenko (1989) et etendu par Hornik et al. (1991), qui stipule qu'un reseau de neurones feedforward avec au moins une couche cachee de largeur suffisante et une fonction d'activation non-lineaire appropriee peut approximer n'importe quelle fonction continue sur un domaine compact avec une precision arbitraire. Formellement : pour tout epsilon > 0 et toute fonction continue f sur un compact K de R^n, il existe un reseau de neurones N(x) avec une couche cachee de largeur m suffisante tel que |f(x) - N(x)| < epsilon pour tout x dans K. La precision est atteinte en augmentant la largeur m (nombre de neurones cachés) ou en empilant des couches (profondeur). Les implications pour le deep learning : le theoreme demontre theroriquement qu'un reseau de neurones assez grand peut representer n'importe quelle fonction, justifiant leur utilisation pour des taches arbitrairement complexes. Cependant, le theoreme est d'existence (il garantit qu'un tel reseau existe) mais pas de construction (il ne dit pas comment l'entrainer). Les extensions importantes : le theoreme s'applique avec differentes fonctions d'activation (sigmoids, ReLU, tanh, GELU). Pour les reseaux profonds (deep), un reseau avec d couches peut representer des fonctions plus efficacement (moins de neurones par couche) que des reseaux peu profonds equivalents, ce qui justifie theroriquement la superiorite empirique du deep learning sur les reseaux peu profonds larges. Limitations du theoreme : (1) il garantit l'existence mais pas la facilite de l'apprentissage (le gradient descent peut converger vers des minima locaux pauvres), (2) la largeur necessaire peut etre exponentiellement grande en pratique, (3) il ne garantit pas la generalisation (un reseau peut memoriser le training set sans generaliser). Ces limitations expliquent pourquoi l'entrainement pratique est plus subtil que la theorie ne le suggere.

Illustration intuitive

Un neurone avec activation sigmoide peut approximer une fonction 'porte' (plateau entre deux valeurs). En combinant assez de ces fonctions porte avec differentes positions et hauteurs, on peut approximer n'importe quelle forme de courbe — comme une somme de Riemann approxime une integrale.

Extensions du theoreme

  • Profondeur vs largeur : Eldan & Shamir (2016) montrent que les reseaux 2-couches peuvent necessiter exponentiellement plus de neurones que les reseaux 3-couches pour la meme fonction
  • Reseaux convolutionnels : le theoreme s'etend aux CNN et Transformers sous certaines conditions
  • Fonctions non-continues : avec ReLU (lineaire par morceaux), les reseaux profonds peuvent approximer des fonctions discontinues

Implications pratiques

  • Justifie theroriquement la puissance des LLMs : un Transformer de taille suffisante peut en principe apprendre n'importe quelle relation dans les donnees de texte
  • Ne garantit pas l'entrainabilite : trouver les bons poids reste un probleme d'optimisation difficile
  • Motivations pour la profondeur : les reseaux profonds representent les fonctions complexes plus efficacement

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis