Superposition Hypothesis
iaDéfinition
La Superposition Hypothesis est une theorie fondamentale de la mechanistic interpretability des LLMs, proposee par Elhage et al. (Anthropic, 2022) dans le paper 'Toy Models of Superposition'. Elle stipule que les reseaux de neurones encodent un nombre de 'features' (concepts, proprietes) bien superieur au nombre de neurones disponibles, en utilisant des directions non-orthogonales dans l'espace des activations — une sorte de compression avec interference controlee. L'intuition : si un reseau a N neurones et doit representer M > N features, il ne peut pas assigner un neurone unique a chaque feature (monosemantique). Au lieu de ca, il encode chaque feature comme une direction dans l'espace des activations, en acceptant que ces directions interferent. Les features rares (apparaissant peu souvent) peuvent partager des neurones sans trop d'interference, permettant une capacite effective bien superieure a N. La superposition explique pourquoi les neurones individuels dans les LLMs sont polysemantiques (repondent a des concepts multiples et apparemment non lies) : un meme neurone peut s'activer pour 'base de donnees', 'coureur de fond' et 'musique classique' car ces concepts sont encodes dans des directions differentes qui projettent toutes sur ce neurone. Les implications pour la mechanistic interpretability sont profondes : si les features sont dans les directions de l'espace d'activation et non dans les neurones individuels, il faut des techniques comme la Sparse Autoencoder (SAE) decomposition pour extraire des features monosemantiques. Les SAEs ont ete utilises pour decouvrir des features interpretables dans Claude et GPT-4 (emotions, biais, intentions). La Superposition Hypothesis guide la recherche en circuits au sein des LLMs : en decouvrant comment les features sont organisees et comment elles interagissent dans les circuits d'attention et FFN, les chercheurs esperent comprendre et predire les comportements emergents des LLMs, y compris leurs biais et leurs vulnerabilites.
Sparse Autoencoders pour decomposer la superposition
# Un SAE decompose les activations de couche LLM en features interpretables
# Chaque feature SAE est monosemantique (un seul concept)
class SparseAutoencoder(nn.Module):
def __init__(self, d_model, n_features, sparsity_coef=1e-3):
super().__init__()
self.encoder = nn.Linear(d_model, n_features)
self.decoder = nn.Linear(n_features, d_model)
self.sparsity = sparsity_coef
def forward(self, x):
# Encoder avec ReLU (induit la sparsite)
features = torch.relu(self.encoder(x))
# Penalite L1 pour encourager la sparsite
loss_L1 = self.sparsity * features.abs().sum()
reconstruction = self.decoder(features)
loss_recon = (x - reconstruction).pow(2).mean()
return features, loss_recon + loss_L1Exemples de features decouvertes (Anthropic 2024)
- Feature 'Barack Obama' : s'active sur des mentions de Barack Obama et concepts associes
- Feature 'frustration' : s'active sur des tokens exprimant de la frustration
- Features bilingues : une meme feature s'active pour 'chat' et 'cat'
- Features contextuelles : 'ruse' dans un contexte juridique vs animal
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h