Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Superposition Hypothesis

ia

Définition

La Superposition Hypothesis est une theorie fondamentale de la mechanistic interpretability des LLMs, proposee par Elhage et al. (Anthropic, 2022) dans le paper 'Toy Models of Superposition'. Elle stipule que les reseaux de neurones encodent un nombre de 'features' (concepts, proprietes) bien superieur au nombre de neurones disponibles, en utilisant des directions non-orthogonales dans l'espace des activations — une sorte de compression avec interference controlee. L'intuition : si un reseau a N neurones et doit representer M > N features, il ne peut pas assigner un neurone unique a chaque feature (monosemantique). Au lieu de ca, il encode chaque feature comme une direction dans l'espace des activations, en acceptant que ces directions interferent. Les features rares (apparaissant peu souvent) peuvent partager des neurones sans trop d'interference, permettant une capacite effective bien superieure a N. La superposition explique pourquoi les neurones individuels dans les LLMs sont polysemantiques (repondent a des concepts multiples et apparemment non lies) : un meme neurone peut s'activer pour 'base de donnees', 'coureur de fond' et 'musique classique' car ces concepts sont encodes dans des directions differentes qui projettent toutes sur ce neurone. Les implications pour la mechanistic interpretability sont profondes : si les features sont dans les directions de l'espace d'activation et non dans les neurones individuels, il faut des techniques comme la Sparse Autoencoder (SAE) decomposition pour extraire des features monosemantiques. Les SAEs ont ete utilises pour decouvrir des features interpretables dans Claude et GPT-4 (emotions, biais, intentions). La Superposition Hypothesis guide la recherche en circuits au sein des LLMs : en decouvrant comment les features sont organisees et comment elles interagissent dans les circuits d'attention et FFN, les chercheurs esperent comprendre et predire les comportements emergents des LLMs, y compris leurs biais et leurs vulnerabilites.

Sparse Autoencoders pour decomposer la superposition

# Un SAE decompose les activations de couche LLM en features interpretables
# Chaque feature SAE est monosemantique (un seul concept)

class SparseAutoencoder(nn.Module):
    def __init__(self, d_model, n_features, sparsity_coef=1e-3):
        super().__init__()
        self.encoder = nn.Linear(d_model, n_features)
        self.decoder = nn.Linear(n_features, d_model)
        self.sparsity = sparsity_coef

    def forward(self, x):
        # Encoder avec ReLU (induit la sparsite)
        features = torch.relu(self.encoder(x))
        # Penalite L1 pour encourager la sparsite
        loss_L1 = self.sparsity * features.abs().sum()
        reconstruction = self.decoder(features)
        loss_recon = (x - reconstruction).pow(2).mean()
        return features, loss_recon + loss_L1

Exemples de features decouvertes (Anthropic 2024)

  • Feature 'Barack Obama' : s'active sur des mentions de Barack Obama et concepts associes
  • Feature 'frustration' : s'active sur des tokens exprimant de la frustration
  • Features bilingues : une meme feature s'active pour 'chat' et 'cat'
  • Features contextuelles : 'ruse' dans un contexte juridique vs animal

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis