Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Feature Visualization (Interpretabilite)

ia

Définition

La Feature Visualization est une technique de mechanistic interpretability qui genere synthetiquement les inputs qui maximisent l'activation d'un neurone, d'un canal ou d'une direction dans l'espace des activations d'un reseau de neurones. Elle repond a la question : 'Qu'est-ce que ce neurone a appris a detecter ?' en creant le stimulus qui l'excite le plus. Pour les CNN (reseaux convolutifs), la technique est bien etablie : en utilisant la descente de gradient sur l'espace des images (gradient ascent sur l'activation), on genere une image optimisee pour maximiser le neurone cible. Olah et al. (Distill, 2017) ont visualise systematiquement les features des CNNs, revelant que les premieres couches detectent des bords et textures, les couches moyennes des motifs et parties d'objets, et les dernieres couches des concepts complets. Pour les LLMs, la feature visualization est plus complexe car l'espace d'input est discret (tokens). Les approches incluent : (1) Logit lens — projeter les activations intermediaires dans l'espace de vocabulaire pour voir quelle 'prediction' chaque couche ferait, (2) Steering vectors — trouver des directions dans l'espace d'activation qui correspondent a des concepts (en contrastant des activations avec/sans le concept), (3) Maximum Activating Dataset Examples — trouver dans un large corpus les textes qui maximisent une direction d'activation. Les Sparse Autoencoders (SAE) sont devenus l'outil dominant de feature visualization pour les LLMs : en apprenant un codebook de features monosemantiques a partir des activations, ils permettent d'identifier et de visualiser des milliers de features interpretables. Anthropic (2024) a publie une carte interactive de millions de features du modele Claude 3 Sonnet. La feature visualization a des implications pratiques pour la securite IA : en identifiant les features correspondant a des concepts dangereux (instructions pour la violence, manipulation emotionnelle), il devient possible de monitorer si ces features sont activees pendant l'inference et d'intervenir. C'est la base du Representation Engineering (RepE).

Feature Visualization via Maximum Activating Examples

from transformer_lens import HookedTransformer

model = HookedTransformer.from_pretrained('gpt2-small')

def find_max_activating_tokens(model, layer, neuron_idx, corpus, top_k=10):
    activations = []
    for text in corpus:
        tokens = model.to_tokens(text)
        _, cache = model.run_with_cache(tokens)
        # Activation du neurone specifique sur tous les tokens
        neuron_acts = cache['mlp_post', layer][:, :, neuron_idx]
        max_act = neuron_acts.max().item()
        activations.append((text, max_act))

    return sorted(activations, key=lambda x: x[1], reverse=True)[:top_k]

Outil de reference : Neuroscope (Anthropic)

  • Interface web permettant de browser les features de GPT-2 et LLaMA
  • Pour chaque neurone : les tokens qui l'activent le plus
  • Revele des features emergentes surprenantes : bilingues, contextuelles, syntaxiques

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis