Feature Visualization (Interpretabilite)
iaDéfinition
La Feature Visualization est une technique de mechanistic interpretability qui genere synthetiquement les inputs qui maximisent l'activation d'un neurone, d'un canal ou d'une direction dans l'espace des activations d'un reseau de neurones. Elle repond a la question : 'Qu'est-ce que ce neurone a appris a detecter ?' en creant le stimulus qui l'excite le plus. Pour les CNN (reseaux convolutifs), la technique est bien etablie : en utilisant la descente de gradient sur l'espace des images (gradient ascent sur l'activation), on genere une image optimisee pour maximiser le neurone cible. Olah et al. (Distill, 2017) ont visualise systematiquement les features des CNNs, revelant que les premieres couches detectent des bords et textures, les couches moyennes des motifs et parties d'objets, et les dernieres couches des concepts complets. Pour les LLMs, la feature visualization est plus complexe car l'espace d'input est discret (tokens). Les approches incluent : (1) Logit lens — projeter les activations intermediaires dans l'espace de vocabulaire pour voir quelle 'prediction' chaque couche ferait, (2) Steering vectors — trouver des directions dans l'espace d'activation qui correspondent a des concepts (en contrastant des activations avec/sans le concept), (3) Maximum Activating Dataset Examples — trouver dans un large corpus les textes qui maximisent une direction d'activation. Les Sparse Autoencoders (SAE) sont devenus l'outil dominant de feature visualization pour les LLMs : en apprenant un codebook de features monosemantiques a partir des activations, ils permettent d'identifier et de visualiser des milliers de features interpretables. Anthropic (2024) a publie une carte interactive de millions de features du modele Claude 3 Sonnet. La feature visualization a des implications pratiques pour la securite IA : en identifiant les features correspondant a des concepts dangereux (instructions pour la violence, manipulation emotionnelle), il devient possible de monitorer si ces features sont activees pendant l'inference et d'intervenir. C'est la base du Representation Engineering (RepE).
Feature Visualization via Maximum Activating Examples
from transformer_lens import HookedTransformer
model = HookedTransformer.from_pretrained('gpt2-small')
def find_max_activating_tokens(model, layer, neuron_idx, corpus, top_k=10):
activations = []
for text in corpus:
tokens = model.to_tokens(text)
_, cache = model.run_with_cache(tokens)
# Activation du neurone specifique sur tous les tokens
neuron_acts = cache['mlp_post', layer][:, :, neuron_idx]
max_act = neuron_acts.max().item()
activations.append((text, max_act))
return sorted(activations, key=lambda x: x[1], reverse=True)[:top_k]Outil de reference : Neuroscope (Anthropic)
- Interface web permettant de browser les features de GPT-2 et LLaMA
- Pour chaque neurone : les tokens qui l'activent le plus
- Revele des features emergentes surprenantes : bilingues, contextuelles, syntaxiques
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h