Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Mechanistic Interpretability

ia

Définition

L'Interpretability mecaniste est une discipline de recherche en AI Safety qui cherche a comprendre de maniere rigoureuse les mecanismes computationnels internes des reseaux de neurones pour expliquer pourquoi et comment ils produisent leurs sorties. Contrairement aux techniques XAI classiques (LIME, SHAP), elle vise une comprehension causale. Principalement menee par Anthropic (Chris Olah, Elhage et al.) et Neel Nanda, la recherche a identifie des circuits specifiques dans les LLMs : les 'induction heads' (detection de patterns), les 'name mover heads' (propagation des noms propres), et les circuits d'arithmetique modulaire. La Superposition Hypothesis (Elhage et al., 2022) explique pourquoi les LLMs sont difficiles a interpreter : les modeles encodent beaucoup plus de 'features' (concepts) que de dimensions dans leur espace d'activation, en superposant plusieurs features par neurone. Les Sparse Autoencoders (SAE) sont une technique recente pour decomposer ces superpositions : en encodant les activations dans un espace beaucoup plus large avec contrainte de sparsite, on obtient des features monofonctionnelles interpretables ('Paris is in France', 'past tense verbs'). Pour la securite IA, l'interpretability mecaniste est cruciale : comprendre les circuits implementant les comportements indesirables permet de les corriger chirurgicalement ou de developper des detecteurs d'activation pour les monitorer en production.

Sparse Autoencoders (SAE)

from sae_lens import SAE

# Charger un SAE pre-entraine sur GPT-2 Small
sae, cfg, _ = SAE.from_pretrained(
    release='gpt2-small-res-jb',
    sae_id='blocks.8.hook_resid_pre'
)
# Les colonnes de W_dec correspondent aux features interpretables
# Ex: 'Paris is in France', 'DNA sequences', 'past tense verbs'

Circuits notables identifies

  • Induction Heads : detectent et copient des patterns [A][B]...[A] → [B]
  • IOI (Indirect Object Identification) : 'When Mary and John went to the store, John gave the bag to [Mary]'
  • Greater-than circuit : compare des nombres dans le contexte

Activation Steering

En ajoutant des vecteurs d'activation patches dans le residual stream, on peut modifier le comportement du modele de maniere controlee. Application : rendre le modele plus prudent sur un sujet, ou detecter des comportements indesirables en monitoring de production.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis