Circuits (Mechanistic Interpretability)
iaDéfinition
Les Circuits, dans le contexte de la mechanistic interpretability, sont des sous-graphes du reseau de neurones (combinaisons de couches d'attention et FFN connectees par des residual streams) qui implementent des algorithmes specifiques et interpretables. La 'Circuit Analysis' vise a identifier ces sous-reseaux et a comprendre l'algorithme qu'ils executent pour accomplir une tache specifique. Olah et al. (Anthropic, 2020) ont lance ce programme de recherche en decouvrant des circuits dans les CNNs : des courbes de detection, des collecteurs de frequences, des detecteurs de courbes. Ces resultats ont inspire la meme approche pour les Transformers. Elhage et al. (Anthropic, 2021) 'A Mathematical Framework for Transformer Circuits' a formalise l'analyse de circuits pour les Transformers, decrivant comment l'attention et les couches FFN interagissent via le residual stream. Des circuits specifiques ont ete identifies : les 'induction heads' (qui copient les patterns precedents), les 'suppression heads' (qui inhibent certains tokens), et les 'copying heads'. Des circuits specifiques ont ete trouves pour : (1) le 'indirect object identification' (IOI) dans GPT-2 — comment le modele identifie l'objet indirect dans 'John gave Mary a book, then she...' et predit 'Mary', (2) la detection d'algorithmes de tri dans les Transformers, (3) la computation arithmetique. La recherche en circuits a des implications pratiques pour la securite IA : en comprenant quels circuits sont responsables de quels comportements, il devient possible d'intervenir chirurgicalement sur ces circuits pour modifier des comportements specifiques (editition de modele, activation steering) sans impacter le reste du modele.
Exemple : Induction Heads
Les 'induction heads' sont un type de circuit trouve dans tous les Transformers : si le token A est suivi de B dans le contexte, et que A apparait a nouveau, les induction heads predictent B comme prochain token. Deux tetes d'attention cooperent :
- Tete 'previous token' : pour chaque token, attend le token qui la precede
- Tete 'induction' : cherche si le token precedent a ete vu avant, et si oui, copie ce qui le suivait
Outils d'analyse de circuits
- TransformerLens (Neel Nanda) : bibliotheque Python pour l'interpretabilite mechaniste
- Baukit : hooks pour acceder aux activations intermediaires
- EAP (Edge Attribution Patching) : identifier quels edges du graphe sont importants
- Activation Patching : localiser causalement les composants responsables
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h