Sonde lineaire de representation (linear probe)
iaDéfinition
La sonde lineaire de representation (linear probe) est une methode d'interpretabilite qui entraine un classifieur lineaire simple sur les activations internes d'un reseau de neurones pour verifier si une information specifique, comme un sentiment, une langue, un concept factuel ou une intention de tromperie, y est encodee de maniere lineairement separable. Le principe : on fige les poids du modele etudie, on extrait les activations d'une couche donnee pour un ensemble d'exemples etiquetes, puis on entraine une regression logistique a predire l'etiquette a partir de ces activations. Une precision elevee indique que la couche represente l'information de facon exploitable ; une precision proche du hasard suggere une absence de codage lineaire, sans exclure un codage non lineaire plus complexe. Les sondes lineaires sont utilisees en recherche sur l'alignement pour detecter des representations de tromperie, de biais ou de connaissances factuelles dans les grands modeles de langage, notamment dans les travaux d'interpretabilite mecaniste. Limite majeure : une sonde performante ne prouve pas que le modele utilise causalement cette information dans son raisonnement, seulement qu'elle est presente et accessible. Pour etablir la causalite, les chercheurs completent les sondes par des interventions d'activation steering. Utilite pratique pour un RSSI : auditer si un modele encode des donnees sensibles memorisees avant tout deploiement en production.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.