Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Steering de modele par activation (activation steering)

ia

Définition

Le steering de modele par activation est une technique d'intervention qui modifie le comportement d'un grand modele de langage en ajoutant un vecteur de direction aux activations internes pendant l'inference, sans modifier les poids du reseau ni reentrainer le modele. Le vecteur de steering, aussi appele vecteur de controle, est generalement calcule comme la difference d'activations moyennes entre des paires de prompts contrastes, par exemple des reponses polies contre des reponses hostiles, puis injecte a une ou plusieurs couches du transformeur avec un coefficient d'intensite ajustable. Cette methode permet d'orienter un modele vers plus d'honnetete, moins de toxicite, ou un style donne, de maniere plus ciblee et moins couteuse qu'un finetuning complet ou un RLHF. Elle est etudiee comme axe de recherche en securite de l'IA pour reduire les comportements trompeurs ou dangereux detectes via des sondes lineaires, en complement de l'alignement classique. Limites connues : effets parfois imprevisibles sur des capacites non ciblees, degradation possible de la coherence du texte a forte intensite, et absence de garantie que l'intervention supprime reellement le comportement indesirable plutot que de masquer son expression. Le steering par activation reste une technique de recherche, peu deployee en production, mais suivie de pres par les equipes d'alignement et de red teaming IA.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis