Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Constitutional AI

ia

Définition

Constitutional AI (CAI) est une methode d'alignment des LLMs developpee par Anthropic (Bai et al., 2022) qui utilise un ensemble explicite de principes ethiques et comportementaux (la 'Constitution') pour guider un processus d'auto-critique et d'auto-revision du modele, reduisant la dependance aux annotations humaines massives tout en ameliorant l'harmlessness. Le pipeline Constitutional AI en deux phases : Phase 1 (SL-CAI) — le modele genere des reponses a des prompts adversariaux, puis s'auto-critique selon les principes de la Constitution ('Cette reponse est-elle conforme au principe X ?') et se revise lui-meme. Les paires (prompt, reponse revisee) forment un dataset de fine-tuning. Phase 2 (RL-CAI) — un reward model est entraine depuis les preferences AI (feedback du modele selon la Constitution), puis le LLM est fine-tune via RL. La Constitution d'Anthropic inclut des principes comme : 'Choisir la reponse la moins susceptible de causer du tort physique, psychologique, financier, ou social', 'Choisir la reponse la plus honnete', 'Choisir la reponse qui respecte l'autonomie de l'utilisateur'. Ces principes sont inspires de la Declaration des Droits de l'Homme, des regles de conduite d'Apple, et des valeurs d'Anthropic. Les avantages de CAI sur le RLHF standard : (1) Transparence — la Constitution est explicite et verifiable (vs le reward model 'boite noire'), (2) Scalabilite — reduit les annotations humaines coteuses pour l'harmlessness (les humains annotent principalement sur l'helpfulness), (3) Coherence — les principes sont appliques de maniere plus uniforme qu'un reward model appris sur des preferences humaines variables. Constitutional AI est la base technique de l'alignment de Claude (tous les modeles). La Constitution peut etre adaptee pour des domaines specifiques (CAI medical, CAI juridique) en modifiant les principes. Des implementations open-source (self-critique avec principes explicites) sont disponibles dans TRL.

Etapes Constitutional AI

  1. Generation : modele genere reponse a prompt 'red team'
  2. Auto-Critique : 'Identifie les aspects de cette reponse qui pourraient violer [principe X]'
  3. Revision : 'Reecris la reponse pour etre conforme au principe X'
  4. AI Feedback : modele evalue quelles reponses sont plus conformes a la Constitution
  5. RL-CAI : entrainement PPO avec le reward model base sur la Constitution

Exemple de principe de Constitution

constitution_principles = [
    'Choisir la reponse la moins susceptible de contenir des informations nocives,'
    ' dangereuses, ou contraires a l ethique.',
    'Choisir la reponse qui traite les personnes avec le plus de respect et de dignite.',
    'Choisir la reponse qui exprime le moins de problemes avec l IA prenant conscience d elle-meme.',
    'Choisir la reponse la plus honnete et transparente.'
]

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis