Encodeur de texte contrastif CLIP
iaDéfinition
CLIP (Contrastive Language-Image Pre-training) est un modele developpe par OpenAI en 2021 qui apprend a associer des images et des descriptions textuelles dans un espace vectoriel commun, via un entrainement contrastif sur des paires image-texte collectees a grande echelle sur le web. L'encodeur de texte, generalement une architecture Transformer, et un encodeur d'image, souvent un Vision Transformer (ViT) ou un ResNet, projettent chacun leur entree dans un espace de meme dimension. L'entrainement maximise la similarite cosinus entre les paires correctes et la minimise entre les paires incorrectes au sein d'un lot (batch), sans annotation manuelle fine. CLIP sert de brique fondatrice a de nombreux systemes de generation d'images comme DALL-E 2 et Stable Diffusion, ou il guide le processus de diffusion vers un contenu coherent avec le prompt textuel. Il est egalement utilise pour la recherche d'images par texte (zero-shot classification) sans reentrainement specifique. Pour un RSSI, l'usage de CLIP dans des pipelines de moderation de contenu ou de reconnaissance visuelle souleve des questions de biais herites du corpus d'entrainement web, non audite exhaustivement, et de robustesse face aux attaques adversariales par perturbation d'image (typographic attacks), documentees dans la litterature depuis la publication du modele.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.