Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Embeddings multi-vecteurs

ia

Définition

Les embeddings multi-vecteurs sont une representation d'un document ou d'une requete par plusieurs vecteurs plutot qu'un seul, chaque vecteur capturant un fragment ou un token du texte. L'approche de reference, ColBERT, encode chaque token independamment et calcule la similarite finale par une operation MaxSim qui compare tous les vecteurs de la requete a tous les vecteurs du document. Cette granularite ameliore la precision par rapport a un embedding unique dense qui ecrase le sens global d'un texte long en un seul point de l'espace vectoriel, au prix d'une perte d'information lexicale fine. Le cout est un index plus volumineux, car chaque document produit des dizaines voire des centaines de vecteurs au lieu d'un seul, et une recherche plus couteuse en calcul et en memoire. Des variantes compressees comme ColBERTv2 ou PLAID reduisent cet overhead via la quantification des vecteurs. En entreprise, les embeddings multi-vecteurs interessent les systemes RAG exigeant une forte precision de recherche, par exemple sur de la documentation technique ou juridique, ou une mauvaise recuperation entraine des reponses erronees du modele de langage. Le choix se fait generalement en arbitrant precision de recherche, latence et cout d'infrastructure face aux embeddings denses classiques a vecteur unique.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis