Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Recherche Sémantique (Semantic Search)

ia

Définition

La recherche sémantique, ou semantic search, est une technique de recherche d'information qui exploite des embeddings vectoriels pour identifier des documents conceptuellement proches d'une requête utilisateur donnée, indépendamment de toute correspondance lexicale exacte entre les termes employés dans la requête et ceux effectivement présents dans les documents recherchés. Contrairement à la recherche traditionnelle par mots-clés, s'appuyant sur des algorithmes statistiques comme BM25 ou TF-IDF qui mesurent la fréquence et la rareté relative des termes partagés entre requête et document sans jamais capturer leur sens réel, la recherche sémantique encode conjointement la requête et l'ensemble des documents indexés dans un espace vectoriel commun, généralement via des modèles bi-encodeurs entraînés spécifiquement à rapprocher dans cet espace les paires question-réponse ou requête-document sémantiquement pertinentes. Cette approche permet de retrouver des documents pertinents même en l'absence de tout mot commun avec la requête initiale, par exemple en identifiant un document traitant du « rançongiciel » à partir d'une recherche sur « ransomware », les deux termes étant sémantiquement équivalents mais lexicalement distincts. En pratique, les architectures de recherche les plus robustes combinent recherche sémantique vectorielle et recherche lexicale classique dans une approche hybride, exploitant les forces complémentaires de chaque méthode selon la nature de la requête traitée.

Description

La recherche sémantique utilise des embeddings vectoriels pour trouver des documents conceptuellement proches d'une requête, indépendamment de la correspondance lexicale exacte. Contrairement à la recherche par mots-clés (BM25), elle comprend la sémantique et les reformulations de la requête.

Fonctionnement

La requête et les documents sont encodés en vecteurs denses via des modèles bi-encodeurs (SBERT, E5, BGE). La similarité cosinus classe les résultats. La recherche hybride (dense + sparse) combine les avantages des deux approches, avec le Reciprocal Rank Fusion pour l'agrégation des scores.

Points clés

  • Transformatrice pour la threat intelligence : trouver des TTPs similaires même reformulés différemment dans des rapports hétérogènes
  • Détecte des variantes de malwares par comportement similaire plutôt que par signature textuelle exacte
  • Le reranking (CrossEncoder, Cohere Rerank) affine les résultats initiaux en N candidats pour une précision maximale

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis