Cosine Similarity
iaDéfinition
La Cosine Similarity, ou similarité cosinus, est une mesure mathématique de similarité entre deux vecteurs non nuls dans un espace multidimensionnel, calculée comme le cosinus de l'angle formé entre ces deux vecteurs, obtenu par le rapport de leur produit scalaire sur le produit de leurs normes euclidiennes respectives, produisant une valeur comprise entre -1, indiquant des vecteurs de sens strictement opposés, et 1, indiquant des vecteurs de direction parfaitement identique, une valeur de 0 signifiant une orthogonalité totale sans relation directionnelle entre eux. Cette mesure présente un avantage déterminant pour l'analyse sémantique de texte comparée à une simple distance euclidienne : elle s'intéresse exclusivement à l'orientation relative des vecteurs comparés, indépendamment de leur magnitude absolue, une propriété précieuse lorsque l'on compare des embeddings de texte de longueurs différentes dont l'amplitude vectorielle peut varier sans que cela reflète une différence de sens réelle. Dans le contexte des pipelines RAG et de la recherche sémantique, chaque document et chaque requête sont convertis en vecteurs d'embedding par un modèle d'encodage dédié, et la similarité cosinus entre le vecteur de la requête et chaque vecteur de document stocké dans la base vectorielle permet de classer et retourner les résultats les plus pertinents sémantiquement, un standard adopté par la quasi-totalité des bases de données vectorielles modernes comme Pinecone, Weaviate ou Qdrant.
Description
La similarité cosinus mesure la proximité sémantique entre deux vecteurs en calculant le cosinus de l'angle qui les sépare. Résultant en une valeur entre -1 (opposés) et 1 (identiques), elle est le standard de comparaison des embeddings en recherche sémantique et détection de similarités.
Fonctionnement
Le calcul cos(θ) = (A·B) / (|A|×|B|) normalise les vecteurs, rendant la mesure indépendante de leur magnitude. Cette propriété est cruciale pour la comparaison de textes de longueurs différentes ou d'images à résolutions variées encodées dans le même espace vectoriel.
Points clés
- Standard de facto pour la recherche de voisins approximatifs (ANN) dans les bases vectorielles (FAISS, Pinecone)
- Utilisée en cybersécurité pour détecter des variantes de malwares similaires par comparaison d'embeddings de code
- La distance euclidienne est préférable à la similarité cosinus quand la magnitude des vecteurs est informative
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés. 2.1.7
Un projet cybersécurité ?
Expert dispo · Réponse 24h