Vocabulaire de sous-mots
iaDéfinition
Le vocabulaire de sous-mots est l'ensemble fini d'unites linguistiques (morceaux de mots, mots entiers ou caracteres) qu'un modele de langage utilise pour representer n'importe quel texte en entree ou en sortie. Il est construit par des algorithmes comme Byte-Pair Encoding (BPE), WordPiece ou Unigram Language Model, qui fusionnent iterativement les paires de caracteres ou de sous-chaines les plus frequentes dans un corpus d'entrainement. La taille typique varie de 30000 a plus de 250000 unites selon les modeles, GPT-4 et Llama 3 utilisant des vocabulaires multilingues plus larges pour reduire le nombre de tokens necessaires par langue. Un vocabulaire de sous-mots permet de gerer les mots rares ou inconnus (out-of-vocabulary) en les decomposant en fragments connus, evitant ainsi le probleme des vocabulaires fermes des premiers modeles de langage. Ce mecanisme conditionne directement le cout d'inference d'un LLM, facture au token chez la plupart des fournisseurs d'API, ainsi que la fenetre de contexte effective. Pour un DSI evaluant des solutions d'IA generative, la connaissance du vocabulaire sous-jacent aide a estimer les couts d'usage et les biais potentiels : les langues sous-representees dans le corpus d'entrainement produisent souvent des decoupages moins efficaces, donc plus couteux et moins performants.
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h