Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Vocabulaire de sous-mots

ia

Définition

Le vocabulaire de sous-mots est l'ensemble fini d'unites linguistiques (morceaux de mots, mots entiers ou caracteres) qu'un modele de langage utilise pour representer n'importe quel texte en entree ou en sortie. Il est construit par des algorithmes comme Byte-Pair Encoding (BPE), WordPiece ou Unigram Language Model, qui fusionnent iterativement les paires de caracteres ou de sous-chaines les plus frequentes dans un corpus d'entrainement. La taille typique varie de 30000 a plus de 250000 unites selon les modeles, GPT-4 et Llama 3 utilisant des vocabulaires multilingues plus larges pour reduire le nombre de tokens necessaires par langue. Un vocabulaire de sous-mots permet de gerer les mots rares ou inconnus (out-of-vocabulary) en les decomposant en fragments connus, evitant ainsi le probleme des vocabulaires fermes des premiers modeles de langage. Ce mecanisme conditionne directement le cout d'inference d'un LLM, facture au token chez la plupart des fournisseurs d'API, ainsi que la fenetre de contexte effective. Pour un DSI evaluant des solutions d'IA generative, la connaissance du vocabulaire sous-jacent aide a estimer les couts d'usage et les biais potentiels : les langues sous-representees dans le corpus d'entrainement produisent souvent des decoupages moins efficaces, donc plus couteux et moins performants.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis