Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Vocabulary Size (Taille du vocabulaire)

ia

Définition

La Vocabulary Size (taille du vocabulaire) est le nombre total de tokens uniques dans le vocabulaire du tokenizer d'un LLM, determinent la granularite avec laquelle le texte est decoupes en unites de traitement. Ce parametre a un impact direct sur l'efficacite du traitement multilingue, la compression du texte en tokens, et le cout computationnel du modele. L'evolution des tailles de vocabulaire : GPT-2 (50K tokens), GPT-3 (50K), LLaMA 1 (32K), LLaMA 2 (32K, SentencePiece BPE), LLaMA 3 (128K, TikToken), Qwen 2.5 (152K), DeepSeek V3 (129K). La tendance est vers des vocabulaires plus grands qui permettent un encodage plus efficace, surtout pour les langues non-anglaises et le code. L'impact du vocabulaire sur l'efficacite multilingue : un vocabulaire de 32K tokens entraine principalement sur l'anglais necessite 3-6 tokens par mot francais, et 10-15 tokens par mot chinois ou arabe (car les caracteres asiatiques n'ont pas de sous-unites BPE). Un vocabulaire de 128K+ avec une couverture multilingue balanced reduit ce ratio, accelerant l'inference et reduisant les couts d'API pour les langues non-anglaises. Le cout computationnel lie au vocabulaire : la couche de tete du LLM (lm_head) effectue une multiplication matrice-vecteur de dimension (hidden_size, vocab_size) pour chaque token genere. Pour un LLM hidden_size=4096 et vocab_size=128K, cette couche seule contient 4096*128000 = 524M parametres et necessite 524M multiplications par token genere. Pour les applications enterprise avec du texte majoritairement non-anglais ou du code, le choix du vocabulaire du modele est un facteur de cout important. Qwen 2.5 (vocabulaire 152K optimise pour le multilingual) genere moins de tokens qu'un LLaMA 2 (32K) pour les memes textes en chinois ou francais, reduisant proportionnellement les couts d'API.

Comparaison efficacite multilingue

TexteLLaMA 2 (32K)LLaMA 3 (128K)Qwen 2.5 (152K)
Anglais (100 mots)~120 tokens~110 tokens~110 tokens
Francais (100 mots)~165 tokens~135 tokens~125 tokens
Chinois (100 chars)~350 tokens~180 tokens~120 tokens
Code Python (100 LOC)~400 tokens~280 tokens~280 tokens

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis