Vocabulary Size (Taille du vocabulaire)
iaDéfinition
La Vocabulary Size (taille du vocabulaire) est le nombre total de tokens uniques dans le vocabulaire du tokenizer d'un LLM, determinent la granularite avec laquelle le texte est decoupes en unites de traitement. Ce parametre a un impact direct sur l'efficacite du traitement multilingue, la compression du texte en tokens, et le cout computationnel du modele. L'evolution des tailles de vocabulaire : GPT-2 (50K tokens), GPT-3 (50K), LLaMA 1 (32K), LLaMA 2 (32K, SentencePiece BPE), LLaMA 3 (128K, TikToken), Qwen 2.5 (152K), DeepSeek V3 (129K). La tendance est vers des vocabulaires plus grands qui permettent un encodage plus efficace, surtout pour les langues non-anglaises et le code. L'impact du vocabulaire sur l'efficacite multilingue : un vocabulaire de 32K tokens entraine principalement sur l'anglais necessite 3-6 tokens par mot francais, et 10-15 tokens par mot chinois ou arabe (car les caracteres asiatiques n'ont pas de sous-unites BPE). Un vocabulaire de 128K+ avec une couverture multilingue balanced reduit ce ratio, accelerant l'inference et reduisant les couts d'API pour les langues non-anglaises. Le cout computationnel lie au vocabulaire : la couche de tete du LLM (lm_head) effectue une multiplication matrice-vecteur de dimension (hidden_size, vocab_size) pour chaque token genere. Pour un LLM hidden_size=4096 et vocab_size=128K, cette couche seule contient 4096*128000 = 524M parametres et necessite 524M multiplications par token genere. Pour les applications enterprise avec du texte majoritairement non-anglais ou du code, le choix du vocabulaire du modele est un facteur de cout important. Qwen 2.5 (vocabulaire 152K optimise pour le multilingual) genere moins de tokens qu'un LLaMA 2 (32K) pour les memes textes en chinois ou francais, reduisant proportionnellement les couts d'API.
Comparaison efficacite multilingue
| Texte | LLaMA 2 (32K) | LLaMA 3 (128K) | Qwen 2.5 (152K) |
|---|---|---|---|
| Anglais (100 mots) | ~120 tokens | ~110 tokens | ~110 tokens |
| Francais (100 mots) | ~165 tokens | ~135 tokens | ~125 tokens |
| Chinois (100 chars) | ~350 tokens | ~180 tokens | ~120 tokens |
| Code Python (100 LOC) | ~400 tokens | ~280 tokens | ~280 tokens |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h