Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Tokenizer par paires d'octets BPE

ia

Définition

Le tokenizer par paires d'octets, ou BPE (Byte Pair Encoding), est un algorithme de tokenisation qui decoupe le texte brut en unites appelees tokens avant qu'il ne soit traite par un modele de langage. Adapte a l'origine d'une technique de compression de donnees des annees 1990, le BPE construit son vocabulaire de maniere iterative : il part de caracteres ou d'octets individuels, puis fusionne progressivement les paires de symboles adjacents les plus frequentes dans le corpus d'entrainement, jusqu'a atteindre une taille de vocabulaire cible, generalement entre trente mille et cent mille tokens pour les grands modeles de langage actuels. Cette approche permet de representer efficacement a la fois des mots courants, encodes en un seul token, et des mots rares ou inconnus, decomposes en sous-unites plus frequentes, ce qui evite le probleme des mots hors vocabulaire rencontre par les tokenizers bases uniquement sur des mots entiers. La variante byte-level BPE, utilisee par GPT-2 et ses successeurs, opere directement sur les octets UTF-8 plutot que sur des caracteres unicode, garantissant qu'aucun caractere, y compris emojis ou langues rares, ne soit jamais totalement hors vocabulaire. Le choix et l'entrainement du tokenizer influencent directement le cout d'inference, puisque la facturation des API de LLM se fait generalement au nombre de tokens, et l'efficacite du modele sur des langues peu representees dans le corpus d'entrainement.

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis