Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Instruction Tuning

ia

Définition

L'Instruction Tuning est une phase de fine-tuning supervisé appliquée à un grand modèle de langage après son pré-entraînement initial sur de vastes corpus textuels bruts, consistant à réentraîner le modèle sur un jeu de données structuré en paires explicites d'instruction et de réponse attendue, couvrant une grande diversité de tâches formulées en langage naturel : répondre à une question, résumer un texte, traduire, générer du code, suivre une consigne précise de format. Cette étape transforme fondamentalement le comportement du modèle : un modèle uniquement pré-entraîné, optimisé pour prédire statistiquement le mot suivant d'un texte, tend à compléter un prompt de façon imprévisible plutôt qu'à y répondre directement de façon utile et alignée avec l'intention de l'utilisateur ; l'instruction tuning oriente explicitement le modèle vers un comportement conversationnel et directement exploitable, capable de comprendre et d'exécuter fidèlement des consignes variées formulées naturellement. InstructGPT, publié par OpenAI en 2022, a formalisé et popularisé cette approche, démontrant qu'un modèle de taille modeste correctement instruction-tuné pouvait produire des réponses jugées préférables par des évaluateurs humains à celles d'un modèle brut bien plus volumineux. L'instruction tuning constitue une étape fondatrice du pipeline d'entraînement des modèles conversationnels modernes, précédant généralement un affinage supplémentaire par apprentissage par renforcement à partir de retours humains (RLHF).

Description

L'Instruction Tuning est une phase de fine-tuning d'un LLM pré-entraîné sur des paires instruction/réponse de haute qualité pour améliorer sa capacité à comprendre et suivre des instructions en langage naturel. C'est la base des modèles chat comme InstructGPT, Claude et Llama-3-Instruct.

Fonctionnement

Le modèle est fine-tuné en apprentissage supervisé sur des milliers à millions de paires (instruction, réponse souhaitée) couvrant des tâches diversifiées. La qualité et la diversité des instructions sont critiques. Cette phase transforme un modèle completion en modèle chat capable de suivre des directives complexes.

Points clés

  • FLAN-T5 a démontré que la généralisation zero-shot s'améliore massivement avec l'instruction tuning multi-tâche
  • Le jeu de données d'instruction doit couvrir des instructions de refus (safety) pour éviter les comportements dangereux
  • Alpaca (Stanford) et OpenHermes démontrent que de petits datasets de haute qualité surpassent de grands datasets bruités

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis