Reglage fin par instructions
iaDéfinition
Le reglage fin par instructions (instruction fine-tuning ou instruction tuning) est une phase d'entrainement supplementaire appliquee a un modele de langage pre-entraine, qui vise a lui apprendre a suivre des consignes formulees en langage naturel plutot qu'a simplement completer un texte de maniere statistique. Le jeu de donnees d'entrainement est constitue de paires instruction-reponse couvrant un large eventail de taches (resumer, traduire, coder, repondre a une question), a l'image des jeux de donnees FLAN de Google ou Alpaca, souvent generes ou enrichis avec l'aide d'un autre modele. Cette etape, situee entre le pre-entrainement sur corpus brut et l'alignement par preferences (RLHF ou DPO), transforme un modele generaliste de completion de texte en un assistant capable de repondre directement et utilement a une demande formulee sous forme de question ou de commande, sans exemples supplementaires dans le prompt (capacite zero-shot amelioree). Les modeles GPT-3.5, Llama 2-Chat ou Mistral-Instruct illustrent des versions ayant subi ce traitement par rapport a leurs versions de base. Pour un DSI, distinguer un modele de base d'un modele instruit est essentiel avant tout deploiement : un modele de base non instruit produit des completions imprevisibles et inadaptees a un usage conversationnel ou d'assistance metier direct, meme s'il conserve un interet pour des usages de fine-tuning specialise ulterieur.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.