Glossaire IA / LLM
643 termes définis, classés par ordre alphabétique.
-
1M Token Context Window
La fenetre de contexte de 1M tokens (environ 750 000 mots, 1500 pages de texte, ou 40 heures d'audio transcrit) represente un changement de paradigme dans les capacites des LLMs. Gemini 1.5 Pro...
-
A/B Testing ML
L'A/B testing ML est une méthode d'expérimentation contrôlée qui compare deux versions d'un modèle de machine learning déployées simultanément en production, chacune exposée à un segment distinct...
-
Accélérateur NPU (Neural Processing Unit)
Un accélérateur NPU, pour Neural Processing Unit, est un circuit intégré spécialisé conçu pour exécuter efficacement les calculs d'inférence de réseaux de neurones directement sur un dispositif...
-
Accélérateur TPU (Tensor Processing Unit)
Un accélérateur TPU, pour Tensor Processing Unit, est un circuit intégré spécifique, ou ASIC, conçu par Google spécifiquement pour accélérer les calculs matriciels massifs utilisés dans...
-
Accumulation de gradient
L'accumulation de gradient est une technique d'entraînement qui simule un lot de données de grande taille sans nécessiter la mémoire GPU correspondante. Plutôt que de calculer les gradients sur un...
-
Activation Patching (Causal Tracing)
L'Activation Patching (aussi appele Causal Tracing) est une technique de mechanistic interpretability qui consiste a intercepter et modifier les activations internes d'un LLM lors d'une inference...
-
Adaptateur QLoRA
QLoRA (Quantized Low-Rank Adaptation) est une methode de reglage fin efficace en parametres, proposee par Dettmers et al. en 2023, qui combine la quantification du modele de base sur 4 bits (via le...
-
Adaptation de domaine (Domain Adaptation)
L'adaptation de domaine est un ensemble de techniques d'apprentissage automatique qui visent à transférer les performances d'un modèle entraîné sur un domaine source vers un domaine cible différent...
-
Adapter Tuning
L'adapter tuning est une technique de PEFT, Parameter-Efficient Fine-Tuning, qui insère de petits modules neuronaux supplémentaires, les adapters, entre les couches d'un grand modèle de langage...
-
Advanced RAG
L'Advanced RAG est une evolution architecturale du Naive RAG qui ajoute des etapes de pre-traitement et post-traitement pour ameliorer la qualite et la robustesse du retrieval. Formalise par Gao et...
-
Adversarial Machine Learning
L'Adversarial Machine Learning est la discipline de recherche qui étudie les vulnérabilités structurelles des systèmes d'apprentissage automatique face à des attaques intentionnelles menées par un...
-
Adversarial Suffix (GCG)
GCG (Greedy Coordinate Gradient) est une technique d'attaque adversariale contre les LLMs proposee par Zou et al. (CMU/UCSD, 2023) dans le paper 'Universal and Transferable Adversarial Attacks on...
-
Agent de correction de bugs automatise
Un agent de correction de bugs automatise est un systeme d'IA agentique capable d'identifier, de diagnostiquer et de corriger un defaut logiciel de maniere autonome ou semi-autonome, en enchainant...
-
Agent de developpement logiciel autonome
Un agent de developpement logiciel autonome, parfois designe par l'acronyme anglais SWE agent, est un agent IA capable de realiser de bout en bout des taches de developpement, comme la correction de...
-
Agent de navigateur controle
Un agent de navigateur controle est un agent IA capable de piloter un navigateur web comme le ferait un utilisateur humain, en cliquant sur des elements, en remplissant des formulaires, en naviguant...
-
Agent de navigation web
Un agent de navigation web est un systeme base sur un modele de langage capable de piloter directement un navigateur, en cliquant sur des liens, en remplissant des formulaires et en interpretant...
-
Agent de recherche web autonome
Un agent de recherche web autonome est un systeme base sur un modele de langage capable de planifier et d'executer de facon independante une sequence de recherches sur internet pour repondre a une...
-
Agent de service client automatise
Un agent de service client automatise est un agent IA integre aux canaux de support d'une entreprise, chat, email ou voix, capable de comprendre les demandes des clients, de consulter les bases de...
-
Agent executeur de code
Un agent executeur de code est un systeme qui associe un modele de langage a un environnement d'execution isole, un sandbox, permettant au modele de generer du code, generalement en Python, de...
-
Agent IA (AI Agent)
Un Agent IA (AI Agent) est un système d'intelligence artificielle autonome combinant un grand modèle de langage à des capacités de perception, de planification et d'exécution d'actions multi-étapes...
-
Agent specialiste
Un agent specialiste est un agent IA concu pour executer un domaine de taches restreint et bien defini, avec un jeu d'outils, un prompt systeme et parfois un modele dedie, optimises pour ce perimetre...
-
Agent superviseur
Un agent superviseur est un agent IA place au sommet d'une architecture multi-agent, charge de decomposer une requete utilisateur, de deleguer les sous-taches aux agents specialistes competents et de...
-
Agent vocal conversationnel
Un agent vocal conversationnel est un agent IA capable de mener un echange oral en temps reel avec un utilisateur, en combinant reconnaissance vocale, comprehension du langage naturel, raisonnement...
-
Agentic AI
L'Agentic AI (IA agentique) désigne un paradigme émergent d'intelligence artificielle où des agents logiciels autonomes, construits autour de grands modèles de langage, planifient et exécutent de...
-
Agentic RAG
Agentic RAG est une evolution du RAG ou le systeme de retrieval est pilote par un agent LLM autonome qui peut utiliser plusieurs outils de recherche (bases vectorielles, moteurs de recherche web...
-
Agents IA (AI Agents)
Les agents IA autonomes, ou AI Agents, sont des systèmes combinant un grand modèle de langage avec des capacités d'action concrètes, accès à des outils externes, appels API, exécution de code, pour...
-
Agents Memory
L'Agent Memory (memoire des agents IA) fait reference aux differents mecanismes permettant aux agents LLM de stocker, recuperer et utiliser des informations au-dela de la fenetre de contexte...
-
AI Safety
L'AI Safety, ou sûreté de l'IA, est un domaine de recherche interdisciplinaire visant à garantir que les systèmes d'intelligence artificielle, en particulier les modèles de grande taille comme les...
-
Alerte de degradation de performance modele
Une alerte de degradation de performance modele est un mecanisme automatise qui notifie les equipes techniques lorsque les indicateurs de qualite d'un modele d'intelligence artificielle en production...
-
Alignement par preference directe DPO
L'alignement par preference directe (Direct Preference Optimization, DPO) est une methode d'alignement des modeles de langage sur les preferences humaines, proposee par Rafailov et al. en 2023, qui...
-
Alignment Problem
Le probleme d'alignement (Alignment Problem) est le defi fondamental en recherche en securite de l'IA (AI Safety) consistant a concevoir des systemes d'intelligence artificielle qui agissent...
-
AlpacaEval
AlpacaEval est un benchmark automatique d'evaluation des assistants LLMs developpe par Dubois et al. (Stanford, 2023), utilisant GPT-4 comme juge pour comparer les reponses de n'importe quel modele a...
-
Analyse de sentiment par LLM
L'analyse de sentiment par LLM est une technique de traitement du langage naturel qui evalue la tonalite emotionnelle ou l'opinion exprimee dans un texte, generalement classee en positive, negative...
-
Annotation par préférence humaine (Human Preference Annotation)
L'annotation par préférence humaine est une méthode de collecte de données dans laquelle des évaluateurs comparent deux ou plusieurs réponses générées par un modèle pour un même prompt et indiquent...
-
Anonymisation pour l'entrainement de modeles
L'anonymisation pour l'entrainement de modeles est le processus consistant a transformer irreversiblement des donnees a caractere personnel pour qu'elles ne permettent plus d'identifier une personne...
-
Apprentissage continu
L'apprentissage continu (continual learning ou lifelong learning) est un paradigme d'apprentissage automatique dans lequel un modele acquiert de nouvelles connaissances ou competences de maniere...
-
Apprentissage federe pour la confidentialite
L'apprentissage federe, ou federated learning, est une technique d'entrainement de modeles d'intelligence artificielle qui permet d'apprendre a partir de donnees reparties sur plusieurs appareils ou...
-
Apprentissage par auto-distillation (Self-distillation)
L'apprentissage par auto-distillation, ou self-distillation, est une technique dans laquelle un modèle apprend à partir de ses propres prédictions, utilisées comme cibles d'entraînement...
-
Apprentissage par curriculum
L'apprentissage par curriculum (curriculum learning) est une strategie d'entrainement des modeles d'apprentissage automatique qui consiste a presenter les exemples d'entrainement dans un ordre...
-
ARC-Challenge
ARC-Challenge (AI2 Reasoning Challenge) est un subset du dataset ARC developpe par l'Allen Institute for AI (AI2), compose de 1172 questions a choix multiples de sciences scolaires (niveau CE2 a...
-
Architecture Mamba
L'architecture Mamba est un modele de sequence base sur les state space models (SSM) selectifs, propose comme alternative au transformeur pour le traitement de longues sequences. Contrairement a...
-
Architecture Transformer
L'architecture Transformer, introduite dans l'article fondateur « Attention Is All You Need » publié par Vaswani et al. en 2017, constitue le fondement architectural de la quasi-totalité des grands...
-
Artificial Analysis (benchmark aggregateur)
Artificial Analysis (artificialanalysis.ai) est une plateforme independante de benchmarking des LLMs et des providers API IA qui mesure simultanement la qualite des modeles (scores sur les benchmarks...
-
Assistant de codage par IA
Un assistant de codage par IA est un outil base sur un grand modele de langage entraine sur du code source qui aide les developpeurs a ecrire, completer et corriger des programmes en temps reel....
-
Attaque de la chaine d'outils d'un agent
L'attaque de la chaine d'outils d'un agent est une technique qui compromet un agent IA en corrompant l'un des composants externes qu'il invoque : plugin, API tierce, connecteur MCP, fonction outillee...
-
Attaque en boîte blanche sur modèle
Une attaque en boite blanche sur modele est une categorie d'attaques adversariales ou l'attaquant dispose d'un acces complet a l'architecture, aux poids et aux gradients du modele cible, ce qui lui...
-
Attaque en boîte noire sur modèle
Une attaque en boite noire sur modele est une categorie d'attaques adversariales ou l'attaquant n'a acces qu'aux entrees et sorties du modele cible, sans connaissance de son architecture interne, de...
-
Attaque évasive sur classifieur
Une attaque evasive sur classifieur est une attaque adversariale menee au moment de l'inference, qui vise a modifier une entree malveillante de facon a ce qu'elle soit classee comme benigne par un...
-
Attaque par deni de service sur modele
L'attaque par deni de service sur modele est une technique visant a rendre un modele d'IA ou son service d'inference indisponible ou inutilisable pour ses utilisateurs legitimes. Elle exploite la...
-
Attaque par epuisement de ressources d'inference
L'attaque par epuisement de ressources d'inference est une forme de deni de service specifique aux systemes d'IA generative, qui vise a saturer les capacites de calcul allouees a l'etape d'inference...
-
Attaque par exemple adversarial
Une attaque par exemple adversarial consiste a modifier legerement une entree soumise a un modele d'IA de maniere a provoquer une erreur de prediction, tout en gardant l'entree quasiment identique a...
-
Attaque par inférence d'appartenance
Une attaque par inference d'appartenance, ou membership inference attack, est une technique qui permet a un adversaire de determiner si un exemple de donnees precis a ete utilise dans le jeu...
-
Attaque par inversion de modèle
Une attaque par inversion de modele, ou model inversion attack, est une technique qui exploite l'acces aux sorties d'un modele d'IA pour reconstruire des informations sur ses donnees d'entrainement...
-
Attaque par porte dérobée sur réseau de neurones
Une attaque par porte derobee sur reseau de neurones, ou backdoor attack, consiste a entrainer ou modifier un modele pour qu'il se comporte normalement sur la grande majorite des entrees, tout en...
-
Attaque par transfert adversarial
Une attaque par transfert adversarial est une technique qui exploite la transferabilite des exemples adversariaux : une perturbation calculee pour tromper un premier modele reste souvent efficace...
-
Attention lineaire
L'attention lineaire designe une famille de variantes du mecanisme d'auto-attention concues pour reduire sa complexite calculatoire, quadratique par rapport a la longueur de la sequence dans...
-
Attention multi-requetes MQA
L'attention multi-requetes, ou MQA (Multi-Query Attention), est une optimisation du mecanisme d'attention multi-tetes dans les transformeurs, ou toutes les tetes d'attention partagent une unique...
-
Attention Sink
Les Attention Sinks (puits d'attention) sont un phenomene decouverts par Xiao et al. (MIT, 2023) dans les Transformers auto-regressifs : les LLMs tendent a concentrer massivement leur attention sur...
-
Attribution de caracteristiques
L'attribution de caracteristiques est une famille de methodes d'explicabilite qui quantifient la contribution de chaque variable d'entree d'un modele d'intelligence artificielle a une prediction...
-
Audio LLM
Un Audio LLM (modele de langage audio) est un modele multimodal qui traite nativement les signaux audio (parole, musique, sons ambiants) en plus du texte, sans pipeline STT (Speech-to-Text)...
-
Audit d'equite de modele
Un audit d'equite de modele est une demarche technique qui evalue si un modele d'intelligence artificielle traite equitablement les differents groupes de personnes affectes par ses decisions, et qui...
-
Audit de biais algorithmique
Un audit de biais algorithmique est un examen technique et methodologique visant a detecter et quantifier des disparites de traitement injustifiees produites par un modele algorithmique ou...
-
Augmentation de données textuelles (Text Data Augmentation)
L'augmentation de données textuelles désigne l'ensemble des techniques qui génèrent des variantes artificielles d'exemples existants afin d'accroître la taille et la diversité d'un jeu d'entraînement...
-
Autoencodeur epars pour interpretabilite
Un autoencodeur epars pour interpretabilite est une architecture de reseau de neurones utilisee en recherche d'interpretabilite mecanistique pour decomposer les activations internes d'un grand modele...
-
Autoencodeur variationnel VAE
Un autoencodeur variationnel, ou VAE (Variational Autoencoder), est un modele generatif compose d'un encodeur et d'un decodeur, entraine a compresser une donnee dans un espace latent probabiliste...
-
AutoGen
AutoGen est un framework open-source de Microsoft Research pour créer des workflows d'agents LLM multi-agents conversationnels, publié en 2023. Il permet de définir des "agents" qui sont des LLMs...
-
Autorite nationale de surveillance IA
Une autorite nationale de surveillance IA est l'organisme designe par chaque Etat membre de l'Union europeenne pour assurer, au niveau national, l'application et le controle du respect de l'AI Act...
-
AWQ (Activation-aware Weight Quantization)
AWQ (Activation-aware Weight Quantization) est un algorithme de quantification post-entraînement pour LLMs développé par Lin et al. (MIT HAN Lab, 2023). Il se distingue de GPTQ par son approche...
-
Bac a sable d'evaluation de securite de modele
Un bac a sable d'evaluation de securite de modele est un environnement isole, sans acces aux systemes de production ni aux donnees reelles sensibles, dans lequel une equipe teste le comportement d'un...
-
Bac a sable reglementaire IA (regulatory sandbox)
Le bac a sable reglementaire IA, ou regulatory sandbox, est un cadre controle mis en place par une autorite nationale competente, prevu par l'AI Act europeen, qui permet a des fournisseurs, notamment...
-
Bascule de retour arriere de modele
La bascule de retour arriere de modele, ou rollback, est le mecanisme qui restaure automatiquement ou manuellement une version anterieure et validee d'un modele d'intelligence artificielle lorsque la...
-
Base de connaissances vectorielle
Une base de connaissances vectorielle est un systeme de stockage et d'indexation ou les documents, ou leurs fragments, sont convertis en vecteurs numeriques par un modele d'embedding, puis organises...
-
Base vectorielle
Une base de données vectorielle est un système de stockage spécialisé, optimisé pour l'indexation et la recherche efficace de vecteurs haute-dimensionnels, ou embeddings, par similarité sémantique...
-
Base Vectorielle (Vector Database)
Une Base Vectorielle (Vector Database) est une base de données spécialisée dans le stockage et l'interrogation d'embeddings, des représentations numériques denses de données textuelles, visuelles ou...
-
Batch Size (LLM Training)
Le Batch Size dans l'entrainement des LLMs est le nombre de sequences d'entrainement utilisees pour calculer les gradients lors de chaque step d'optimisation. C'est un hyperparametre critique qui...
-
Benchmark d'agents SWE-bench
SWE-bench est un benchmark qui evalue la capacite d'un agent IA a resoudre des problemes logiciels reels extraits de depots GitHub open source. Chaque tache correspond a une issue reelle documentee...
-
Benchmark de biais et equite
Un benchmark de biais et equite est un protocole d'evaluation qui mesure les disparites de traitement produites par un modele de langage selon des attributs proteges comme le genre, l'origine...
-
Benchmark de connaissances generales MMLU
MMLU (Massive Multitask Language Understanding) est un benchmark qui evalue les connaissances generales et le raisonnement d'un modele de langage a travers 57 matieres couvrant les sciences, les...
-
Benchmark de generation de code HumanEval-X
HumanEval-X est un benchmark d'evaluation de la generation de code qui etend le jeu de donnees original HumanEval, initialement limite au Python, a plusieurs langages de programmation dont C++, Java...
-
Benchmark de raisonnement de sens commun
Un benchmark de raisonnement de sens commun est un jeu d'evaluation qui mesure la capacite d'un modele de langage a mobiliser des connaissances implicites sur le monde physique et social, du type que...
-
Benchmark de raisonnement mathematique
Un benchmark de raisonnement mathematique est un jeu d'evaluation standardise qui mesure la capacite d'un modele de langage a resoudre des problemes numeriques et logiques necessitant un enchainement...
-
Benchmark de securite des modeles
Un benchmark de securite des modeles est un protocole d'evaluation qui mesure la resistance d'un modele de langage aux usages malveillants et aux comportements non desires : generation de contenu...
-
Benchmark de tenue de conversation
Un benchmark de tenue de conversation est un protocole d'evaluation qui mesure la capacite d'un modele de langage a maintenir une interaction coherente sur plusieurs tours d'echange, en preservant le...
-
Benchmark multilingue
Un benchmark multilingue est un jeu d'evaluation qui mesure la performance d'un modele de langage a travers plusieurs langues, permettant de detecter les ecarts de qualite souvent significatifs entre...
-
BF16 (BFloat16)
BF16 (BFloat16 ou Brain Floating Point 16) est un format de representation numerique en virgule flottante 16 bits developpe par Google Brain, utilise massivement pour l'entrainement et l'inference...
-
BFCL (Berkeley Function Calling Leaderboard)
BFCL (Berkeley Function Calling Leaderboard) est un benchmark de reference pour evaluer la capacite des LLMs a appeler correctement des fonctions/outils (function calling ou tool use), une competence...
-
Bi-Encoder (Dense Retriever)
Un Bi-Encoder (ou dense retriever) est un modele qui encode independamment la requete et les documents en vecteurs de haut dimension (embeddings), puis calcule la pertinence par similarite cosinus ou...
-
Biais Algorithmique
Le biais algorithmique désigne une erreur systématique et reproductible dans les sorties d'un modèle d'intelligence artificielle, causée par des données d'entraînement non représentatives, des choix...
-
Bibliothèque DeepSpeed
DeepSpeed est une bibliothèque open source développée par Microsoft pour optimiser l'entraînement et l'inférence de modèles de deep learning à grande échelle, en particulier les grands modèles de...
-
Bibliothèque Megatron-LM
Megatron-LM est une bibliothèque open source développée par NVIDIA pour l'entraînement de très grands modèles de langage de type transformer sur des clusters GPU. Elle a introduit et popularisé le...
-
BIG-Bench
BIG-Bench (Beyond the Imitation Game Benchmark) est une suite de benchmarks collaboratifs publiee par Srivastava et al. (2022) avec plus de 450 auteurs de 132 institutions, comprenant 204 taches...
-
bitsandbytes
bitsandbytes (bnb) est une bibliotheque Python open-source developpee par Tim Dettmers (University of Washington) qui implémente des algorithmes de quantisation 8-bit (LLM.int8()) et 4-bit (NF4, FP4)...
-
BM25
BM25 (Best Match 25) est un algorithme de ranking de documents pour la recherche d'information, développé par Robertson et Jones dans les années 1990 et toujours considéré comme l'algorithme de...
-
Boucle d'auto-amelioration d'agent
La boucle d'auto-amelioration d'agent est un cycle par lequel un agent IA evalue ses propres resultats, identifie ses erreurs et ajuste son comportement futur sans intervention humaine directe a...
-
Boucle de reflexion agent
La boucle de reflexion agent est un mecanisme dans lequel un systeme base sur un modele de langage evalue de facon critique sa propre sortie, action ou raisonnement intermediaire, avant de poursuivre...
-
Boucle ReAct raisonnement et action
La boucle ReAct, contraction de Reasoning and Acting, est un pattern d'architecture agentique publie par des chercheurs de Google en 2022 qui structure le fonctionnement d'un agent base sur un modele...
-
BPE (Byte Pair Encoding)
Le Byte Pair Encoding (BPE) est l'algorithme de tokenisation le plus largement utilisé dans les grands modèles de langage modernes : GPT-2, GPT-3, GPT-4 (via Tiktoken), LLaMA, Mistral, Qwen, DeepSeek...
-
Bradley-Terry Model
Le modele de Bradley-Terry est un modele probabiliste de classement base sur des comparaisons par paires, utilise comme fondement mathematique des systemes de classement ELO appliques aux LLMs dans...
-
Budget de cout d'inference
Le budget de cout d'inference est le plafond financier ou technique alloue a l'execution des predictions d'un modele d'intelligence artificielle en production, exprime en cout par requete, par...
-
Bureau europeen de l'IA (AI Office)
Le Bureau europeen de l'IA, ou AI Office, est l'organe cree par la Commission europeenne en 2024 pour superviser la mise en oeuvre et l'application de l'AI Act au niveau de l'Union, avec une...
-
Bus de messages inter-agents
Un bus de messages inter-agents est une infrastructure de communication qui permet a plusieurs agents IA d'echanger des informations, des resultats intermediaires et des demandes de delegation de...
-
Cache de valeurs-clés paginé (PagedAttention)
Le cache de valeurs-clés paginé, popularisé sous le nom PagedAttention par le moteur d'inférence vLLM, est une méthode de gestion mémoire pour le cache de valeurs-clés, ou KV cache, des grands...
-
Cadre de gestion des risques IA du NIST (NIST AI RMF)
Le cadre de gestion des risques IA du NIST, ou NIST AI Risk Management Framework, est un referentiel volontaire publie en janvier 2023 par le National Institute of Standards and Technology americain...
-
Cadre MITRE ATLAS
Le cadre MITRE ATLAS, pour Adversarial Threat Landscape for Artificial-Intelligence Systems, est une base de connaissances publique developpee par MITRE qui recense les tactiques, techniques et...
-
Calcul multipartite securise pour l'IA
Le calcul multipartite securise, ou secure multi-party computation, est une famille de protocoles cryptographiques permettant a plusieurs parties de calculer conjointement une fonction, par exemple...
-
Canary Deployment ML
Le Canary Deployment ML est une stratégie de mise en production progressive d'un nouveau modèle de machine learning, consistant à l'exposer initialement à une fraction restreinte du trafic réel —...
-
Carte de saillance
Une carte de saillance, ou saliency map, est une representation visuelle qui met en evidence les regions d'une image ou les segments d'un signal d'entree ayant le plus influence la decision d'un...
-
Catalogue de competences agent
Un catalogue de competences agent est un repertoire structure qui documente les capacites fonctionnelles disponibles au sein d'un ecosysteme d'agents IA, comme la redaction, la recherche...
-
Chain of Thought (CoT)
Le Chain of Thought, ou CoT, est une technique de prompting qui incite explicitement un grand modèle de langage à décomposer son raisonnement en une suite d'étapes intermédiaires exposées avant de...
-
Chain-of-Thought Prompting
Le Chain-of-Thought Prompting est une technique de conception de prompts pour les grands modèles de langage (LLM) qui consiste à inciter explicitement le modèle à dérouler un raisonnement...
-
Chain-of-Thought Scaling
Le Chain-of-Thought Scaling (mise a l'echelle du raisonnement) est le phenomene selon lequel les performances des LLMs sur des taches complexes s'ameliorent de maniere mesurable avec la longueur (et...
-
Chaine de pensee latente
La chaine de pensee latente (latent chain-of-thought) designe un mecanisme par lequel un modele de langage effectue un raisonnement multi-etapes dans son espace de representation interne (les...
-
Charte d'usage responsable de l'IA
Une charte d'usage responsable de l'IA est un document de gouvernance interne par lequel une organisation formalise les principes, les regles et les limites qu'elle s'impose dans le developpement...
-
Chatbot d'entreprise sur donnees internes
Un chatbot d'entreprise sur donnees internes est un agent conversationnel qui repond aux questions des employes ou des clients en s'appuyant exclusivement sur la base de connaissances propre a...
-
Checkpoint d'entraînement (Training Checkpoint)
Un checkpoint d'entraînement est une sauvegarde intermédiaire de l'état complet d'un modèle en cours d'entraînement, incluant les valeurs de ses paramètres, l'état de l'optimiseur, le pas...
-
Chiffrement homomorphe pour l'inference
Le chiffrement homomorphe pour l'inference est une technique cryptographique permettant d'effectuer des calculs, notamment l'inference d'un modele d'intelligence artificielle, directement sur des...
-
Chinchilla Scaling
Les Chinchilla Scaling Laws sont des lois d'echelle publiees par Hoffmann et al. (DeepMind, 2022) dans le paper 'Training Compute-Optimal Large Language Models'. En analysant systematiquement la...
-
Chunk Overlap (RAG)
Le Chunk Overlap (chevauchement de chunks) est un parametre du decoupage documentaire (chunking) dans les pipelines RAG qui specifie le nombre de tokens ou caracteres qui se repetent entre deux...
-
Chunking
Le Chunking est la stratégie de découpage de documents sources en segments, ou chunks, destinés à être indexés individuellement dans un pipeline RAG, une étape déterminante dont la granularité et la...
-
Circuits (Mechanistic Interpretability)
Les Circuits, dans le contexte de la mechanistic interpretability, sont des sous-graphes du reseau de neurones (combinaisons de couches d'attention et FFN connectees par des residual streams) qui...
-
Classification de documents par LLM
La classification de documents par LLM est une methode qui utilise un grand modele de langage pour attribuer automatiquement une ou plusieurs categories predefinies a un document, un email ou un...
-
Classifieur de garde-fou d'entree
Un classifieur de garde-fou d'entree est un modele de detection place en amont d'un systeme d'IA generative pour analyser les requetes des utilisateurs avant qu'elles n'atteignent le modele...
-
Classifieur de garde-fou de sortie
Un classifieur de garde-fou de sortie est un modele de controle place en aval d'un systeme d'IA generative pour analyser les reponses produites avant leur diffusion a l'utilisateur final. Il verifie...
-
CLIP (Contrastive Language-Image Pre-training)
CLIP (Contrastive Language-Image Pre-training) est un modele de vision fondateur developpe par OpenAI (Radford et al., 2021) qui apprend a associer des images et des descriptions textuelles via un...
-
Clonage de voix par IA
Le clonage de voix par IA est une technique qui reproduit les caracteristiques vocales specifiques d'une personne, timbre, accent, rythme et intonation, a partir d'un echantillon audio de reference...
-
Code de conduite pour l'IA generative
Un code de conduite pour l'IA generative est un instrument d'autoregulation, encourage par l'AI Act europeen, que les fournisseurs de systemes d'IA elaborent seuls ou collectivement, souvent en lien...
-
Comite d'ethique de l'IA
Un comite d'ethique de l'IA est une instance de gouvernance interne, generalement pluridisciplinaire, chargee d'examiner les implications ethiques des projets d'intelligence artificielle d'une...
-
Compilateur TensorRT
TensorRT est un compilateur et moteur d'exécution développé par NVIDIA pour optimiser l'inférence de modèles de deep learning sur les GPU NVIDIA. Il prend en entrée un modèle entraîné, souvent au...
-
Completion de code contextuelle
La completion de code contextuelle est une fonctionnalite d'assistance au developpement qui propose la suite probable d'une ligne ou d'un bloc de code en s'appuyant sur le contexte immediat : fichier...
-
Compression de modèle par élagage structuré (Structured Pruning)
La compression de modèle par élagage structuré est une technique de réduction de la taille d'un réseau de neurones qui supprime des blocs entiers et cohérents de paramètres, comme des neurones...
-
Compression de prompt
La compression de prompt est un ensemble de techniques visant a reduire la longueur du texte envoye en entree d'un modele de langage tout en preservant l'information essentielle necessaire a la...
-
Compression du cache KV
La compression du cache KV désigne un ensemble de techniques visant à réduire la taille du cache de valeurs-clés d'un grand modèle de langage en mémoire GPU lors de l'inférence, ce cache croissant...
-
Confidential Computing ML
Le Confidential Computing pour le Machine Learning est l'utilisation de Trusted Execution Environments (TEE) — des enclaves materielles isolees et chiffrees au niveau du processeur — pour executer...
-
Confidentialite differentielle
La confidentialite differentielle, ou differential privacy, est une definition mathematique rigoureuse de la protection de la vie privee qui garantit que la presence ou l'absence d'un individu unique...
-
Consentement pour l'entrainement de modeles
Le consentement pour l'entrainement de modeles designe l'autorisation donnee par une personne pour que ses donnees a caractere personnel soient utilisees afin d'entrainer un modele d'intelligence...
-
Consolidation de memoire d'agent
La consolidation de memoire d'agent est le processus par lequel un agent IA transforme des informations volatiles issues de sa memoire de travail ou d'episodes recents en connaissances durables...
-
Constitutional AI
Constitutional AI (CAI) est une methode d'alignment des LLMs developpee par Anthropic (Bai et al., 2022) qui utilise un ensemble explicite de principes ethiques et comportementaux (la 'Constitution')...
-
Contestabilite d'une decision algorithmique
La contestabilite d'une decision algorithmique est la capacite offerte a une personne affectee par une decision issue d'un systeme automatise de la remettre en cause et d'obtenir un reexamen...
-
Context Window (Fenêtre de Contexte)
La Context Window, ou fenêtre de contexte, désigne la quantité maximale de tokens qu'un grand modèle de langage (LLM) peut traiter simultanément au sein d'un seul appel, englobant à la fois le prompt...
-
Continual Pre-training
Le Continual Pre-training (aussi appele Domain-Adaptive Pre-training ou DAPT) est la technique consistant a reprendre le pre-entrainement d'un LLM de base sur un corpus de donnees domaine-specifiques...
-
Continuous Batching
Le Continuous Batching (aussi appelé Dynamic Batching ou Iteration-level Scheduling) est une technique d'optimisation pour les serveurs d'inférence LLM qui améliore drastiquement l'utilisation GPU et...
-
Continuous Training (ML)
Le Continuous Training, ou entraînement continu, désigne la pratique consistant à réentraîner régulièrement et automatiquement un modèle de machine learning en production à partir de nouvelles...
-
Contournement de garde-fou par encodage
Le contournement de garde-fou par encodage est une technique de jailbreak qui consiste a transformer une requete malveillante destinee a un grand modele de langage - via base64, ROT13, langage leet...
-
Controle qualite automatise par IA
Le controle qualite automatise par IA est un ensemble de methodes qui remplacent ou completent l'inspection humaine dans les processus de production en utilisant des modeles de vision par ordinateur...
-
ControlNet
ControlNet est une extension des modèles de diffusion, introduite en 2023 par Lvmin Zhang, permettant de conditionner précisément la génération d'images via des signaux structurels additionnels comme...
-
Copilote metier sectoriel
Un copilote metier sectoriel est un assistant d'IA generative specialise, concu pour un secteur d'activite ou une fonction precise, integrant un vocabulaire, des workflows et des sources de...
-
Corrective RAG (CRAG)
Corrective RAG (CRAG) est une technique RAG proposee par Yan et al. (2024) qui ajoute une etape d'evaluation de la qualite du retrieval et une correction automatique quand les documents recuperes...
-
Cosine Similarity
La Cosine Similarity, ou similarité cosinus, est une mesure mathématique de similarité entre deux vecteurs non nuls dans un espace multidimensionnel, calculée comme le cosinus de l'angle formé entre...
-
Cout par million de jetons
Le cout par million de jetons est l'unite tarifaire standard utilisee par les fournisseurs d'API de modeles de langage pour facturer l'usage de leurs services, distinguant generalement le prix des...
-
CrewAI
CrewAI est un framework open-source pour créer et orchestrer des équipes d'agents LLM collaboratifs, conçu pour imiter les structures organisationnelles humaines. Lancé par João Moura en 2024, il...
-
Cross-Attention
Le Cross-Attention (ou attention croisée) est un mécanisme d'attention dans lequel les queries proviennent d'une séquence source et les keys/values d'une autre séquence cible. Contrairement au...
-
Cross-Encoder (Reranker)
Un Cross-Encoder (ou reranker) est un modele de classement de pertinence qui prend en entree la paire (requete, document) concatenee et produit un score de pertinence unique, contrairement aux...
-
Cycle de vie du modele en production
Le cycle de vie du modele en production designe l'ensemble des etapes traversees par un modele d'intelligence artificielle depuis sa conception jusqu'a son retrait, en passant par son deploiement...
-
DALL-E
DALL-E est une famille de modeles de generation d'images par IA developpes par OpenAI, utilisant des techniques de diffusion et d'apprentissage auto-supervise pour creer des images realistes a partir...
-
DAN (Do Anything Now)
DAN ('Do Anything Now') est le nom d'une famille de techniques de jailbreak pour les LLMs, popularisee sur Reddit en 2022-2023. Le principe est de demander au modele de jouer le role d'un alter-ego...
-
Data Curation
La Data Curation (curation des donnees) est l'ensemble des processus de selection, nettoyage, filtrage et validation des donnees d'entrainement des LLMs. La qualite des donnees est reconnue comme le...
-
Data Parallelism
Le Data Parallelism (DP) est la technique la plus fondamentale de parallelisme pour l'entrainement des LLMs : plusieurs copies identiques du modele sont maintenues sur differents GPUs, chaque...
-
Data Poisoning
Le Data Poisoning, ou empoisonnement de données, est une attaque ciblant les systèmes d'apprentissage automatique qui consiste à corrompre intentionnellement les données utilisées lors de la phase...
-
Debit de generation en jetons par seconde
Le debit de generation en jetons par seconde mesure la vitesse a laquelle un modele de langage produit sa reponse une fois la generation demarree, exprime en nombre de jetons emis chaque seconde. Cet...
-
Declencheur de reentrainement sur derive
Un declencheur de reentrainement sur derive est un mecanisme de surveillance automatise qui detecte une degradation statistique significative des donnees traitees ou des performances d'un modele en...
-
Déclencheur de trojan neuronal
Un declencheur de trojan neuronal, ou neural trojan trigger, est le motif specifique - visuel, textuel ou sonore - qui active le comportement malveillant cache dans un reseau de neurones compromis...
-
Décodage par lots continus (Continuous Batching)
Le décodage par lots continus, ou continuous batching, est une technique d'ordonnancement utilisée par les serveurs d'inférence de grands modèles de langage pour maximiser l'utilisation des GPU en...
-
Décodage spéculatif
Le décodage spéculatif est une technique d'accélération de l'inférence des grands modèles de langage qui utilise un petit modèle rapide, dit modèle brouillon, pour proposer plusieurs tokens candidats...
-
Decoder-Only Architecture
L'architecture Decoder-Only (décodeur seul) est le design dominant de tous les grands modèles de langage génératifs modernes : GPT-4, Claude, LLaMA, Mistral, Gemma, Qwen, DeepSeek — ils utilisent...
-
Decomposition de tache en sous-taches
La decomposition de tache en sous-taches est le processus par lequel un agent IA fractionne un objectif complexe en unites de travail plus simples, executables sequentiellement ou en parallele. Cette...
-
Decomposition en valeurs singulieres pour adaptation
La decomposition en valeurs singulieres pour adaptation designe le principe mathematique sous-jacent a LoRA (Low-Rank Adaptation), methode de reglage fin efficace en parametres proposee par Hu et al....
-
Deduplication (LLM Data)
La deduplication est une etape essentielle du pipeline de curation de donnees pour les LLMs, consistant a identifier et supprimer les contenus dupliques ou quasi-dupliques du corpus d'entrainement....
-
Déduplication sémantique de corpus (Semantic Deduplication)
La déduplication sémantique de corpus est une technique de nettoyage des données d'entraînement qui identifie et retire les documents proches en sens, même lorsqu'ils ne sont pas identiques au niveau...
-
Deep Learning
Le Deep Learning, ou apprentissage profond, est une branche du machine learning utilisant des réseaux de neurones artificiels à plusieurs couches empilées pour apprendre automatiquement des...
-
Deepfake
Un Deepfake est un contenu multimédia — vidéo, audio, image — généré ou manipulé par des techniques d'intelligence artificielle, typiquement des réseaux antagonistes génératifs (GAN) ou des modèles...
-
DeepSpeed ZeRO
DeepSpeed ZeRO (Zero Redundancy Optimizer) est un framework d'optimisation pour l'entraînement distribué de très grands modèles de deep learning, développé par Microsoft Research. Il permet...
-
Delegation de tache entre agents
La delegation de tache entre agents designe le mecanisme par lequel un agent IA orchestrateur confie l'execution d'une sous-tache a un autre agent, specialise dans un domaine ou dote d'outils...
-
Dense Model (vs MoE)
Un Dense Model (modele dense) est un LLM ou l'integralite des parametres du modele est activee et utilise pour traiter chaque token, en opposition aux modeles Mixture of Experts (MoE) qui n'activent...
-
Deploiement bleu-vert de modele
Le deploiement bleu-vert de modele est une strategie de mise en production qui maintient deux environnements identiques et pleinement operationnels, l'un dit bleu executant la version actuelle du...
-
Deploiement canari de modele
Le deploiement canari de modele est une strategie de mise en production qui expose une nouvelle version d'un modele d'intelligence artificielle a une fraction restreinte du trafic reel, generalement...
-
Detection d'anomalies visuelles par IA
La detection d'anomalies visuelles par IA est une technique de vision par ordinateur qui identifie automatiquement des ecarts par rapport a un motif visuel de reference, defaut de surface...
-
Detection d'hallucination automatisee
La detection d'hallucination automatisee est un ensemble de techniques qui identifient, sans intervention humaine systematique, les affirmations produites par un modele de langage qui sont fausses...
-
Detection de contenu genere par IA
La detection de contenu genere par IA regroupe les methodes techniques permettant d'identifier si un texte, une image, un audio ou une video ont ete produits, en tout ou partie, par un systeme...
-
Detection de fraude par apprentissage automatique
La detection de fraude par apprentissage automatique est une application de machine learning qui identifie des transactions, comportements ou demandes suspectes en analysant des patterns statistiques...
-
Detournement d'agent autonome
Le detournement d'agent autonome designe la manipulation d'un agent IA pour lui faire executer des actions non prevues par son operateur, en exploitant sa capacite a planifier et a agir de maniere...
-
Diffusion Models
Les Diffusion Models sont une classe de modèles génératifs, à l'origine de Stable Diffusion, DALL-E ou Midjourney, qui apprennent à générer des données de haute qualité en inversant progressivement...
-
Direction de caracteristique latente
La direction de caracteristique latente est un vecteur dans l'espace des activations d'un reseau de neurones dont l'orientation correspond a un concept semantique specifique, comme la positivite d'un...
-
Distillation de connaissances mutuelle (Mutual Knowledge Distillation)
La distillation de connaissances mutuelle est une variante de la distillation de connaissances dans laquelle deux modèles, ou plus, s'entraînent simultanément en s'échangeant leurs prédictions comme...
-
Distillation de modèle
La distillation de modèle, ou knowledge distillation, est une technique de compression dans laquelle un petit modèle, dit élève, apprend à reproduire le comportement d'un grand modèle pré-entraîné...
-
Document Understanding
Le Document Understanding (comprehension de documents) est un domaine de l'IA qui combine la vision par ordinateur, l'OCR et les LLMs pour extraire et raisonner sur les informations contenues dans...
-
Documentation technique AI Act
La documentation technique AI Act designe l'ensemble des documents que l'AI Act europeen, reglement UE 2024/1689, impose aux fournisseurs de systemes d'IA a haut risque d'etablir et de tenir a jour...
-
DPO (Direct Preference Optimization)
Le Direct Preference Optimization (DPO) est une méthode d'alignement des LLMs sur les préférences humaines proposée par Rafailov et al. (Stanford, 2023) comme alternative directe et simplifiée au...
-
Droit a l'explication d'une decision automatisee
Le droit a l'explication d'une decision automatisee est la prerogative reconnue a une personne d'obtenir des informations comprehensibles sur la logique d'une decision prise, exclusivement ou de...
-
Droit d'opposition au profilage
Le droit d'opposition au profilage est la prerogative reconnue par le RGPD, a son article 21, permettant a une personne de s'opposer, pour des raisons tenant a sa situation particuliere, a un...
-
Dynamic Batching
Le Dynamic Batching (batching dynamique) est une technique d'optimisation du serving LLM qui regroupe automatiquement plusieurs requetes clients arrivant independamment en batches pour l'inference...
-
Echantillonneur DDIM
DDIM (Denoising Diffusion Implicit Models) est un algorithme d'echantillonnage propose par Song, Meng et Ermon en 2020 qui accelere la generation d'images par les modeles de diffusion en remplacant...
-
Edge AI
L'Edge AI désigne le déploiement et l'exécution de modèles d'intelligence artificielle directement sur des appareils physiques situés en périphérie du réseau — smartphones, capteurs IoT, caméras de...
-
Élagage non structuré (Unstructured Pruning)
L'élagage non structuré est une technique de compression de modèle qui met à zéro des poids individuels d'un réseau de neurones, sélectionnés selon un critère d'importance comme leur magnitude, sans...
-
ELO Rating dans les LLMs
Le systeme ELO Rating, adapte des echecs pour le classement des LLMs, est utilise dans les 'chatbot arenas' ou des evaluateurs humains comparent les reponses de deux LLMs anonymes et votent pour le...
-
Embedding
Un Embedding est une représentation vectorielle dense d'un concept — mot, phrase, document, image, ou tout autre type de donnée — dans un espace mathématique continu de dimension fixe, généralement...
-
Embeddings
Les embeddings sont des représentations vectorielles numériques et continues de données, texte, images, code ou audio, projetées dans un espace latent multidimensionnel de dimension fixe, typiquement...
-
Embeddings multi-vecteurs
Les embeddings multi-vecteurs sont une representation d'un document ou d'une requete par plusieurs vecteurs plutot qu'un seul, chaque vecteur capturant un fragment ou un token du texte. L'approche de...
-
Emergent Abilities
Les Emergent Abilities (capacites emergentes) designent des comportements ou capacites d'un LLM qui n'existent pas pour les modeles de petite taille et apparaissent abruptement a partir d'un certain...
-
Empoisonnement de données d'entraînement ciblé
L'empoisonnement de donnees d'entrainement cible est une attaque qui consiste a injecter des exemples malveillants specifiquement concus dans le jeu de donnees d'apprentissage d'un modele d'IA, afin...
-
Empoisonnement de la chaîne d'approvisionnement de modèles
L'empoisonnement de la chaine d'approvisionnement de modeles est une attaque qui compromet un composant IA en amont de son integration finale : jeu de donnees public, modele pre-entraine partage sur...
-
Enclave securisee pour modeles
Une enclave securisee pour modeles est une implementation concrete d'environnement d'execution de confiance dediee a la protection des modeles d'intelligence artificielle, en particulier de leurs...
-
Encoder-Decoder Architecture
L'architecture Encoder-Decoder (aussi appelee Seq2Seq Transformer) utilise les deux blocs du Transformer original de Vaswani et al. (2017) : un encodeur qui produit une representation contextuelle de...
-
Encoder-Only Architecture
L'architecture Encoder-Only (uniquement encodeur) est une sous-famille des Transformers qui utilise uniquement les couches d'encodeur avec attention bidirectionnelle pour produire des representations...
-
Encodeur de texte contrastif CLIP
CLIP (Contrastive Language-Image Pre-training) est un modele developpe par OpenAI en 2021 qui apprend a associer des images et des descriptions textuelles dans un espace vectoriel commun, via un...
-
Enrichissement de chunk par contexte
L'enrichissement de chunk par contexte, ou contextual retrieval, est une technique qui consiste a ajouter automatiquement, avant indexation, une courte description de contexte generee par un modele...
-
Entraînement avec ZeRO (Zero Redundancy Optimizer)
L'entraînement avec ZeRO, pour Zero Redundancy Optimizer, est une technique d'optimisation mémoire développée par Microsoft et intégrée à la bibliothèque DeepSpeed, qui élimine la redondance des...
-
Entraînement en précision FP8 (FP8 Training)
L'entraînement en précision FP8 est une technique qui utilise un format numérique à virgule flottante sur huit bits pour représenter les poids, les activations ou les gradients d'un réseau de...
-
Entraînement par curriculum de données (Curriculum Learning)
L'entraînement par curriculum de données est une stratégie qui ordonne délibérément les exemples présentés à un modèle pendant l'entraînement, du plus simple au plus complexe, plutôt que de les tirer...
-
Environnement d'agent isole
Un environnement d'agent isole est une infrastructure d'execution cloisonnee, dediee a un agent IA, qui limite strictement ses acces reseau, fichiers et systemes afin de contenir les consequences...
-
Environnement d'execution de confiance pour IA
Un environnement d'execution de confiance, ou trusted execution environment, TEE, pour IA est une zone isolee et securisee au sein du processeur d'une machine, dans laquelle le code et les donnees...
-
Equilibrage de charge entre modeles
L'equilibrage de charge entre modeles est une technique d'infrastructure qui repartit les requetes entrantes vers plusieurs instances ou plusieurs modeles d'intelligence artificielle disponibles...
-
Equipe rouge de systeme d'IA
Une equipe rouge de systeme d'IA, ou AI red team, est un groupe d'experts charge de simuler des attaques reelles contre un modele ou une application d'IA generative afin d'identifier ses...
-
Espace Latent (Latent Space)
L'espace latent, ou latent space, désigne la représentation interne compressée et continue dans laquelle un réseau de neurones encode les données d'entrée après avoir appris à en extraire les...
-
Étiquetage assisté par modèle (Model-assisted Labeling)
L'étiquetage assisté par modèle est un processus d'annotation de données dans lequel un modèle d'intelligence artificielle propose une première étiquette, une catégorie ou une réponse, qu'un...
-
Évaluation continue en production
L'evaluation continue en production designe le suivi permanent des performances d'un modele d'IA une fois deploye, par opposition a l'evaluation ponctuelle realisee avant sa mise en service. Elle...
-
Evaluation d'impact algorithmique
Une evaluation d'impact algorithmique est une demarche structuree qui analyse en amont les consequences potentielles, positives et negatives, d'un systeme algorithmique ou d'intelligence artificielle...
-
Évaluation de la calibration du modèle
L'evaluation de la calibration du modele est une analyse qui verifie si les scores de confiance produits par un modele d'IA refletent reellement la probabilite que sa prediction soit correcte. Un...
-
Evaluation de la coherence factuelle
L'evaluation de la coherence factuelle verifie qu'un texte genere par un modele de langage, notamment un resume ou une reponse fondee sur un document source, ne contredit pas et ne deforme pas les...
-
Evaluation de la pertinence de recuperation
L'evaluation de la pertinence de recuperation est le processus qui mesure la capacite d'un systeme de recherche, notamment le composant de recuperation d'une architecture RAG, a retrouver les...
-
Evaluation humaine par paires
L'evaluation humaine par paires est une methode de jugement de qualite ou des evaluateurs comparent deux reponses generees pour un meme prompt, issues de deux modeles ou versions differentes, et...
-
Evaluation par correspondance exacte
L'evaluation par correspondance exacte, ou exact match, est une metrique d'evaluation qui verifie si la reponse generee par un modele correspond mot pour mot, ou apres normalisation minimale (casse...
-
Evaluation par preference Elo
L'evaluation par preference Elo est une methode de classement des modeles de langage adaptee du systeme de notation utilise aux echecs, ou chaque modele possede un score numerique ajuste apres chaque...
-
Evaluation par similarite semantique BERTScore
BERTScore mesure la similarite semantique entre un texte genere par un modele et un texte de reference, en comparant leurs vecteurs contextuels produits par un modele de type BERT, plutot qu'en...
-
Evaluation prealable de conformite IA
L'evaluation prealable de conformite IA est l'analyse menee avant le deploiement d'un systeme d'intelligence artificielle afin de verifier son adequation avec les obligations legales applicables...
-
Evaluation reference-free
L'evaluation reference-free note la qualite d'une reponse d'un modele de langage sans reponse de reference preetablie. Contrairement aux metriques classiques comme BLEU ou ROUGE, qui mesurent un...
-
Exercice de simulation d'attaque sur agent
Un exercice de simulation d'attaque sur agent est une campagne de test controlee visant a evaluer la resilience d'un agent IA autonome face a des scenarios de compromission realistes, en...
-
Exfiltration de données via agent IA
L'exfiltration de donnees via agent IA est une attaque qui exploite les capacites d'action autonome d'un agent base sur un grand modele de langage - acces a des outils, navigation web, envoi...
-
ExLlamaV2
ExLlamaV2 est un moteur d'inference LLM open-source developpe par turboderp, optimise pour les GPU NVIDIA et utilisant un format de quantisation proprietaire EXL2 (ExLlama quantization v2). Il est...
-
Experimentation de modeles trackee
L'experimentation de modeles trackee est une pratique du machine learning qui enregistre de maniere systematique et reproductible chaque essai realise pendant le developpement d'un modele...
-
Explicabilite locale LIME
L'explicabilite locale LIME, pour Local Interpretable Model-agnostic Explanations, est une methode d'explicabilite qui approxime le comportement d'un modele complexe et opaque, comme un reseau de...
-
Explicabilite par valeurs de Shapley
L'explicabilite par valeurs de Shapley est une methode d'interpretabilite de modeles d'intelligence artificielle qui attribue a chaque caracteristique d'entree une contribution numerique a une...
-
Extended Thinking
L'Extended Thinking (raisonnement etendu) est un mode de generation introduit par Anthropic dans Claude 3.7 Sonnet (2025) qui permet au modele de generer un 'thinking process' visible (chaine de...
-
Extraction d'entites nommees par LLM
L'extraction d'entites nommees par LLM, ou named entity recognition, est une tache de traitement du langage naturel qui consiste a identifier et categoriser dans un texte les mentions d'entites...
-
Extraction d'information structuree par LLM
L'extraction d'information structuree par LLM est une technique qui consiste a utiliser un grand modele de langage pour identifier et extraire des donnees precises depuis un texte non structure, un...
-
Extraction de texte de documents PDF
L'extraction de texte de documents PDF est le processus qui consiste a convertir le contenu d'un fichier PDF, souvent mise en page de facon complexe avec colonnes, tableaux, images et en-tetes, en...
-
Feature Store
Un Feature Store est une infrastructure MLOps dédiée au stockage, à la gestion et à la mise à disposition centralisée des variables d'entrée, dites features, utilisées pour l'entraînement et...
-
Feature Visualization (Interpretabilite)
La Feature Visualization est une technique de mechanistic interpretability qui genere synthetiquement les inputs qui maximisent l'activation d'un neurone, d'un canal ou d'une direction dans l'espace...
-
Federated Learning
Le Federated Learning (apprentissage federe) est un paradigme d'entrainement dans lequel le modele est entraine sur des donnees distribuees sur de multiples appareils ou serveurs, sans jamais...
-
Feed-Forward Network (FFN)
Le Feed-Forward Network (FFN), aussi appelé MLP (Multi-Layer Perceptron) dans ce contexte, est le deuxième sous-composant majeur de chaque bloc Transformer, après le mécanisme d'attention. Il traite...
-
Fenêtre de contexte glissante en inférence
La fenêtre de contexte glissante en inférence, ou sliding window attention, est une technique qui limite le calcul d'attention d'un modèle de langage à une fenêtre de taille fixe de tokens récents...
-
Few-Shot Learning
Le Few-Shot Learning désigne la capacité d'un modèle d'intelligence artificielle à apprendre à réaliser une nouvelle tâche à partir d'un très petit nombre d'exemples fournis en contexte, typiquement...
-
Fiche de risque de systeme d'IA
Une fiche de risque de systeme d'IA est un document de gouvernance qui documente de maniere structuree les risques identifies pour un modele ou une application d'intelligence artificielle donnee...
-
Fiche de transparence de systeme d'IA (model card)
La fiche de transparence de systeme d'IA, ou model card, est un document standardise qui accompagne un modele d'intelligence artificielle publie ou deploye, decrivant ses caracteristiques techniques...
-
Fiche nutritionnelle de jeu de donnees (datasheet for datasets)
La fiche nutritionnelle de jeu de donnees, traduction du terme anglais datasheet for datasets popularise par Timnit Gebru et ses coauteurs en 2018, est un document standardise qui accompagne un jeu...
-
Filigrane de contenu genere par IA
Le filigrane de contenu genere par IA, ou watermarking, est un procede technique qui insere une marque imperceptible dans un texte, une image, un audio ou une video produits par un modele generatif...
-
Filtrage de contenu toxique dans les données (Toxicity Filtering)
Le filtrage de contenu toxique dans les données est un traitement appliqué aux corpus d'entraînement pour retirer ou déclasser les textes contenant des propos haineux, violents, discriminatoires ou...
-
Filtre de securite de contenu
Un filtre de securite de contenu est un mecanisme technique integre a un systeme d'IA generative qui detecte et bloque les contenus indesirables, qu'ils soient recus en entree ou produits en sortie...
-
Fine-tuning
Le fine-tuning est la phase de spécialisation d'un modèle d'intelligence artificielle déjà pré-entraîné, qui poursuit son entraînement sur un jeu de données restreint et spécifique à un domaine ou...
-
Fine-Tuning (LLM)
Le Fine-Tuning est le processus d'adaptation d'un grand modèle de langage (LLM) préalablement entraîné sur un corpus généraliste massif, à une tâche, un domaine ou un style spécifique, en poursuivant...
-
Fine-tuning LoRA
Le Fine-tuning LoRA (Low-Rank Adaptation) est une technique d'adaptation efficace des grands modèles de langage (LLM) qui consiste à geler l'intégralité des poids du modèle pré-entraîné et à insérer...
-
Fine-tuning vs Prompting
Le choix entre Fine-tuning (adapter les poids du modele) et Prompting (utiliser des instructions dans le contexte) est une decision architecturale fondamentale pour les applications LLM enterprise....
-
FLARE (Forward-Looking Active REtrieval)
FLARE (Forward-Looking Active REtrieval) est une technique RAG iterative proposee par Jiang et al. (2023) ou le LLM genere du texte et declenche dynamiquement un retrieval uniquement quand sa...
-
Flash Attention
Flash Attention est un algorithme d'optimisation du mécanisme d'attention des transformers, conçu pour exploiter l'architecture mémoire hiérarchique des GPU, réduisant drastiquement la mémoire...
-
Flux de travail d'entrainement automatise
Un flux de travail d'entrainement automatise (automated training workflow) est une chaine de traitement qui declenche, execute et valide le reentrainement d'un modele d'intelligence artificielle sans...
-
Fonction d'activation GELU
La fonction d'activation GELU, pour Gaussian Error Linear Unit, est une fonction non lineaire utilisee dans la plupart des architectures transformeurs, notamment BERT et GPT, pour introduire de la...
-
Fonction d'activation SwiGLU
La fonction d'activation SwiGLU est une fonction non lineaire a portes, combinaison de la fonction Swish et d'une unite lineaire a portes, GLU, utilisee dans les blocs feed-forward des transformeurs...
-
Format de poids GGUF
Le format GGUF, pour GPT-Generated Unified Format, est un format de fichier binaire conçu pour stocker et distribuer les poids de modèles de langage quantifiés, principalement utilisé par le moteur...
-
Format ONNX (Open Neural Network Exchange)
Le format ONNX, pour Open Neural Network Exchange, est un format ouvert et standardisé de représentation des modèles de deep learning, conçu pour permettre l'interopérabilité entre différents...
-
FP8 (Float Point 8-bit)
FP8 (8-bit Floating Point) est un format de representation numerique ultra-compact utilise pour l'entrainement et l'inference des LLMs, introduit avec les GPU NVIDIA H100. Il existe en deux variantes...
-
Framework d'agents AutoGen
AutoGen est un framework open source developpe par Microsoft Research pour la construction de systemes multi-agents fondes sur des grands modeles de langage, ou plusieurs agents conversationnels...
-
Framework d'agents CrewAI
CrewAI est un framework open source de developpement d'agents IA qui organise plusieurs agents autonomes en une equipe collaborative, appelee crew, ou chaque agent recoit un role, un objectif et un...
-
Framework d'agents LangGraph
LangGraph est un framework open source, developpe par l'equipe de LangChain, qui permet de construire des agents IA et des workflows multi-agents sous forme de graphes d'etats explicites, ou chaque...
-
FSDP (Fully Sharded Data Parallel)
FSDP (Fully Sharded Data Parallel) est une technique de parallelisme distribue pour l'entrainement des LLMs, implementee nativement dans PyTorch depuis la version 1.11. Elle etend le Data Parallelism...
-
Fuite de prompt système
La fuite de prompt systeme, ou system prompt leak, est un incident de securite ou un utilisateur parvient a extraire le contenu des instructions confidentielles configurees en amont d'un grand modele...
-
Function Calling (LLM)
Le Function Calling, ou appel de fonction, désigne la capacité d'un grand modèle de langage à générer, en réponse à une requête utilisateur, un appel structuré vers une fonction ou une API externe...
-
Function Calling / Tool Use
Le Function Calling, également désigné Tool Use, est une capacité des grands modèles de langage modernes leur permettant de décider de manière autonome d'invoquer des fonctions ou des API externes...
-
Fusion de modèles par moyenne des poids (Model Soups)
La fusion de modèles par moyenne des poids est une technique qui combine plusieurs modèles de même architecture, entraînés séparément, en calculant la moyenne arithmétique de leurs paramètres pour...
-
Fusion de modèles par tâche TIES (TIES-Merging)
La fusion de modèles par tâche TIES, ou TIES-Merging, est une méthode de fusion de modèles conçue pour combiner plusieurs modèles fine-tunés sur des tâches différentes à partir d'un même modèle de...
-
Fusion de rangs reciproques RRF (Reciprocal Rank Fusion)
La fusion de rangs reciproques, ou Reciprocal Rank Fusion (RRF), est un algorithme utilise pour combiner les resultats de plusieurs systemes de recherche distincts, typiquement une recherche...
-
GAN (Generative Adversarial Network)
Un GAN, Generative Adversarial Network ou réseau antagoniste génératif, est une architecture d'apprentissage profond introduite en 2014 par Ian Goodfellow, composée de deux réseaux de neurones...
-
GeGLU
GeGLU (Gated Linear Unit with GELU activation) est une variante des fonctions d'activation pour les couches Feed-Forward Network (FFN) des Transformers, proposee par Noam Shazeer (Google, 2020). Elle...
-
Generation d'image par texte
La generation d'image par texte, ou text-to-image, est une technique d'IA generative qui produit une image originale a partir d'une description textuelle appelee prompt. Les modeles de diffusion...
-
Generation de tests unitaires par IA
La generation de tests unitaires par IA designe l'utilisation d'un modele de langage pour produire automatiquement des cas de test a partir du code source, de sa documentation ou de sa specification...
-
Generation de video par texte
La generation de video par texte, ou text-to-video, est une technologie d'IA generative qui produit des sequences video a partir d'une description textuelle, en etendant les principes des modeles de...
-
Generation de voix synthetique
La generation de voix synthetique est une technologie qui produit de la parole artificielle a partir de texte ou d'un style vocal cible, en s'appuyant sur des reseaux de neurones profonds entraines...
-
GGML
GGML (Georgi Gerganov Machine Learning) est un format de fichier et une bibliotheque C pour l'inference de LLMs quantises, developpes par Georgi Gerganov. GGML est le predecesseur direct de GGUF...
-
GGUF
GGUF (GPT-Generated Unified Format) est un format de fichier binaire pour les modèles de langage quantifiés, créé par Georgi Gerganov (auteur de llama.cpp) et introduit en août 2023 comme successeur...
-
Goodhart's Law in AI
La loi de Goodhart, en economie : 'When a measure becomes a target, it ceases to be a good measure' (Goodhart, 1975), est le fondement theorique du reward hacking et des problemes d'alignement en IA....
-
Gouvernance des donnees d'entrainement
La gouvernance des donnees d'entrainement est l'ensemble des processus, roles et controles qui encadrent la collecte, la qualification, la documentation et l'usage des donnees utilisees pour...
-
Gouvernance du cycle de vie des donnees IA
La gouvernance du cycle de vie des donnees IA est l'ensemble des politiques, roles et processus qui encadrent les donnees utilisees par un systeme d'intelligence artificielle depuis leur collecte...
-
GPQA Diamond
GPQA (Graduate-Level Google-Proof Q&A) Diamond est un benchmark d'evaluation des LLMs cree par Rein et al. (2023) pour tester les capacites de raisonnement de niveau doctorat dans des domaines...
-
GPTQ
GPTQ (Generative Pre-trained Transformers Quantization) est un algorithme de quantification post-entraînement (PTQ — Post-Training Quantization) pour les LLMs, développé par Frantar et al. (IST...
-
Gradient Checkpointing
Le Gradient Checkpointing (aussi appelé Activation Checkpointing) est une technique d'optimisation mémoire pour l'entraînement de réseaux de neurones profonds qui réduit la consommation mémoire GPU...
-
Gradient Clipping
Le Gradient Clipping est une technique d'optimisation utilisee lors de l'entrainement des reseaux de neurones profonds, et particulierement des LLMs, qui consiste a limiter la norme (magnitude) des...
-
GraphRAG
GraphRAG est une architecture avancée de génération augmentée par récupération, développée par Microsoft Research, combinant les graphes de connaissances (Knowledge Graphs) avec les principes du RAG...
-
Grille d'evaluation rubrique
Une grille d'evaluation rubrique, ou rubric evaluation, est un protocole de notation qui decompose l'evaluation d'une reponse generee par un modele en une liste de criteres explicites et verifiables...
-
Grouped Query Attention (GQA)
Le Grouped Query Attention (GQA) est une technique d'optimisation de l'attention dans les LLMs, introduite par Ainslie et al. (Google, 2023). Elle constitue un compromis entre le Multi-Head Attention...
-
GSM8K
GSM8K (Grade School Math 8K) est un dataset de 8 500 problemes de mathematiques de niveau lycee, developpe par Cobbe et al. (OpenAI, 2021). C'est l'un des benchmarks les plus influents pour mesurer...
-
Guardrails IA
Les Guardrails IA sont des mécanismes de contrôle appliqués aux entrées et aux sorties des systèmes d'intelligence artificielle, destinés à prévenir les comportements non souhaitables et à sécuriser...
-
Guidance sans classifieur
La guidance sans classifieur (classifier-free guidance, CFG) est une technique introduite par Ho et Salimans en 2022 qui ameliore l'alignement entre un texte de prompt et l'image generee par un...
-
Hallucination (LLM)
L'Hallucination, appliquée aux grands modèles de langage (LLM), désigne le phénomène par lequel un modèle génère des informations factuellement incorrectes, inventées ou non fondées sur ses données...
-
Hallucination IA
L'hallucination IA désigne le phénomène par lequel un grand modèle de langage génère des informations factuellement incorrectes, entièrement inventées ou logiquement incohérentes, tout en les...
-
HellaSwag
HellaSwag (Harder Endings, Longer contexts, and Low-shot Activities For Situations With Adversarial Generations) est un benchmark de completion de phrase testant le raisonnement de sens commun...
-
Hierarchical Indexing (RAG)
Le Hierarchical Indexing (indexation hierarchique) est une technique d'indexation avancee pour les systemes RAG qui cree deux niveaux de representation pour les documents : des resumes de haut niveau...
-
Homomorphic Encryption ML
Le Chiffrement Homomorphe (Homomorphic Encryption, HE) pour le Machine Learning est une technique cryptographique qui permet d'effectuer des calculs (additions, multiplications) directement sur des...
-
Human-in-the-Loop (HITL)
Le Human-in-the-Loop (HITL) est une architecture de conception de systèmes d'intelligence artificielle intégrant une étape de validation ou d'intervention humaine explicite dans le processus...
-
Human-in-the-loop pour agents
Le human-in-the-loop pour agents est un mode d'operation ou un agent IA autonome soumet certaines decisions ou actions a validation humaine avant execution. Ce mecanisme s'applique typiquement aux...
-
HumanEval
HumanEval est un benchmark de generation de code developpe par OpenAI (Chen et al., 2021) dans le paper qui accompagnait Codex (ancetre de GitHub Copilot). Il se compose de 164 problemes de...
-
HyDE (Hypothetical Document Embeddings)
HyDE (Hypothetical Document Embeddings) est une technique d'amelioration du retrieval dans les pipelines RAG, proposee par Gao et al. (2022). L'idee centrale : resoudre le probleme ou les embeddings...
-
IA Générative
L'IA générative désigne une famille de modèles d'intelligence artificielle capables de produire du contenu original, texte, image, audio ou code, en apprenant la distribution statistique sous-jacente...
-
IFEval (Instruction Following Evaluation)
IFEval (Instruction Following Evaluation) est un benchmark developpe par Google (Zhou et al., 2023) qui evalue la capacite des LLMs a suivre des instructions formelles, verifiables automatiquement...
-
Image Captioning
L'Image Captioning (legendage automatique d'images) est la tache consistant a generer automatiquement une description textuelle pertinente d'une image. C'est l'une des taches multimodales...
-
Image Tokenization
L'Image Tokenization est le processus de conversion d'une image en une sequence de tokens compatibles avec les Transformers de langage, permettant aux LLMs de traiter les images comme s'ils...
-
In-Context Learning (ICL)
L'In-Context Learning, ou ICL, est une capacité émergente des grands modèles de langage leur permettant d'apprendre et de s'adapter à une nouvelle tâche uniquement à partir d'exemples ou...
-
Index de quantification produit
L'index de quantification produit, ou Product Quantization en anglais, est une technique de compression des vecteurs utilisee dans les bases de donnees vectorielles pour reduire drastiquement...
-
Index HNSW (Hierarchical Navigable Small World)
L'index HNSW, pour Hierarchical Navigable Small World, est une structure de donnees utilisee par la recherche vectorielle approximee pour retrouver rapidement les voisins les plus proches d'un...
-
Index IVF (Inverted File Index)
L'index IVF, pour Inverted File Index, est une methode d'indexation vectorielle qui partitionne l'espace des vecteurs en un nombre defini de regroupements, ou clusters, obtenus generalement par un...
-
Indirect Prompt Injection
L'Indirect Prompt Injection (injection de prompt indirecte) est une attaque contre les systemes LLM agentiques dans laquelle des instructions malveillantes sont dissimulees dans des donnees externes...
-
Inférence LLM
L'inférence LLM désigne le processus opérationnel par lequel un modèle de langage préalablement entraîné génère une prédiction ou une réponse à partir d'une entrée fournie, le prompt, par opposition...
-
Inference Scaling
L'Inference Scaling (aussi appele Test-Time Compute Scaling) est le paradigme emergent consistant a ameliorer les performances des LLMs en augmentant les ressources de calcul allouees lors de...
-
Injection de prompt indirecte via document
L'injection de prompt indirecte via document est une attaque qui dissimule des instructions malveillantes destinees a un grand modele de langage a l'interieur d'un contenu externe - page web, PDF...
-
Injection de prompt via image
L'injection de prompt via image est une variante multimodale de l'attaque par injection de prompt, ou des instructions malveillantes sont dissimulees a l'interieur d'une image soumise a un modele de...
-
Instruction Tuning
L'Instruction Tuning est une phase de fine-tuning supervisé appliquée à un grand modèle de langage après son pré-entraînement initial sur de vastes corpus textuels bruts, consistant à réentraîner le...
-
Intelligence Artificielle
L'intelligence artificielle, IA, est le domaine de l'informatique visant à concevoir des systèmes capables de reproduire certaines fonctions cognitives humaines : raisonnement, apprentissage...
-
Interconnexion haute bande passante NVLink
NVLink est une technologie d'interconnexion proprietaire de NVIDIA qui relie plusieurs GPU entre eux avec un debit de donnees bien superieur a celui du bus PCIe standard. Elle permet a plusieurs...
-
Interleaved Modalities
Les Interleaved Modalities (modalites entrelacees) font reference a la capacite d'un LLM multimodal a traiter et generer des documents qui alternent texte et images dans un ordre quelconque, plutot...
-
Interpolation sphérique de poids SLERP (Spherical Linear Interpolation)
L'interpolation sphérique de poids SLERP, ou Spherical Linear Interpolation, est une méthode de fusion de deux modèles qui calcule un chemin d'interpolation le long d'un arc de cercle dans l'espace...
-
Interpretabilite mecanistique par circuits
L'interpretabilite mecanistique par circuits est un domaine de recherche en intelligence artificielle qui vise a comprendre le fonctionnement interne des reseaux de neurones, en particulier des...
-
Interpreteur de code pour agent
Un interpreteur de code pour agent est un outil qui permet a un agent IA de generer et d'executer directement du code, le plus souvent en Python, afin de resoudre des taches necessitant du calcul, de...
-
Inventaire des cas d'usage IA
L'inventaire des cas d'usage IA est le recensement operationnel des applications concretes de l'intelligence artificielle au sein d'une organisation, oriente metier plutot que technique. Il liste par...
-
Jailbreak LLM
Un jailbreak LLM est une technique d'attaque visant à contourner délibérément les mécanismes d'alignement de sécurité, les filtres de contenu et les restrictions éthiques intégrés à un modèle de...
-
Jeu de données adversarial
Un jeu de données adversarial est un ensemble d'exemples construits volontairement pour tromper un modèle d'IA, en exploitant ses failles de generalisation plutot que ses cas d'usage normaux. Il sert...
-
Journal d'audit des decisions IA
Le journal d'audit des decisions IA est un enregistrement structure et horodate des entrees, sorties, parametres et versions de modele associes a chaque decision automatisee prise par un systeme...
-
Journalisation des inferences
La journalisation des inferences (inference logging) est la capture systematique et structuree de chaque prediction produite par un modele d'intelligence artificielle en production, incluant...
-
Knowledge Distillation
La Knowledge Distillation, ou distillation de connaissance, est une technique de compression de modèle qui transfère les connaissances acquises par un grand modèle, dit teacher, vers un modèle...
-
KV-Cache
Le KV-cache est une optimisation d'inférence des grands modèles de langage qui stocke les vecteurs clé et valeur, key et value, calculés par les couches d'attention pour chaque token déjà traité...
-
LangChain
LangChain est un framework open-source pour construire des applications basées sur les LLMs, lancé par Harrison Chase en octobre 2022 et rapidement devenu le framework le plus populaire de...
-
LangGraph
LangGraph est un framework d'orchestration d'agents LLM basé sur des graphes d'états, développé par l'équipe LangChain en 2024 comme solution aux limitations des chains séquentielles pour les...
-
Latence de premier jeton
La latence de premier jeton, ou Time To First Token (TTFT), designe le delai ecoule entre l'envoi d'une requete a un modele de langage et la reception du tout premier jeton de la reponse generee. Cet...
-
Learning Rate Scheduling
Le Learning Rate Scheduling (planification du taux d'apprentissage) désigne l'ensemble des stratégies qui font varier dynamiquement le learning rate (LR) pendant l'entraînement d'un modèle de deep...
-
Liquid Neural Networks
Les Liquid Neural Networks, ou réseaux de neurones liquides, sont une architecture développée notamment par des chercheurs du MIT, inspirée du système nerveux minimaliste du ver C. elegans, dont les...
-
Liste de refus de sujets sensibles
Une liste de refus de sujets sensibles, ou denylist thematique, est un dispositif de controle qui recense explicitement les themes, mots-cles ou intentions pour lesquels un systeme d'IA generative...
-
llama.cpp
llama.cpp est une implementation en C/C++ pure d'inference de LLMs, developpee par Georgi Gerganov (communaute open-source) originellement pour executer LLaMA sur Apple Silicon. C'est devenu le...
-
LlamaIndex
LlamaIndex (anciennement GPT Index) est un framework open-source Python/TypeScript spécialisé dans la construction de pipelines d'indexation et de retrieval pour connecter des LLMs à des données...
-
LLM (Large Language Model)
Un LLM, Large Language Model, est un modèle d'intelligence artificielle fondé sur l'architecture Transformer, pré-entraîné sur des corpus textuels massifs pouvant atteindre plusieurs centaines de...
-
LLM Multimodal
Un LLM multimodal est un modèle de langage étendu capable de traiter et de raisonner sur plusieurs modalités de données simultanément : texte, images, audio, vidéo, code et données structurées....
-
LLM Red Teaming
Le LLM Red Teaming est une discipline de sécurité offensive spécialisée, consistant à tester de manière adversariale et systématique les systèmes d'intelligence artificielle générative afin...
-
LLM-as-a-Judge
LLM-as-a-Judge (LLM comme juge) est la methodologie d'evaluation qui utilise un LLM puissant (typiquement GPT-4o ou Claude 3.5 Sonnet) pour noter la qualite des reponses d'un modele cible, remplacant...
-
LLMOps
Le LLMOps est une extension spécialisée du MLOps (Machine Learning Operations) adaptée aux spécificités opérationnelles des grands modèles de langage (LLM), couvrant l'ensemble du cycle de vie de ces...
-
LM Studio
LM Studio est une application desktop (Windows, macOS, Linux) qui simplifie radicalement l'utilisation de LLMs locaux en offrant une interface graphique intuitive pour telecharger, gerer et interagir...
-
LM-Eval-Harness
LM-Eval-Harness (ou lm-evaluation-harness) est un framework d'evaluation des LLMs open-source developpe par Eleuther AI. Il standardise l'evaluation sur 200+ benchmarks NLP (ARC, HellaSwag, MMLU...
-
LMSYS Chatbot Arena
LMSYS Chatbot Arena est une plateforme d'evaluation collaborative des LLMs developpee par l'equipe LMSYS (Large Model Systems Organization) de UC Berkeley. Les utilisateurs soumettent une question a...
-
Load Balancing Loss (MoE)
La Load Balancing Loss (perte d'equilibrage de charge) est un terme de regularisation specifique aux architectures Mixture of Experts (MoE) qui penalise les desequilibres de distribution des tokens...
-
Long Context LLM
Les Long Context LLMs sont des modeles de langage capables de traiter des fenetres de contexte de 128K a plusieurs millions de tokens, representant des milliers de pages de texte ou des bases de code...
-
LongBench
LongBench est un benchmark bilingue (anglais et chinois) developpe par l'equipe THUDM (Tsinghua University, 2023) pour evaluer la comprehension de documents longs par les LLMs. Il comprend 21...
-
LoRA (Low-Rank Adaptation)
LoRA, pour Low-Rank Adaptation, est une technique de fine-tuning efficient des grands modèles de langage, publiée par des chercheurs Microsoft en 2021, qui permet d'adapter un modèle pré-entraîné à...
-
Lost in the Middle
Le 'Lost in the Middle' est un phenomene de biais cognitif des LLMs documente par Liu et al. (Stanford, 2023) dans le paper 'Lost in the Middle: How Language Models Use Long Contexts'. Les LLMs ont...
-
Machine Learning
Le machine learning, ou apprentissage automatique, est un sous-domaine de l'intelligence artificielle permettant à un système d'améliorer ses performances sur une tâche donnée à partir de données...
-
Magasin de caracteristiques hors ligne
Un magasin de caracteristiques hors ligne, ou offline feature store, est un composant d'infrastructure de machine learning qui stocke et met a disposition en batch les variables predictives, appelees...
-
Maintenance predictive par IA
La maintenance predictive par IA est une strategie de gestion des actifs industriels qui utilise des modeles de machine learning pour anticiper la defaillance d'un equipement avant qu'elle ne...
-
Many-Shot Jailbreak
Le Many-Shot Jailbreak est une technique d'attaque contre les LLMs documentee par Anil et al. (Anthropic, 2024) qui exploite les capacites d'apprentissage en contexte (in-context learning) des LLMs...
-
Marquage CE pour systeme d'IA
Le marquage CE pour systeme d'IA est l'attestation visible, apposee par le fournisseur, qu'un systeme d'intelligence artificielle a haut risque respecte l'ensemble des exigences essentielles de l'AI...
-
MATH (Benchmark)
MATH est un benchmark de mathematiques avancees publie par Hendrycks et al. (2021) comprenant 12500 problemes de niveau lycee a olympiade issus de competitions de maths (AMC, AIME, etc.). Il couvre 7...
-
MCP (Model Context Protocol)
Le MCP (Model Context Protocol) est un protocole ouvert développé par Anthropic, publié fin 2024, standardisant la manière dont les grands modèles de langage se connectent à des outils externes, des...
-
Mécanisme d'Attention (Transformer)
Le mécanisme d'attention est le composant central des architectures Transformer, introduit dans l'article fondateur « Attention Is All You Need » publié par Google en 2017, qui calcule l'importance...
-
Mécanisme d'Attention / Self-Attention
Le mécanisme d'attention est le composant central de l'architecture Transformer, permettant à un modèle de pondérer dynamiquement l'importance relative de chaque token d'une séquence par rapport à...
-
Mechanistic Interpretability
L'Interpretability mecaniste est une discipline de recherche en AI Safety qui cherche a comprendre de maniere rigoureuse les mecanismes computationnels internes des reseaux de neurones pour expliquer...
-
Melange d'experts creux
Le melange d'experts creux, ou sparse Mixture of Experts (MoE), est une architecture de reseau de neurones dans laquelle chaque couche feed-forward est remplacee par un ensemble de sous-reseaux...
-
Mélange de données d'entraînement (Data Mixture)
Le mélange de données d'entraînement désigne la répartition, en proportions définies, des différentes sources de texte utilisées pour pré-entraîner ou fine-tuner un modèle de langage : pages web...
-
Membership Inference Attack
Une Membership Inference Attack (MIA) est une attaque sur la vie privee des modeles de machine learning consistant a determiner si un exemple de donnees specifique a ete inclus dans le dataset...
-
Memoire a court et long terme LSTM
La memoire a court et long terme, ou LSTM (Long Short-Term Memory), est une variante de reseau de neurones recurrent concue pour resoudre le probleme du gradient qui s'evanouit dans les RNN...
-
Memoire a large bande passante HBM (High Bandwidth Memory)
La memoire HBM, ou High Bandwidth Memory, est une technologie de memoire empilee verticalement en trois dimensions et placee au plus pres du processeur graphique afin de maximiser le debit de...
-
Memoire de travail d'agent
La memoire de travail d'agent designe l'espace de contexte immediat qu'un agent IA utilise pour raisonner et agir pendant l'execution d'une tache en cours, par analogie avec la memoire de travail...
-
Memoire episodique d'agent
La memoire episodique d'agent est un mecanisme de stockage qui conserve l'historique concret des interactions, evenements et actions vecus par un agent IA au fil du temps, a l'image des souvenirs...
-
Memoire semantique d'agent
La memoire semantique d'agent est le composant qui stocke des connaissances generales, des faits stables et des relations conceptuelles independamment du contexte precis dans lequel ils ont ete...
-
Memory (IA Agent)
La Memory (mémoire) d'un agent IA désigne l'ensemble des mécanismes permettant à un système fondé sur un grand modèle de langage de stocker et de récupérer des informations pertinentes au-delà de la...
-
Meta-Learning (Few-Shot Learning)
Le Meta-Learning (apprendre a apprendre) est un paradigme d'apprentissage machine dont l'objectif est de developper des modeles capables de s'adapter rapidement a de nouvelles taches avec tres peu...
-
Metadonnees de chunk
Les metadonnees de chunk sont des informations structurees associees a chaque fragment de texte indexe dans une base de donnees vectorielle, en complement du vecteur d'embedding lui-meme, destinees a...
-
Metrique BLEU
BLEU (Bilingual Evaluation Understudy) est une metrique historiquement developpee pour juger la qualite de traductions automatiques, en mesurant le chevauchement de n-grammes (sequences de mots...
-
Metrique de precision moyenne
La metrique de precision moyenne, ou Mean Average Precision, MAP, est un indicateur d'evaluation de la qualite d'un classement de resultats de recherche qui combine precision et ordre de restitution...
-
Metrique de rappel a k
La metrique de rappel a k, ou Recall@k, mesure la proportion de documents effectivement pertinents pour une requete donnee qui figurent parmi les k premiers resultats retournes par un systeme de...
-
Metrique METEOR
METEOR (Metric for Evaluation of Translation with Explicit ORdering) est une metrique d'evaluation automatique concue pour corriger certaines limites de BLEU dans l'evaluation de traductions et de...
-
Metrique NDCG
La metrique NDCG, Normalized Discounted Cumulative Gain, est un indicateur d'evaluation de classement qui mesure la qualite de l'ordre des resultats retournes par un systeme de recherche en tenant...
-
Metrique ROUGE
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) est une famille de metriques d'evaluation automatique utilisee principalement pour juger la qualite de resumes generes par un modele, en...
-
Midjourney
Midjourney est un outil proprietary de generation d'images par IA developpe par la societe Midjourney Inc. (David Holz, 2022), accessible initialement via Discord et desormais via une interface web....
-
Minimisation des donnees en IA
La minimisation des donnees en IA est l'application du principe RGPD de minimisation, pose a l'article 5, aux systemes d'intelligence artificielle : les donnees collectees et traitees doivent etre...
-
Mise a l'echelle horizontale de l'inference
La mise a l'echelle horizontale de l'inference designe la strategie qui consiste a augmenter la capacite de traitement d'un service d'IA en multipliant le nombre d'instances de calcul qui traitent...
-
Mise en cache semantique de requetes
La mise en cache semantique de requetes est une technique d'optimisation qui consiste a reutiliser la reponse deja generee par un modele d'intelligence artificielle pour une requete similaire, meme...
-
Mixed Precision Training
Le Mixed Precision Training (entraînement en précision mixte) est une technique qui utilise simultanément des types numériques de précision différente (float32, float16, bfloat16) pour les...
-
Mixture of Experts (MoE)
Le Mixture of Experts (MoE, mélange d'experts) est une architecture de grand modèle de langage conçue pour découpler la taille totale du modèle du coût de calcul nécessaire à chaque inférence, en...
-
MLOps
Le MLOps, contraction de Machine Learning et DevOps, désigne l'ensemble des pratiques et outils visant à automatiser et industrialiser le cycle de vie complet des modèles de machine learning, du...
-
MMLU (Massive Multitask Language Understanding)
MMLU (Massive Multitask Language Understanding) est l'un des benchmarks d'evaluation les plus utilises pour mesurer les connaissances et capacites de raisonnement des LLMs dans 57 domaines...
-
Model Card
Une Model Card est un document de transparence standardise accompagnant un modele d'IA, decrivant ses caracteristiques, performances, limitations, biais potentiels et usages prevus et...
-
Model Context Protocol (MCP)
Le Model Context Protocol (MCP) est un standard ouvert développé par Anthropic permettant aux applications hôtes d'exposer des ressources, outils et prompts à des LLM de manière standardisée et...
-
Model Drift
Le model drift désigne la dégradation progressive des performances d'un modèle de machine learning en production, survenant lorsque les conditions réelles d'utilisation s'écartent de celles observées...
-
Model Extraction Attack
Une Model Extraction Attack (attaque d'extraction de modele) est une attaque de securite IA dans laquelle un attaquant reconstruit ou approxime un modele d'apprentissage automatique proprietaire en...
-
Model Merging
Le Model Merging (fusion de modeles) est la technique de combiner les poids de plusieurs modeles fine-tunes (ayant le meme modele de base) en un seul modele, sans retrainement supplementaire....
-
Model Registry
Un Model Registry est un composant d'infrastructure MLOps servant de référentiel centralisé pour le versionnement, la documentation et la gouvernance des modèles de machine learning tout au long de...
-
Model Serving
Le Model Serving désigne l'infrastructure et les processus permettant de déployer un modèle de machine learning entraîné en environnement de production, afin de répondre à des requêtes d'inférence en...
-
Model Sharding
Le Model Sharding (partage de modele) designe l'ensemble des techniques de partition d'un LLM sur plusieurs GPUs pour l'inference, permettant de depasser la limite de VRAM d'un seul GPU. C'est le...
-
Modèle brouillon pour décodage spéculatif
Un modèle brouillon, ou draft model, est un modèle de langage de petite taille utilisé dans le cadre du décodage spéculatif pour générer rapidement des suites de tokens candidats, ensuite vérifiées...
-
Modele d'embedding de code
Un modele d'embedding de code est un modele specialise qui transforme du code source, des fonctions ou des extraits de documentation technique en vecteurs numeriques, afin de permettre une recherche...
-
Modele d'embedding multilingue
Un modele d'embedding multilingue est un reseau de neurones entraine pour projeter des textes issus de plusieurs langues dans un espace vectoriel partage, ou des phrases de sens equivalent restent...
-
Modele de diffusion latente
Un modele de diffusion latente est une architecture generative qui apprend a produire des donnees, le plus souvent des images, en debruitant progressivement un bruit aleatoire dans un espace latent...
-
Modele de langage a contexte etendu
Un modele de langage a contexte etendu, ou long-context LLM, est un grand modele de langage capable de traiter en une seule requete une fenetre de contexte tres large, pouvant aller de plusieurs...
-
Modele de langage a poids ouverts
Un modele de langage a poids ouverts, ou open-weight LLM, est un modele dont les parametres entraines sont publies et telechargeables librement ou sous licence permissive, permettant a un tiers de...
-
Modele de langage causal
Un modele de langage causal (causal language model) est un modele entraine a predire le token suivant dans une sequence en n'utilisant que le contexte precedent, jamais les tokens futurs, grace a un...
-
Modele de langage de petite taille SLM
Un modele de langage de petite taille, ou SLM (Small Language Model), est un modele de traitement du langage naturel dont le nombre de parametres, generalement de quelques centaines de millions a...
-
Modele de langage de raisonnement
Un modele de langage de raisonnement (reasoning language model) est un grand modele de langage entraine ou incite specifiquement a produire une sequence d'etapes intermediaires explicites avant de...
-
Modele de langage medical
Un modele de langage medical (medical language model) est un modele de langage specialise par domaine, adapte par entrainement continu ou fine-tuning sur des corpus cliniques, litterature...
-
Modele de langage proprietaire
Un modele de langage proprietaire est un grand modele de langage dont les poids, l'architecture detaillee et le code d'entrainement restent la propriete exclusive de l'organisation qui l'a developpe...
-
Modele de langage specialise par domaine
Un modele de langage specialise par domaine (domain-specific language model) est un grand modele de langage adapte, par entrainement continu ou par fine-tuning, au vocabulaire, aux raisonnements et...
-
Modele de langage vision-action VLA
Un modele de langage vision-action (VLA, Vision-Language-Action) est une architecture d'intelligence artificielle qui combine la comprehension du langage naturel, la perception visuelle et la...
-
Modèle de récompense de processus (Process Reward Model)
Un modèle de récompense de processus, ou Process Reward Model (PRM), est un modèle entraîné à évaluer chaque étape intermédiaire d'un raisonnement produit par un LLM, plutôt que de noter uniquement...
-
Modele de score de diffusion
Un modele de score de diffusion (score-based diffusion model) est une famille de modeles generatifs qui apprend a inverser un processus graduel de bruitage applique a des donnees (images, audio), en...
-
Modele fondation
Un modele fondation, ou foundation model, est un modele d'intelligence artificielle de tres grande echelle, pre-entraine sur un vaste corpus de donnees generalistes, puis adapte a une multitude de...
-
Modele generatif auto-regressif
Un modele generatif auto-regressif est un modele statistique qui produit une sequence (texte, audio, image en pixels) en generant chaque element successivement, chaque prediction etant conditionnee...
-
Modele routeur
Un modele routeur est un modele d'intelligence artificielle, souvent de petite taille et rapide, dont la fonction unique est d'analyser une requete entrante et de decider vers quel autre modele...
-
Modular RAG
Modular RAG est une architecture RAG avancee decrite par Gao et al. (2023) qui decompose le pipeline RAG en modules independants et interchangeables, permettant de composer des workflows differents...
-
Moteur de recommandation par embeddings
Un moteur de recommandation par embeddings est un systeme qui suggere des contenus, produits ou actions pertinents en representant les elements et les utilisateurs sous forme de vecteurs numeriques...
-
MT-Bench
MT-Bench (Multi-Turn Benchmark) est un benchmark d'evaluation des LLMs conversationnels developpe par Zheng et al. (LMSYS, 2023) dans le paper 'Judging LLM-as-a-Judge with MT-Bench and Chatbot...
-
MTEB (Massive Text Embedding Benchmark)
MTEB (Massive Text Embedding Benchmark, Muennighoff et al., HuggingFace 2022) est le benchmark de reference pour evaluer la qualite des modeles d'embedding de texte sur un large eventail de taches....
-
Multi-Agent Systems (IA)
Les systèmes multi-agents en intelligence artificielle désignent des architectures dans lesquelles plusieurs agents autonomes, chacun généralement piloté par un grand modèle de langage spécialisé...
-
Multi-Head Attention
Le Multi-Head Attention (attention multi-têtes) est le composant central de l'architecture Transformer, introduit dans le paper fondateur "Attention Is All You Need" (Vaswani et al., 2017). Ce...
-
Multimodal AI
La Multimodal AI, ou intelligence artificielle multimodale, désigne les systèmes capables de traiter simultanément et de générer plusieurs types distincts de données, texte, image, audio, vidéo, au...
-
Multimodal Alignment
Le Multimodal Alignment est l'ensemble des techniques permettant d'aligner les representations apprises independamment pour differentes modalites (texte, images, audio, video) dans un espace commun...
-
Naive RAG
Le Naive RAG designe l'implementation fondamentale du RAG (Retrieval-Augmented Generation) suivant un pipeline lineaire en trois etapes : indexation, retrieval, et generation. C'est le point de...
-
Needle in a Haystack
Le test Needle in a Haystack (aiguille dans une botte de foin) est un benchmark d'evaluation de la memoire contextuelle des LLMs consistant a inserer une information specifique (l'aiguille) a un...
-
Nettoyage de corpus d'entraînement (Data Cleaning)
Le nettoyage de corpus d'entraînement regroupe l'ensemble des traitements appliqués aux données brutes avant leur utilisation pour entraîner un modèle de langage, afin d'en améliorer la qualité et de...
-
NLP (Natural Language Processing)
Le NLP, Natural Language Processing ou traitement automatique du langage naturel, est le domaine de l'intelligence artificielle dédié à la compréhension, l'analyse et la génération du langage humain...
-
Normalisation de couche
La normalisation de couche, ou layer normalization, est une technique de stabilisation de l'entrainement des reseaux de neurones qui normalise les activations d'une couche en soustrayant leur moyenne...
-
Normalisation RMS
La normalisation RMS, ou RMSNorm (Root Mean Square Normalization), est une variante simplifiee de la normalisation de couche utilisee dans de nombreux grands modeles de langage recents comme Llama ou...
-
Norme ISO/IEC 23894 gestion des risques IA
La norme ISO/IEC 23894 gestion des risques IA est une norme internationale publiee en 2023 par l'ISO et la CEI, qui fournit des lignes directrices pour integrer la gestion des risques specifiques a...
-
Norme ISO/IEC 24029 robustesse des reseaux de neurones
La norme ISO/IEC 24029 robustesse des reseaux de neurones est une norme internationale publiee en deux parties, 24029-1 en 2021 et 24029-2 en 2023, qui traite specifiquement de l'evaluation de la...
-
Norme ISO/IEC 25059 qualite des systemes IA
La norme ISO/IEC 25059 qualite des systemes IA est une norme internationale, publiee en 2023, qui adapte le modele de qualite generique de la famille SQuaRE, ISO/IEC 25000, aux specificites des...
-
o1-style Reasoning
Le o1-style Reasoning (aussi appele Large Reasoning Models ou LRMs) est un paradigme de modeles LLM introduit par OpenAI avec o1 (septembre 2024) qui genere des chaines de reflexion internes longues...
-
Obligations du deployeur AI Act
Les obligations du deployeur AI Act designent les exigences que l'AI Act europeen impose a toute personne physique ou morale qui utilise, sous sa propre autorite, un systeme d'IA dans le cadre d'une...
-
Obligations du fournisseur AI Act
Les obligations du fournisseur AI Act designent l'ensemble des exigences reglementaires que l'AI Act europeen impose a toute entite qui developpe un systeme d'IA, ou le fait developper, en vue de le...
-
Observabilite des applications LLM
L'observabilite des applications LLM est l'ensemble des pratiques et outils qui permettent de comprendre en continu le comportement interne d'une application fondee sur un grand modele de langage...
-
OCR avec LLM
L'OCR avec LLM (Optical Character Recognition utilisant des Large Language Models) est l'utilisation des VLMs (Vision-Language Models) comme GPT-4o, Claude 3.5 Sonnet, ou Gemini 1.5 Pro pour extraire...
-
Ollama
Ollama est un outil open-source (licence MIT) permettant d'exécuter des LLMs en local de manière simple et efficace, avec une interface en ligne de commande inspirée de Docker. Lancé en 2023, il...
-
ONNX Runtime
ONNX Runtime (ORT) est un moteur d'inference machine learning open-source developpe par Microsoft qui execute des modeles au format ONNX (Open Neural Network Exchange). ONNX est un format...
-
OpenVINO (Intel)
OpenVINO (Open Visual Inference and Neural Network Optimization) est un toolkit d'inference IA open-source developpe par Intel, optimise pour executer des modeles de machine learning sur du hardware...
-
Optimisation de politique par proximite PPO
L'optimisation de politique par proximite (Proximal Policy Optimization, PPO) est un algorithme d'apprentissage par renforcement propose par Schulman et al. (OpenAI, 2017), largement utilise pour...
-
Optimisation du cout d'un pipeline IA
L'optimisation du cout d'un pipeline IA est l'ensemble des techniques visant a reduire la depense operationnelle d'un systeme d'intelligence artificielle sans degrader ses performances en dessous...
-
Optimiseur Adafactor
L'optimiseur Adafactor est un algorithme d'optimisation pour réseaux de neurones, conçu par Shazeer et Stern en 2018 chez Google, qui vise à réduire drastiquement l'empreinte mémoire des optimiseurs...
-
Optimiseur AdamW
L'optimiseur AdamW est un algorithme d'optimisation utilisé pour entraîner les réseaux de neurones, qui combine les principes d'Adam, Adaptive Moment Estimation, avec une régularisation par weight...
-
Orchestrateur de pipeline de donnees
Un orchestrateur de pipeline de donnees est un systeme logiciel qui planifie, execute et supervise l'enchainement des taches necessaires pour transformer des donnees brutes en donnees exploitables...
-
Orchestrateur multi-agent
Un orchestrateur multi-agent est le composant logiciel qui coordonne l'execution de plusieurs agents IA specialises afin d'accomplir collectivement un objectif que aucun agent isole ne pourrait...
-
Orchestration agents IA
L'orchestration d'agents IA désigne l'ensemble des frameworks et patterns architecturaux permettant de coordonner plusieurs agents autonomes, chacun généralement piloté par un LLM et doté d'outils...
-
Ordonnancement des requêtes d'inférence
L'ordonnancement des requêtes d'inférence désigne l'ensemble des politiques et mécanismes qui déterminent l'ordre et le regroupement dans lequel un serveur de modèles d'IA traite les requêtes...
-
ORPO (Odds Ratio Preference Optimization)
ORPO (Odds Ratio Preference Optimization) est une methode d'alignement des LLMs publiee par Hong et al. (2024) qui integre simultanement le Supervised Fine-tuning (SFT) et l'alignement sur les...
-
Oubli catastrophique
L'oubli catastrophique (catastrophic forgetting) est un phenomene par lequel un reseau de neurones perd brutalement les performances acquises sur des taches ou connaissances anterieures lorsqu'il est...
-
Outcome Reward Model (ORM)
Un Outcome Reward Model (ORM) est un modele de recompense qui evalue uniquement le resultat final (la reponse complete) plutot que les etapes intermediaires du raisonnement. C'est la forme la plus...
-
Overfitting / Surapprentissage
L'overfitting, ou surapprentissage, est un problème classique d'apprentissage automatique survenant lorsqu'un modèle apprend de manière excessivement précise les caractéristiques spécifiques de son...
-
OWASP LLM Top 10
L'OWASP LLM Top 10 est un référentiel de sécurité publié par l'Open Worldwide Application Security Project, listant les dix catégories de risques jugées les plus critiques et spécifiques aux...
-
Pack de conformite pour deploiement IA
Un pack de conformite pour deploiement IA est un ensemble structure de documents, controles et preuves reunis avant la mise en production d'un systeme d'intelligence artificielle, destine a demontrer...
-
PagedAttention
PagedAttention est une technique de gestion du KV-Cache pour les LLMs, introduite par Kwon et al. (UC Berkeley, 2023) dans le paper "Efficient Memory Management for Large Language Model Serving with...
-
Parallélisme d'experts (Expert Parallelism)
Le parallélisme d'experts, ou Expert Parallelism, est une méthode de distribution utilisée pour les architectures Mixture of Experts (MoE), dans lesquelles un modèle est composé de plusieurs...
-
Parallélisme de données distribué (DDP)
Le parallélisme de données distribué (DDP, Distributed Data Parallelism) est une méthode d'entraînement qui réplique un même modèle sur plusieurs accélérateurs (GPU ou TPU) et répartit les lots de...
-
Parallélisme tensoriel
Le parallélisme tensoriel est une technique de parallélisation qui découpe les matrices de poids d'un modèle, par exemple les couches d'attention ou les réseaux feed-forward d'un transformer, entre...
-
Paramètre de modèle
Un paramètre de modèle, dans le contexte des réseaux de neurones et des grands modèles de langage, est une valeur numérique interne au modèle, ajustée itérativement au cours de la phase...
-
Passerelle d'API pour modeles de langage
Une passerelle d'API pour modeles de langage, ou LLM Gateway, est une couche logicielle intermediaire placee entre les applications d'une organisation et les differents fournisseurs de modeles...
-
Patch Embedding
Le Patch Embedding est la technique de tokenisation d'images pour les Vision Transformers (ViT) et les LLMs multimodaux, qui divise une image en une grille de patches (petites regions carrees) de...
-
PEFT (Parameter-Efficient Fine-Tuning)
PEFT, Parameter-Efficient Fine-Tuning, désigne une famille de techniques d'adaptation de grands modèles de langage pré-entraînés à des tâches ou domaines spécifiques, qui n'ajustent qu'une fraction...
-
Perplexite (LLM Metric)
La Perplexite (Perplexity, PPL) est la metrique d'evaluation fondamentale des modeles de langage, mesurant a quel point le modele est 'surpris' ou 'incertain' en lisant un texte. Mathematiquement, la...
-
Perturbation adversariale imperceptible
Une perturbation adversariale imperceptible est une modification calculee et de tres faible amplitude apportee a une donnee d'entree - image, audio ou texte - concue pour tromper un modele d'IA sans...
-
Pipeline d'ingestion documentaire
Un pipeline d'ingestion documentaire est l'ensemble des etapes automatisees qui transforment des documents bruts et heterogenes, PDF, pages web, fichiers Office, emails, en donnees pretes a etre...
-
Pipeline de reentrainement automatise
Un pipeline de reentrainement automatise est une chaine d'orchestration technique qui declenche, execute et valide automatiquement le reentrainement d'un modele d'intelligence artificielle a...
-
Pipeline Parallelism
Le Pipeline Parallelism (PP) est une technique de parallelisme distribue qui partitionne les couches d'un LLM en 'stages' et assigne chaque stage a un GPU different. Contrairement au Tensor...
-
Planification du taux d'apprentissage (Learning Rate Scheduling)
La planification du taux d'apprentissage, ou learning rate scheduling, est une stratégie qui fait varier le taux d'apprentissage d'un modèle au fil de l'entraînement, plutôt que de le maintenir...
-
Planification hierarchique d'agent
La planification hierarchique d'agent est une methode qui decompose un objectif complexe en une arborescence de sous-objectifs traites a differents niveaux d'abstraction, du plan strategique...
-
Planning (IA Agent)
Le planning, dans le contexte d'un agent IA, désigne la capacité de ce dernier à décomposer un objectif complexe en une séquence de sous-tâches ordonnées, à allouer les outils et ressources...
-
Plateforme de monitoring LLM en production
Une plateforme de monitoring LLM en production est un outil logiciel dedie a la surveillance continue des applications construites sur des grands modeles de langage une fois deployees aupres des...
-
Plongement positionnel appris
Le plongement positionnel appris (learned positional embedding) est une methode par laquelle un modele Transformer encode la position de chaque token dans une sequence a l'aide d'un vecteur numerique...
-
Point de controle humain dans un workflow agent
Un point de controle humain dans un workflow agent est une etape explicitement inseree dans la chaine d'execution d'un agent IA ou l'action est suspendue jusqu'a validation d'un operateur....
-
Politique d'utilisation acceptable des LLM
La politique d'utilisation acceptable des LLM est un document interne qui encadre les usages autorises des grands modeles de langage par les salaries d'une organisation. Elle definit les cas d'usage...
-
Positional Encoding
Le Positional Encoding (encodage positionnel) est une technique essentielle dans les architectures Transformer pour injecter une information sur la position des tokens dans une séquence....
-
Positionnement relatif des tokens
Le positionnement relatif des tokens designe une famille de methodes d'encodage de position dans les architectures transformeurs, qui encodent la distance relative entre deux tokens plutot que leur...
-
PPO (Proximal Policy Optimization)
PPO (Proximal Policy Optimization) est un algorithme de Reinforcement Learning developpe par Schulman et al. (OpenAI, 2017) qui est utilise dans le pipeline RLHF pour optimiser le comportement d'un...
-
Pré-entraînement (Pretraining)
Le pré-entraînement, ou pretraining, désigne la phase initiale et la plus coûteuse en ressources de l'entraînement d'un grand modèle de langage, réalisée sur des corpus textuels massifs et non...
-
Pré-entraînement continu (Continual Pretraining)
Le pré-entraînement continu est une technique qui poursuit l'entraînement non supervisé d'un modèle de langage déjà pré-entraîné sur un nouveau corpus, sans repartir de zéro. Il permet d'intégrer des...
-
Pre-LayerNorm vs Post-LayerNorm
Pre-LayerNorm (Pre-LN) et Post-LayerNorm (Post-LN) designent deux variantes architecturales des Transformers qui different par la position de la normalisation par couche (LayerNorm) relative aux...
-
Précision mixte d'entraînement (Mixed Precision Training)
La précision mixte d'entraînement, ou mixed precision training, est une technique qui combine plusieurs formats numériques, typiquement le FP16 ou le BF16 en seize bits pour la majorité des calculs...
-
Process Reward Model (PRM)
Un Process Reward Model (PRM) est un type de modele de recompense entraine a evaluer la qualite de chaque etape intermediaire d'un raisonnement, plutot qu'uniquement la reponse finale. C'est une...
-
Profil de gouvernance IA
Un profil de gouvernance IA est une declinaison contextualisee d'un cadre generique de gestion des risques, tel que le NIST AI RMF, adaptee a un secteur, un cas d'usage ou une technologie specifique...
-
Prompt
Un prompt est l'instruction, la question ou le contexte textuel fourni en entrée à un modèle de langage (LLM) pour orienter et déclencher la génération de sa réponse, constituant l'unique canal par...
-
Prompt Caching
Le Prompt Caching est une fonctionnalite d'optimisation de l'inference LLM proposee par les providers API (Anthropic Claude, OpenAI, Google Gemini) qui permet de cacher le KV cache compute pour un...
-
Prompt Chaining
Le Prompt Chaining est une technique de composition de LLMs qui consiste a decomposer une tache complexe en une sequence de sous-taches plus simples, ou la sortie de chaque prompt devient l'entree du...
-
Prompt Engineering
Le prompt engineering est la discipline consistant à concevoir et formuler des instructions optimisées pour un grand modèle de langage, LLM, afin d'obtenir des réponses précises, fiables et adaptées...
-
Prompt Injection
La Prompt Injection est une classe d'attaques ciblant les systèmes d'IA conversationnels, classée LLM01 dans le référentiel OWASP LLM Top 10 en raison de sa criticité et de sa prévalence, consistant...
-
Protection des donnees des l'entrainement
La protection des donnees des l'entrainement, ou privacy by design applique au machine learning, est l'integration des exigences de protection des donnees personnelles des la phase de conception d'un...
-
Protocole agent-a-agent A2A
Le protocole agent-a-agent A2A, pour Agent-to-Agent, est une specification ouverte qui standardise la maniere dont des agents IA developpes par des equipes ou des fournisseurs differents peuvent...
-
Protocole d'appel de fonction
Le protocole d'appel de fonction, ou function calling, est le mecanisme standardise permettant a un grand modele de langage de declencher l'execution d'une fonction ou d'une API externe en generant...
-
Pruning (élagage de modèle)
Le Pruning (élagage en français) est une technique de compression des réseaux de neurones qui consiste à supprimer les poids ou neurones jugés peu importants pour la performance du modèle, réduisant...
-
Puce d'inference dediee ASIC (Application-Specific Integrated Circuit)
Une puce d'inference dediee ASIC est un circuit integre concu specifiquement pour executer l'inference de modeles d'intelligence artificielle, par opposition a un GPU generaliste programmable....
-
Quantification en 4 bits
La quantification en 4 bits est une technique de compression qui représente les poids d'un modèle d'IA avec seulement 4 bits par valeur, au lieu des 16 ou 32 bits habituels des formats flottants...
-
Quantification par bloc (Block-wise Quantization)
La quantification par bloc, ou block-wise quantization, est une méthode de quantification qui divise les poids d'un modèle en petits groupes, ou blocs, généralement de 32 à 256 valeurs, et calcule un...
-
Quantification post-entraînement (Post-Training Quantization)
La quantification post-entraînement, ou Post-Training Quantization (PTQ), est une technique qui convertit les poids d'un modèle d'IA déjà entraîné, généralement stockés en 16 ou 32 bits, vers un...
-
Quantization (IA)
La Quantization, ou quantification, en intelligence artificielle est une technique de compression de modèle qui réduit la précision numérique utilisée pour représenter les poids et, selon les...
-
Quantization (LLM)
La Quantization, ou quantification, appliquée aux grands modèles de langage, désigne la réduction de la précision numérique utilisée pour représenter les poids et parfois les activations d'un modèle...
-
Quantization-Aware Training (QAT)
La Quantization-Aware Training (QAT) est une technique d'optimisation qui integre la simulation de la quantisation pendant l'entrainement du modele, permettant au modele d'apprendre a minimiser...
-
Question-reponse sur tableaux
La question-reponse sur tableaux, ou Table QA, est une tache d'intelligence artificielle qui consiste a extraire une reponse precise a une question posee en langage naturel a partir de donnees...
-
Rafraichissement incremental d'index
Le rafraichissement incremental d'index est une strategie de mise a jour d'une base de connaissances vectorielle qui consiste a ajouter, modifier ou supprimer uniquement les vecteurs correspondant...
-
RAG (Retrieval-Augmented Generation)
Le RAG (Retrieval-Augmented Generation) est une architecture hybride combinant un mécanisme de recherche documentaire dans une base de connaissances externe avec la capacité générative d'un grand...
-
RAG agentique auto-correctif
Le RAG agentique auto-correctif est une architecture qui enrichit un pipeline RAG classique d'une boucle de controle autonome permettant au systeme d'evaluer et de corriger lui-meme la qualite de sa...
-
RAG conversationnel avec memoire
Le RAG conversationnel avec memoire est une architecture qui combine la recuperation d'information documentaire avec la conservation du contexte d'un echange multi-tours, permettant a un assistant...
-
RAG multi-sauts
Le RAG multi-sauts, ou multi-hop RAG, est une architecture concue pour repondre a des questions dont la resolution necessite de combiner des informations issues de plusieurs documents distincts...
-
RAG sur donnees structurees
Le RAG sur donnees structurees est une variante d'architecture RAG adaptee a l'interrogation de sources non textuelles, telles que des bases de donnees relationnelles, des tableurs ou des entrepots...
-
ReAct (Reasoning + Acting)
ReAct (Reasoning + Acting) est un framework conceptuel structurant le fonctionnement des agents fondés sur des grands modèles de langage, combinant explicitement deux processus complémentaires en...
-
Recherche federee multi-sources
La recherche federee multi-sources est une architecture qui interroge simultanement plusieurs bases de connaissances, index documentaires ou systemes de recherche distincts, puis fusionne et classe...
-
Recherche par mots-cles BM25
BM25, pour Best Matching 25, est un algorithme de recherche par mots-cles qui evalue la pertinence d'un document par rapport a une requete en fonction de la frequence des termes de la requete...
-
Recherche Sémantique (Semantic Search)
La recherche sémantique, ou semantic search, est une technique de recherche d'information qui exploite des embeddings vectoriels pour identifier des documents conceptuellement proches d'une requête...
-
Recherche vectorielle approximee ANN (Approximate Nearest Neighbor)
La recherche vectorielle approximee, ou ANN pour Approximate Nearest Neighbor, est une famille d'algorithmes qui identifient rapidement les vecteurs les plus proches d'une requete au sein d'une base...
-
Recherche vectorielle hybride
La recherche vectorielle hybride est une methode de recuperation d'information qui combine deux approches complementaires au sein d'une meme requete : la recherche vectorielle semantique, fondee sur...
-
Reconnaissance vocale neuronale
La reconnaissance vocale neuronale, ou automatic speech recognition neuronale, est une technique qui transcrit un signal audio parle en texte a l'aide de reseaux de neurones profonds entraines de...
-
Reflection (IA Agent)
La Reflection, dans le contexte des agents d'intelligence artificielle bâtis sur des grands modèles de langage, désigne un mécanisme itératif par lequel un modèle évalue de façon critique sa propre...
-
Registre d'outils pour agents
Un registre d'outils pour agents est un catalogue centralise qui recense l'ensemble des outils, API et fonctions qu'un ou plusieurs agents IA sont autorises a invoquer, avec pour chacun sa...
-
Registre de caracteristiques en temps reel
Un registre de caracteristiques en temps reel, ou online feature store, est un composant d'infrastructure de machine learning qui sert des variables predictives, appelees caracteristiques ou...
-
Registre de jeux de donnees versionnes
Un registre de jeux de donnees versionnes (dataset registry) est un systeme qui enregistre et gere les differentes versions successives d'un jeu de donnees utilise pour entrainer, valider ou tester...
-
Registre de versions de modeles
Un registre de versions de modeles, ou model registry, est un systeme centralise qui catalogue et trace les differentes versions d'un modele d'intelligence artificielle produites au fil des cycles...
-
Registre des systemes d'IA de l'organisation
Le registre des systemes d'IA de l'organisation est un inventaire structure recensant l'ensemble des systemes d'intelligence artificielle deployes ou en cours de developpement au sein d'une entite....
-
Reglage fin complet
Le reglage fin complet (full fine-tuning) est une methode d'adaptation d'un modele de langage pre-entraine a une tache ou un domaine specifique qui consiste a mettre a jour l'integralite des...
-
Reglage fin conversationnel
Le reglage fin conversationnel (chat fine-tuning ou dialogue tuning) est une adaptation specifique d'un modele de langage destinee a optimiser ses capacites d'echange en plusieurs tours (multi-turn...
-
Reglage fin efficace en parametres
Le reglage fin efficace en parametres (Parameter-Efficient Fine-Tuning, PEFT) designe une famille de methodes qui adaptent un modele de langage pre-entraine a une tache specifique en n'entrainant...
-
Reglage fin multi-tache
Le reglage fin multi-tache (multi-task fine-tuning) est une methode d'adaptation d'un modele de langage pre-entraine qui consiste a l'entrainer simultanement sur plusieurs taches distinctes (par...
-
Reglage fin par instructions
Le reglage fin par instructions (instruction fine-tuning ou instruction tuning) est une phase d'entrainement supplementaire appliquee a un modele de langage pre-entraine, qui vise a lui apprendre a...
-
Reinforcement Learning
Le Reinforcement Learning (apprentissage par renforcement) est un paradigme de machine learning dans lequel un agent apprend une politique d'action optimale par essais et erreurs, en interagissant...
-
Reranking
Le Reranking est une etape cruciale d'optimisation dans les pipelines RAG qui ameliore la qualite du retrieval en reclassant les chunks initialement recuperes par un modele de scoring plus precis. La...
-
Reranking cross-encodeur
Le reranking cross-encodeur est une etape de reordonnancement des resultats d'une recherche vectorielle qui consiste a evaluer conjointement, dans un meme passage du modele, la requete et chaque...
-
Reranking par modele de langage
Le reranking par modele de langage est une technique qui utilise un grand modele de langage generatif, plutot qu'un modele de scoring dedie, pour juger et reordonner la pertinence de documents...
-
Reseau antagoniste generatif conditionnel
Un reseau antagoniste generatif conditionnel, ou cGAN (Conditional Generative Adversarial Network), est une variante des GAN dans laquelle le generateur et le discriminateur recoivent tous deux une...
-
Reseau de Kolmogorov-Arnold KAN
Un reseau de Kolmogorov-Arnold, ou KAN (Kolmogorov-Arnold Network), est une architecture de reseau de neurones alternative aux perceptrons multicouches classiques, inspiree du theoreme de...
-
Réseau de Neurones (Neural Network)
Un réseau de neurones artificiels, ou Neural Network, est un modèle computationnel composé de multiples couches de neurones artificiels interconnectés, s'inspirant très librement de l'organisation du...
-
Reseau de neurones a graphe GNN
Un reseau de neurones a graphe (Graph Neural Network, GNN) est une architecture d'apprentissage profond concue pour traiter des donnees structurees sous forme de graphe, c'est-a-dire un ensemble de...
-
Reseau de neurones convolutif
Un reseau de neurones convolutif, ou CNN (Convolutional Neural Network), est une architecture de deep learning specialisee dans le traitement de donnees a structure spatiale, en particulier les...
-
Reseau de neurones recurrent
Un reseau de neurones recurrent, ou RNN (Recurrent Neural Network), est une architecture concue pour traiter des donnees sequentielles en maintenant un etat cache qui se propage d'un pas de temps au...
-
Residual Connection
La Residual Connection (connexion résiduelle, ou skip connection) est une technique d'architecture de réseau de neurones introduite par He et al. dans les ReseNets (2015) et adoptée universellement...
-
Responsabilite en cascade de la chaine IA
La responsabilite en cascade de la chaine IA designe la repartition des obligations juridiques entre les differents acteurs successifs qui interviennent dans la conception, le developpement, la...
-
Resume automatique de documents
Le resume automatique de documents est une application de traitement du langage naturel qui condense un texte long en une version courte conservant les informations essentielles, en s'appuyant sur...
-
Retrieval (RAG)
Le Retrieval, composant central d'un pipeline RAG (Retrieval-Augmented Generation), désigne l'étape qui consiste à récupérer automatiquement, depuis une base de connaissances externe, les documents...
-
Revue de code assistee par IA
La revue de code assistee par IA est une pratique de developpement logiciel dans laquelle un modele de langage analyse une modification de code (pull request) pour detecter des bugs, des failles de...
-
Reward Hacking
Le Reward Hacking (triche sur la recompense) est un phenomene d'alignement ou un agent IA trouve et exploite des failles dans la specification de sa fonction de recompense pour maximiser son score...
-
Reward Model
Le Reward Model (modèle de récompense, RM) est un composant central du pipeline RLHF (Reinforcement Learning from Human Feedback), entraîné à prédire une valeur scalaire reflétant la qualité d'une...
-
Ring Attention
Ring Attention est une technique d'optimisation distribuée de l'attention des transformers, extension de Flash Attention permettant de traiter des contextes extrêmement longs, de l'ordre de plusieurs...
-
RLAIF (Reinforcement Learning from AI Feedback)
RLAIF (Reinforcement Learning from AI Feedback) est une variante du RLHF ou les annotations de preference utilisees pour entrainer le reward model et guider l'optimisation PPO/DPO sont fournies par...
-
RLHF (Reinforcement Learning from Human Feedback)
Le RLHF, Reinforcement Learning from Human Feedback, est la technique d'alignement de référence permettant d'ajuster le comportement d'un grand modèle de langage pré-entraîné pour le rendre conforme...
-
RLVR (Reinforcement Learning with Verifiable Rewards)
RLVR (Reinforcement Learning with Verifiable Rewards) est une methode d'alignement et d'amelioration des LLMs qui utilise des recompenses automatiquement verifiables (plutot qu'un reward model appris...
-
RMSNorm
RMSNorm (Root Mean Square Layer Normalization) est une variante simplifiée de la Layer Normalization (LayerNorm), proposée par Zhang & Sennrich (2019) dans le paper "Root Mean Square Layer...
-
Rotary Position Embedding (RoPE)
Le Rotary Position Embedding (RoPE) est une technique d'encodage positionnel relatif proposée par Su et al. (2021) dans le paper "RoFormer: Enhanced Transformer with Rotary Position Embedding". C'est...
-
Routage de requetes entre modeles
Le routage de requetes entre modeles est une technique qui consiste a orienter automatiquement chaque requete d'un utilisateur vers le modele d'intelligence artificielle le plus approprie parmi...
-
Routage top-1 MoE
Le routage top-1 est une strategie d'aiguillage utilisee dans les architectures de melange d'experts, ou chaque token est envoye vers un unique expert, celui dont le score de routage, calcule par un...
-
RULER (Long-Context Benchmark)
RULER (Retrieval, Understanding, Linking, and Evaluation for Long-context) est un benchmark de long contexte developpe par Hsieh et al. (NVIDIA, 2024) qui etend le test Needle in a Haystack en un...
-
Runtime ONNX Runtime
ONNX Runtime est un moteur d'exécution open source développé par Microsoft, conçu pour exécuter efficacement des modèles au format ONNX sur une grande variété de matériels et de systèmes...
-
Sandbox d'execution de code pour agent
Un sandbox d'execution de code pour agent est un environnement isole et restreint dans lequel un agent IA peut generer et executer du code sans risque d'impact sur le systeme hote ou sur les donnees...
-
Scalable Oversight
Le Scalable Oversight est un probleme de recherche en securite IA qui adresse la question : comment les humains peuvent-ils superviser et verifier le comportement de systemes IA dont les capacites...
-
Scaling Laws
Les Scaling Laws (lois d'echelle) sont des relations empiriques qui decrivent comment la performance des LLMs evolue en fonction de trois variables : la taille du modele (nombre de parametres N), le...
-
Schema de fonction JSON
Un schema de fonction JSON est la specification formelle, redigee au format JSON Schema, qui decrit le nom, la description, les parametres et les types de donnees attendus par une fonction ou un...
-
Score de confiance du modèle
Le score de confiance du modele est une valeur numerique, generalement comprise entre 0 et 1, que produit un systeme d'IA pour indiquer le degre de certitude associe a une prediction donnee. Il est...
-
Score de factualite
Le score de factualite est une metrique d'evaluation qui mesure la proportion d'affirmations verifiables contenues dans un texte genere par un modele de langage qui sont effectivement exactes au...
-
Segmentation hierarchique de documents
La segmentation hierarchique de documents est une methode de decoupage qui organise un texte en plusieurs niveaux de granularite imbriques, generalement du document entier vers la section, puis le...
-
Segmentation par fenetre glissante de texte
La segmentation par fenetre glissante de texte est une methode simple de decoupage de documents pour l'indexation vectorielle, qui divise un texte en fragments de taille fixe, generalement exprimee...
-
Segmentation semantique de documents
La segmentation semantique de documents, ou semantic chunking, est une methode de decoupage de texte destinee a alimenter une architecture RAG, qui divise un document en fragments en se fondant sur...
-
Self-Consistency
La Self-Consistency est une technique d'amelioration du raisonnement des LLMs proposee par Wang et al. (Google Brain, 2022) qui consiste a generer plusieurs chaines de raisonnement independantes...
-
Self-Play (LLM Training)
Le Self-Play dans le contexte des LLMs est un paradigme d'entrainement ou le modele interagit avec lui-meme pour generer des donnees d'apprentissage sans necessite d'annotations humaines a grande...
-
Self-RAG
Self-RAG (Self-Reflective Retrieval-Augmented Generation) est une technique avancee de RAG proposee par Asai et al. (2023) dans laquelle le LLM est entraine a decider dynamiquement quand effectuer un...
-
SentencePiece
SentencePiece est une bibliotheque de tokenisation open-source developpee par Google (Kudo & Richardson, 2018) qui implementent des algorithmes de sous-mots (BPE et Unigram Language Model) de maniere...
-
Sequence Length (LLM Training)
La Sequence Length (longueur de sequence) est un hyperparametre fondamental de l'entrainement des LLMs qui definit le nombre maximal de tokens traites dans un seul exemple d'entrainement. Elle...
-
Serveur d'inférence distribué
Un serveur d'inférence distribué est un système logiciel qui exécute les requêtes d'inférence d'un modèle d'IA en répartissant la charge sur plusieurs accélérateurs ou machines, afin de servir un...
-
SFT (Supervised Fine-Tuning)
Le Supervised Fine-Tuning (SFT) est la premiere etape de post-training qui transforme un LLM de base (pre-entraine sur du texte brut) en un modele capable de suivre des instructions et de repondre de...
-
Shadow Deployment
Le Shadow Deployment est une technique de déploiement de modèles de machine learning consistant à acheminer une copie du trafic réel de production vers un nouveau modèle en parallèle du modèle...
-
Similarity Search
La Similarity Search (recherche de similarité) est une technique consistant à identifier, au sein d'un espace vectoriel de haute dimension, les éléments les plus proches d'un vecteur de requête...
-
SimPO (Simple Preference Optimization)
SimPO (Simple Preference Optimization) est une methode d'alignement des LLMs proposee par Meng et al. (Princeton/CMU, 2024) qui simplifie DPO en eliminant completement le besoin d'un modele de...
-
Sliding Window Attention
Le Sliding Window Attention (SWA) est une technique d'optimisation de l'attention dans les LLMs qui limite chaque token à n'attendre que ses W voisins les plus proches (W = taille de la fenêtre)...
-
Sliding Window Chunking
Le Sliding Window Chunking est une technique de segmentation de documents pour les pipelines RAG qui decoupe le texte en chunks avec une zone de chevauchement (overlap) entre les chunks consecutifs....
-
SmoothQuant
SmoothQuant est un algorithme de quantisation post-entrainement (PTQ) pour les LLMs, propose par Xiao et al. (MIT/NVIDIA, 2022), qui permet une quantisation INT8 de haute qualite en adressant le...
-
Sonde lineaire de representation (linear probe)
La sonde lineaire de representation (linear probe) est une methode d'interpretabilite qui entraine un classifieur lineaire simple sur les activations internes d'un reseau de neurones pour verifier si...
-
Sparse MoE
Le Sparse Mixture of Experts (Sparse MoE) est une architecture de réseaux de neurones qui combine un grand nombre d'experts (sous-réseaux spécialisés) avec un mécanisme de routage qui n'active qu'un...
-
Speculative Decoding
Le Speculative Decoding est une technique d'optimisation de l'inférence des grands modèles de langage, conçue pour accélérer la génération intrinsèquement séquentielle et autorégressive de tokens, en...
-
Speech-to-Text (STT) avec LLM
Le Speech-to-Text (STT) ou ASR (Automatic Speech Recognition) est la technologie de transcription de l'audio en texte, constituant la premiere etape des assistants vocaux et des pipelines de...
-
Stable Diffusion
Stable Diffusion est un modele generatif de generation d'images base sur la diffusion latente, developpe par Stability AI, RunwayML et LMU Munich (Robin Rombach et al., 2022). C'est le premier grand...
-
State Space Models (SSM)
Les State Space Models (SSM, modèles à espace d'états) constituent une architecture alternative aux transformers pour le traitement de séquences longues, modélisant l'évolution d'un état caché...
-
Steering de modele par activation (activation steering)
Le steering de modele par activation est une technique d'intervention qui modifie le comportement d'un grand modele de langage en ajoutant un vecteur de direction aux activations internes pendant...
-
Suivi d'experiences de machine learning
Le suivi d'experiences de machine learning (experiment tracking) est la discipline et l'outillage qui permettent d'enregistrer, de comparer et de retrouver l'ensemble des parametres et resultats...
-
Superposition Hypothesis
La Superposition Hypothesis est une theorie fondamentale de la mechanistic interpretability des LLMs, proposee par Elhage et al. (Anthropic, 2022) dans le paper 'Toy Models of Superposition'. Elle...
-
Supervised Fine-tuning (SFT)
Le Supervised Fine-tuning (SFT) est la première et indispensable étape du pipeline d'alignement des LLMs après le pré-entraînement. Il consiste à entraîner le modèle de base (base model) sur un...
-
Supervised Learning
Le Supervised Learning, ou apprentissage supervisé, est l'un des trois grands paradigmes de l'apprentissage automatique, dans lequel un modèle est entraîné à partir d'un jeu de données labellisées...
-
Supervision humaine effective
La supervision humaine effective designe l'ensemble des mesures organisationnelles et techniques garantissant qu'une personne peut comprendre, surveiller et, si necessaire, corriger ou arreter le...
-
Surveillance de la derive de concept
La surveillance de la derive de concept (concept drift monitoring) est un dispositif qui detecte les changements de la relation statistique entre les variables d'entree et la variable cible d'un...
-
Surveillance de la derive de donnees
La surveillance de la derive de donnees (data drift monitoring) est un controle continu qui compare la distribution statistique des donnees recues en production a celle des donnees d'entrainement...
-
SWE-Bench
SWE-Bench (Software Engineering Benchmark) est un benchmark pour evaluer la capacite des LLMs et agents IA a resoudre de vrais bugs dans des projets open-source Python populaires (Django, Flask...
-
SwiGLU Activation
SwiGLU (Swish-Gated Linear Unit) est une fonction d'activation pour les couches Feed-Forward Network des Transformers, proposée par Noam Shazeer (Google, 2020) dans le paper "GLU Variants Improve...
-
Synthese vocale neuronale
La synthese vocale neuronale, ou neural text-to-speech, est une methode de conversion de texte en parole s'appuyant sur des reseaux de neurones profonds plutot que sur les techniques statistiques ou...
-
Synthetic Data Generation
La Synthetic Data Generation (génération de données synthétiques) consiste à utiliser des LLMs puissants (GPT-4, Claude Opus, Llama 3 70B) pour créer automatiquement des datasets d'entraînement à...
-
System Card
Une System Card est un document de transparence et de securite publie par les labs IA pour leurs modeles frontiere decrivant en detail les evaluations de securite conduites, les risques identifies...
-
System Prompt
Le System Prompt (instruction systeme) est un message special fourni au LLM au debut d'une session, avant les messages de l'utilisateur, qui definit le contexte, la personnalite, les regles de...
-
System Prompt / Instruction Système
Le System Prompt (ou instruction système) est une directive de haut niveau transmise à un LLM avant la conversation avec l'utilisateur, définissant son rôle, ses contraintes comportementales, son...
-
Systeme d'IA a haut risque
Un systeme d'IA a haut risque est, au sens de l'AI Act europeen, reglement UE 2024/1689, un systeme d'intelligence artificielle dont l'usage presente un potentiel significatif d'atteinte a la sante...
-
Systeme d'IA a risque inacceptable
Un systeme d'IA a risque inacceptable est, au sens de l'article 5 de l'AI Act europeen, un systeme d'intelligence artificielle dont les pratiques sont jugees contraires aux valeurs fondamentales de...
-
Systeme d'IA a risque limite
Un systeme d'IA a risque limite est, dans la classification en quatre niveaux de l'AI Act europeen, un systeme d'intelligence artificielle qui ne presente ni un risque inacceptable ni un risque eleve...
-
Tableau de bord d'évaluation de modèle
Un tableau de bord d'evaluation de modele est une interface qui centralise les indicateurs de performance, de robustesse et de conformite d'un systeme d'IA, destinee aux equipes techniques comme aux...
-
Taxonomie des risques IA
Une taxonomie des risques IA est une classification structuree qui organise et categorise les differents types de risques associes au developpement, au deploiement et a l'usage de systemes...
-
Temperature (LLM)
La température est un paramètre de configuration des grands modèles de langage qui contrôle le degré d'aléa introduit lors de la génération du texte de sortie, en modulant la distribution de...
-
Température / Sampling LLM
La température (temperature) est un hyperparamètre de sampling contrôlant la créativité et l'aléatoire des sorties d'un LLM lors de l'inférence. Elle ajuste la distribution de probabilité des tokens...
-
Tensor Offloading
Le Tensor Offloading (ou CPU offloading) est une technique d'inference LLM qui stocke une partie des poids du modele en RAM CPU (plus grande mais plus lente) et les transfère vers la VRAM GPU (plus...
-
Tensor Parallelism
Le Tensor Parallelism (parallelisme de tenseurs) est une technique de parallelisme pour les LLMs qui partitionne les matrices de poids individuelles (attention, FFN) sur plusieurs GPUs, chaque GPU ne...
-
Test A-B de modele en production
Le test A-B de modele en production est une methode d'evaluation comparative qui expose simultanement deux versions d'un modele d'intelligence artificielle, generalement une version de reference A et...
-
Test de non-regression de modele
Un test de non-regression de modele est une procedure de validation qui verifie qu'une nouvelle version d'un modele d'intelligence artificielle ne degrade pas les performances ou le comportement...
-
Test de robustesse aux perturbations
Un test de robustesse aux perturbations est une procedure d'evaluation qui mesure la stabilite des predictions d'un modele d'IA lorsque ses entrees subissent des modifications legeres...
-
Test de sensibilité au prompt
Un test de sensibilite au prompt est une methode d'evaluation qui mesure la variation des reponses d'un grand modele de langage lorsque la formulation d'une requete change sans en alterer le sens....
-
Test-Time Compute
Le Test-Time Compute (compute au temps d'inference) est l'approche consistant a ameliorer les performances d'un LLM en utilisant davantage de ressources computationnelles lors de la generation d'une...
-
Text-to-Speech (TTS) par IA
Le Text-to-Speech (TTS) par IA est la technologie de synthese vocale qui convertit du texte en parole naturelle, avec des avances recentes qui ont rendu les voix synthetiques pratiquement...
-
Text-to-SQL
Le Text-to-SQL est une capacite qui consiste a traduire automatiquement une question formulee en langage naturel en une requete SQL executable sur une base de donnees relationnelle, permettant a un...
-
TGI (Text Generation Inference)
Text Generation Inference (TGI) est un serveur d'inférence haute performance pour les LLMs développé et maintenu par HuggingFace. C'est la solution d'inférence officielle de HuggingFace Inference...
-
Tiktoken
Tiktoken est la bibliotheque de tokenisation open-source developpee par OpenAI implementant l'algorithme BPE (Byte Pair Encoding) en Rust avec des bindings Python, optimisee pour la vitesse. Elle est...
-
Tokenization
La Tokenization est le processus préliminaire et fondamental qui découpe un texte brut en unités atomiques appelées tokens, constituant les entrées effectivement traitées par un grand modèle de...
-
Tokenization (LLM)
La Tokenization, ou tokenisation, en contexte de grands modèles de langage, est l'étape préalable et obligatoire de découpage d'un texte brut en unités discrètes appelées tokens, plus petites que des...
-
Tokenizer par paires d'octets BPE
Le tokenizer par paires d'octets, ou BPE (Byte Pair Encoding), est un algorithme de tokenisation qui decoupe le texte brut en unites appelees tokens avant qu'il ne soit traite par un modele de...
-
Tokenizer SentencePiece
SentencePiece est un tokeniseur open source developpe par Google qui decoupe un texte brut en unites de sous-mots sans dependre d'une segmentation prealable en mots separes par des espaces. Il traite...
-
Tool Use / Function Calling
Le Tool Use (utilisation d'outils) ou Function Calling est la capacite d'un LLM a identifier quand appeler une fonction ou un outil externe, a generer les arguments corrects pour cet appel, et a...
-
Top-K Routing (MoE)
Le Top-K Routing est le mecanisme de selection d'experts dans les architectures Mixture of Experts (MoE) des LLMs. Un reseau de routage (router) calcule un score d'affinite entre chaque token entrant...
-
Tracabilite des donnees d'entrainement
La tracabilite des donnees d'entrainement designe la capacite a documenter et retracer l'origine, la nature, le traitement et les droits d'usage de chaque jeu de donnees ayant servi a entrainer...
-
Tracage de bout en bout d'une requete IA
Le tracage de bout en bout d'une requete IA (end-to-end tracing) est une technique d'observabilite qui suit et enregistre le parcours complet d'une requete utilisateur a travers l'ensemble des...
-
Traduction automatique neuronale
La traduction automatique neuronale, ou neural machine translation, est une methode de traduction de texte s'appuyant sur des reseaux de neurones profonds entraines sur des corpus paralleles...
-
Training (Entraînement IA)
L'entraînement, ou training, est le processus par lequel un modèle de machine learning ajuste ses paramètres internes à partir d'un jeu de données afin de minimiser l'écart entre ses prédictions et...
-
Training Data Extraction
La Training Data Extraction (extraction de donnees d'entrainement) est une attaque de securite et de confidentialite qui consiste a interroger un LLM de maniere a lui faire reproduire des exemples...
-
Transformeur bidirectionnel
Un transformeur bidirectionnel est une architecture de reseau de neurones qui encode chaque token en tenant compte simultanement du contexte a gauche et a droite dans une sequence. Contrairement aux...
-
Transparence algorithmique
La transparence algorithmique designe l'ensemble des obligations et pratiques visant a rendre visible et comprehensible le fonctionnement d'un systeme algorithmique ou d'intelligence artificielle...
-
Tree-of-Thought
Le Tree-of-Thought (arbre de pensée) est une technique de raisonnement avancée pour les grands modèles de langage, étendant le principe du chain-of-thought en permettant au modèle d'explorer...
-
Triton Inference Server
NVIDIA Triton Inference Server (anciennement TensorRT Inference Server) est une plateforme open-source de serving de modeles d'apprentissage automatique pour la production, supportant de multiples...
-
TruthfulQA
TruthfulQA est un benchmark d'evaluation de la veracite des LLMs, developpe par Lin et al. (University of Oxford / OpenAI, 2021). Il se compose de 817 questions concues pour tester la tendance des...
-
U-Net
Le U-Net est une architecture de reseau de neurones convolutif en forme de U, initialement concue en 2015 pour la segmentation d'images medicales, puis largement reprise comme composant central des...
-
Unité de traitement graphique dédiée à l'inférence
Une unité de traitement graphique dédiée à l'inférence est un GPU conçu ou configuré spécifiquement pour l'exécution de modèles d'IA déjà entraînés en production, par opposition aux GPU dédiés à...
-
Universal Approximation Theorem
Le Theoreme d'Approximation Universelle (Universal Approximation Theorem) est un resultat fondamental de la theorie des reseaux de neurones, enonce par Cybenko (1989) et etendu par Hornik et al....
-
Unsupervised Learning
L'Unsupervised Learning, ou apprentissage non supervisé, est une famille d'algorithmes de machine learning où le modèle découvre la structure sous-jacente de données non étiquetées, sans supervision...
-
Value Alignment
Le Value Alignment (alignement des valeurs) est le probleme fondamental de la securite IA qui consiste a s'assurer que les systemes d'intelligence artificielle poursuivent des objectifs et adoptent...
-
Vector Index
Un vector index, ou index vectoriel, est une structure de données optimisée pour la recherche approximative de plus proches voisins, ANN, Approximate Nearest Neighbor, dans des espaces vectoriels de...
-
Vérification de raisonnement étape par étape (Step-by-step Reasoning Verification)
La vérification de raisonnement étape par étape est une méthode d'évaluation et d'entraînement qui contrôle la validité de chaque étape intermédiaire d'une chaîne de raisonnement produite par un...
-
Video Understanding (LLM)
Le Video Understanding avec les LLMs est la capacite d'un modele multimodal a analyser et raisonner sur des sequences video, comprenant le contenu visuel, le son, le texte incrusted et les relations...
-
Vision par ordinateur industrielle
La vision par ordinateur industrielle est une application specialisee de la vision artificielle qui utilise des cameras et des modeles d'IA pour automatiser l'inspection, le comptage, le guidage...
-
Vision-Language Model (VLM)
Un Vision-Language Model (VLM) est un systeme d'IA capable de traiter et raisonner conjointement sur des images et du texte. Les VLMs combinent un encodeur visuel (generalement un Vision Transformer...
-
ViT (Vision Transformer)
Le Vision Transformer (ViT) est une architecture de deep learning pour la vision par ordinateur qui applique l'architecture Transformer directement aux images, en les decoupant en patches (carreaux)...
-
vLLM
vLLM est un framework open-source d'inférence haute performance pour les LLMs, développé par l'équipe Skylab de UC Berkeley (Kwon et al., 2023). Il introduit PagedAttention, une innovation majeure...
-
Vocabulaire de sous-mots
Le vocabulaire de sous-mots est l'ensemble fini d'unites linguistiques (morceaux de mots, mots entiers ou caracteres) qu'un modele de langage utilise pour representer n'importe quel texte en entree...
-
Vocabulary Size (Taille du vocabulaire)
La Vocabulary Size (taille du vocabulaire) est le nombre total de tokens uniques dans le vocabulaire du tokenizer d'un LLM, determinent la granularite avec laquelle le texte est decoupes en unites de...
-
Vol de modèle par requêtage
Le vol de modele par requetage, ou model extraction attack, est une technique qui permet a un attaquant de reconstruire une copie approximative d'un modele d'IA proprietaire en interrogeant...
-
VQA (Visual Question Answering)
Le VQA (Visual Question Answering) est une tache d'apprentissage profond qui requiert d'un modele de repondre a des questions en langage naturel portant sur le contenu d'une image. C'est une tache...
-
Warmup (Learning Rate Warmup)
Le Learning Rate Warmup est une technique d'optimisation qui consiste a augmenter progressivement le taux d'apprentissage (learning rate) de 0 a sa valeur maximale au debut de l'entrainement, avant...
-
WebDev Arena (benchmark UI)
WebDev Arena est un benchmark specifique a la generation d'interfaces web (HTML/CSS/JavaScript) par les LLMs, fonctionnant sur le meme principe de Chatbot Arena (votes humains par paires). Les...
-
Weight Decay
Le Weight Decay est une technique de regularisation qui ajoute une penalite proportionnelle a la magnitude des poids du modele dans la fonction de perte, encourageant le modele a apprendre des...
-
Weight Tying
Le Weight Tying (partage de poids) est une technique d'optimisation architecturale des LLMs qui consiste a partager la matrice de la couche d'embedding d'entree (token_embedding) et la matrice de la...
-
Zero-Shot Learning IA
Le Zero-Shot Learning, en intelligence artificielle, désigne la capacité d'un modèle à réaliser correctement une tâche pour laquelle il n'a reçu aucun exemple d'entraînement spécifique, en s'appuyant...
-
Zero-shot vs Few-shot Learning
Le Zero-shot Learning et le Few-shot Learning sont deux regimes de prompting qui decrivent le nombre d'exemples de demonstration fournis au LLM dans le prompt pour guider sa reponse sur une tache...