Modele de langage vision-action VLA
iaDéfinition
Un modele de langage vision-action (VLA, Vision-Language-Action) est une architecture d'intelligence artificielle qui combine la comprehension du langage naturel, la perception visuelle et la generation de commandes motrices pour piloter un agent physique, typiquement un robot. Introduits publiquement avec des systemes comme RT-2 de Google DeepMind en 2023, les modeles VLA sont generalement construits en ajoutant une tete de sortie specialisee (action) a un modele vision-langage (VLM) pre-entraine, permettant de traduire une instruction textuelle et une observation camera en une sequence de trajectoires ou de couples articulaires. L'entrainement combine des donnees web (texte, images) et des donnees de teleoperation robotique, souvent rares et couteuses a collecter, ce qui explique le recours croissant a des jeux de donnees mutualises comme Open X-Embodiment. Ces modeles visent a generaliser au-dela des taches pour lesquelles ils ont ete specifiquement entraines, contrairement aux systemes de controle robotique classiques bases sur des regles. Pour un DSI evaluant l'automatisation industrielle ou logistique, les VLA representent une rupture potentielle mais posent des enjeux de securite fonctionnelle critiques : latence d'inference, absence de garanties formelles de comportement, et necessite de mecanismes de securite physique independants (arret d'urgence materiel) tant que la certification de ces systemes reste embryonnaire.
Ce terme vous interpelle ?
Nos experts interviennent sur toutes les thématiques de ce glossaire — pentest, conformité NIS 2 / ISO 27001, forensics, sécurité IA. Réponse sous 24h, devis gratuit et sans engagement.