Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Multimodal Alignment

ia

Définition

Le Multimodal Alignment est l'ensemble des techniques permettant d'aligner les representations apprises independamment pour differentes modalites (texte, images, audio, video) dans un espace commun ou coherent, permettant au modele de raisonner conjointement sur ces differentes modalites. C'est la brique fondamentale des Vision-Language Models (VLMs) et plus largement des modeles multimodaux. CLIP (OpenAI, 2021) est le fondement du multimodal alignment moderne : en entrainant un encodeur texte et un encodeur image a produire des embeddings proches pour des paires image-caption valides (contrastive learning sur 400M paires web), CLIP a appris un espace latent partage ou les concepts visuels et linguistiques correspondants sont colocalisees. Les VLMs modernes (LLaVA, InstructBLIP, Qwen-VL, Llama 3.2 Vision) utilisent une architecture en trois parties : un encodeur visuel (ViT pretrained, souvent avec CLIP), un connecteur de projection (MLP ou Perceiver Resampler) qui transforme les tokens visuels en tokens compatibles avec le LLM, et le LLM lui-meme. L'entrainement se fait en deux phases : aligner le connecteur visuel, puis fine-tuner le tout sur des donnees instruction. La qualite du multimodal alignment se mesure par la capacite du modele a : repondre a des questions sur des images (VQA), suivre des instructions multimodales ('encercle le chien dans cette image'), comprendre des graphiques et diagrammes, lire du texte dans des images (OCR). Des benchmarks specifiques comme MMBench, MMStar et MMMU evaluent ces capacites. Les defis du multimodal alignment : le probleme de l'hallucination visuelle (le modele decrit des elements qui ne sont pas dans l'image), la difficulte a aligner les representations de video (sequences temporelles) avec du texte, et l'alignement des representations audio avec du texte (pour les modeles speech-language integres comme Gemini Audio).

Architecture LLaVA (Vision-Language Model)

# Simplifie : architecture LLaVA-style
# 1. Encoder visuel : ViT-L/14 (CLIP) - 256 tokens visuels
# 2. Projection MLP : 256 tokens visuels -> 256 tokens LLM-dimensionnel
# 3. LLM : Llama 3 8B Instruct

from transformers import LlavaForConditionalGeneration, LlavaProcessor

model = LlavaForConditionalGeneration.from_pretrained('llava-hf/llava-1.5-7b-hf')
processor = LlavaProcessor.from_pretrained('llava-hf/llava-1.5-7b-hf')

# Input : image + question
inputs = processor(
    images=image,
    text='\nUser: Decris cette image en detail.\nAssistant:',
    return_tensors='pt'
)
output = model.generate(**inputs, max_new_tokens=200)

Benchmarks Multimodal 2025

ModeleMMBenchMMStarMMMU
GPT-4o83.463.969.1
Gemini 1.5 Pro82.259.165.8
Claude 3.5 Sonnet78.162.268.3
InternVL 2.5 8B79.463.464.3

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis