Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

VQA (Visual Question Answering)

ia

Définition

Le VQA (Visual Question Answering) est une tache d'apprentissage profond qui requiert d'un modele de repondre a des questions en langage naturel portant sur le contenu d'une image. C'est une tache fondamentale en IA multimodale car elle exige de combiner la comprehension visuelle (detecter et reconnaitre les elements de l'image) avec la comprehension linguistique (comprendre la question) et le raisonnement (faire le lien entre les deux). Le dataset VQA v2 (Goyal et al., 2017) est le benchmark de reference historique : 265K images (COCO), 5,8M questions, annotees par des humains. Les questions varient de simples ('Quelle couleur est la voiture ?') a complexes ('Y a-t-il plus de hommes que de femmes dans cette image ?'). La precision humaine est d'environ 83%, servant de reference pour les modeles. Les architectures VQA modernes utilisent des Vision-Language Models (VLM) : GPT-4V, Claude 3 Opus, Gemini 1.5 Pro, LLaVA, InternVL. Ces modeles encodent l'image via un ViT ou ResNet, encodent la question via un transformer texte, fusionnent les deux representations et generent la reponse. Les meilleurs modeles depassent maintenant 80% de precision sur VQA v2. Les applications enterprise du VQA sont nombreuses : analyse automatique de documents avec tableaux et graphiques, inspection qualite industrielle (image + requete), assistance medicale (analyse d'imagerie + question clinique), e-commerce (question sur les specifications d'un produit avec photo), et accessibilite pour les personnes malvoyantes. Des variantes avancees incluent le TextVQA (questions sur du texte dans les images), DocVQA (questions sur des documents scannes), ScienceQA (questions scientifiques avec diagrammes) et ChartQA (interpretation de graphiques). Ces benchmarks plus complexes testent des capacites de comprehension plus profondes.

VQA avec GPT-4o (API Vision)

import openai, base64

def vqa(image_path, question):
    with open(image_path, 'rb') as f:
        img_b64 = base64.b64encode(f.read()).decode()

    client = openai.OpenAI()
    response = client.chat.completions.create(
        model='gpt-4o',
        messages=[{'role': 'user', 'content': [
            {'type': 'image_url', 'image_url': {
                'url': f'data:image/jpeg;base64,{img_b64}'
            }},
            {'type': 'text', 'text': question}
        ]}]
    )
    return response.choices[0].message.content

Benchmarks VQA 2025

BenchmarkDomaineSOTA score
VQA v2Images naturelles~83% (pres humain)
TextVQATexte dans image~80%
DocVQADocuments scannes~96% (modeles OCR)
ChartQAGraphiques~90%
MMStarMultimodal hard~70%

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis