VQA (Visual Question Answering)
iaDéfinition
Le VQA (Visual Question Answering) est une tache d'apprentissage profond qui requiert d'un modele de repondre a des questions en langage naturel portant sur le contenu d'une image. C'est une tache fondamentale en IA multimodale car elle exige de combiner la comprehension visuelle (detecter et reconnaitre les elements de l'image) avec la comprehension linguistique (comprendre la question) et le raisonnement (faire le lien entre les deux). Le dataset VQA v2 (Goyal et al., 2017) est le benchmark de reference historique : 265K images (COCO), 5,8M questions, annotees par des humains. Les questions varient de simples ('Quelle couleur est la voiture ?') a complexes ('Y a-t-il plus de hommes que de femmes dans cette image ?'). La precision humaine est d'environ 83%, servant de reference pour les modeles. Les architectures VQA modernes utilisent des Vision-Language Models (VLM) : GPT-4V, Claude 3 Opus, Gemini 1.5 Pro, LLaVA, InternVL. Ces modeles encodent l'image via un ViT ou ResNet, encodent la question via un transformer texte, fusionnent les deux representations et generent la reponse. Les meilleurs modeles depassent maintenant 80% de precision sur VQA v2. Les applications enterprise du VQA sont nombreuses : analyse automatique de documents avec tableaux et graphiques, inspection qualite industrielle (image + requete), assistance medicale (analyse d'imagerie + question clinique), e-commerce (question sur les specifications d'un produit avec photo), et accessibilite pour les personnes malvoyantes. Des variantes avancees incluent le TextVQA (questions sur du texte dans les images), DocVQA (questions sur des documents scannes), ScienceQA (questions scientifiques avec diagrammes) et ChartQA (interpretation de graphiques). Ces benchmarks plus complexes testent des capacites de comprehension plus profondes.
VQA avec GPT-4o (API Vision)
import openai, base64
def vqa(image_path, question):
with open(image_path, 'rb') as f:
img_b64 = base64.b64encode(f.read()).decode()
client = openai.OpenAI()
response = client.chat.completions.create(
model='gpt-4o',
messages=[{'role': 'user', 'content': [
{'type': 'image_url', 'image_url': {
'url': f'data:image/jpeg;base64,{img_b64}'
}},
{'type': 'text', 'text': question}
]}]
)
return response.choices[0].message.contentBenchmarks VQA 2025
| Benchmark | Domaine | SOTA score |
|---|---|---|
| VQA v2 | Images naturelles | ~83% (pres humain) |
| TextVQA | Texte dans image | ~80% |
| DocVQA | Documents scannes | ~96% (modeles OCR) |
| ChartQA | Graphiques | ~90% |
| MMStar | Multimodal hard | ~70% |
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h