Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Video Understanding (LLM)

ia

Définition

Le Video Understanding avec les LLMs est la capacite d'un modele multimodal a analyser et raisonner sur des sequences video, comprenant le contenu visuel, le son, le texte incrusted et les relations temporelles entre les frames. C'est une extension du VQA (Visual Question Answering) et de l'image captioning aux dimensions temporelles. Les defis specifiques du video understanding : (1) Redondance temporelle — les frames video successives sont tres similaires ; un video de 30fps a 10 secondes = 300 frames. Prendre toutes les frames est prohibitif, d'ou les strategies de sampling adaptatif. (2) Comprehension temporelle — comprendre 'avant', 'apres', 'pendant que' necessitent de raisonner sur des sequences d'evenements. (3) Longue duree — les videos de 1+ heures depassent les capacites actuelles de contexte. Les approches pour le video understanding : (1) Frame sampling + vision LLM — echantillonner 1-8 frames/seconde, les encoder avec ViT, concatener les tokens visuels temporellement, passer au LLM (Qwen-VL, LLaVA-Next-Video). (2) Video-specific encoders — VideoMAE, VideoLLaMA apprennent des representations temporelles specifiques au video. (3) Long-video streaming — Gemini 1.5 Pro traite la video frame par frame en streaming via sa large fenetre de contexte (1M tokens = ~45 minutes de video a 1fps). Les benchmarks video understanding : EgoSchema (comprehension video egocentric a longue duree), MVBench (series de 20 taches video), Video-MME (questions multi-choix sur videos courts et longs), ActivityNet-QA (QA sur des videos de 3-5 minutes). Ces benchmarks revelent les differences entre les modeles specialises video et les VLMs generaux. Les applications enterprise : surveillance intelligente (detection d'anomalies, analyse de comportement), formation et e-learning (analyse de sessions, comprehension de demonstrations), media et entertainment (indexation et recherche de contenu video, generation de resumes), sport analytics (analyse de performances, detection de tactiques), et securite (detection d'intrusions, analyse de comportements).

Video QA avec Gemini 1.5 Pro

import google.generativeai as genai

# Uploader la video (supporte mp4, avi, mov, etc.)
video_file = genai.upload_file('demo_produit.mp4', mime_type='video/mp4')

# Attendre que le traitement soit termine
while video_file.state.name == 'PROCESSING':
    video_file = genai.get_file(video_file.name)

model = genai.GenerativeModel('gemini-1.5-pro')
response = model.generate_content([
    video_file,
    'Identifie les fonctionnalites presentees et les problemes detectes dans cette demo produit.'
])
print(response.text)

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis