Visual Question Answering (VQA)
Explore la réponse aux questions visuelles (VQA), à l’intersection de la CV et du NLP. Apprends comment Ultralytics YOLO26 alimente la VQA pour les applications en temps réel et l’IA multimodale.
Les questions-réponses visuelles (VQA) constituent une tâche sophistiquée d'intelligence artificielle, à l'intersection de la vision par ordinateur (CV) et du traitement automatique du langage naturel (NLP). Contrairement à la classification d'images traditionnelle, qui attribue une seule étiquette à une image, les systèmes de VQA sont conçus pour répondre à des questions ouvertes en langage naturel sur le contenu visuel d'une image. Par exemple, face à une photographie d'une cuisine, un utilisateur peut demander : « La cuisinière est-elle allumée ? » ou « Combien y a-t-il de pommes dans le bol ? » Pour répondre correctement, le modèle doit comprendre la sémantique du texte, identifier les objets pertinents dans la scène et raisonner sur leurs attributs ainsi que sur leurs relations spatiales.
Cette capacité fait de la VQA un composant fondamental de l'IA multimodale moderne, car elle nécessite le traitement simultané de types de données disparates. L'architecture comprend généralement un encodeur de vision, tel qu'un réseau neuronal convolutif (CNN) ou un Transformer visuel (ViT), pour extraire les caractéristiques de l'image, ainsi qu'un encodeur de texte pour traiter la requête linguistique. Les systèmes avancés utilisent un mécanisme d'attention pour aligner les concepts textuels sur des régions précises de l'image, ce qui permet à l'IA de « regarder » les parties pertinentes de la photo avant de générer une réponse.
Applications et importance dans le monde réel#
La possibilité d'interroger dynamiquement des données visuelles a donné naissance à des applications transformatrices dans divers secteurs, renforçant l'automatisation et l'accessibilité.
- Technologies d'assistance : La VQA est essentielle pour les applications destinées aux personnes malvoyantes. Des outils comme Be My Eyes peuvent exploiter la VQA pour permettre aux utilisateurs de prendre une photo de leur environnement et de poser des questions comme : « Cette bouteille contient-elle du shampoing ou de l'après-shampoing ? » ou « Peut-on traverser la rue sans danger ? » Cela favorise une plus grande autonomie en convertissant les informations visuelles en réponses audio.
- Diagnostic médical : Dans le domaine de l'IA dans les soins de santé, les systèmes de VQA assistent les radiologues en analysant des images médicales. Un praticien peut interroger un système au sujet d'une radiographie avec des questions comme : « Y a-t-il des signes de fracture dans le quadrant supérieur gauche ? » Des chercheurs des Instituts nationaux de la santé (NIH) ont étudié la VQA afin de fluidifier la prise de décision clinique et de réduire les erreurs de diagnostic.
- Surveillance intelligente : Les systèmes de sécurité modernes utilisent l'IA pour la sécurité pour analyser des heures d'enregistrements vidéo. Plutôt que d'effectuer une vérification manuelle, les opérateurs peuvent demander : « Un camion rouge est-il entré dans le quai de chargement après minuit ? » La VQA permet une détection rapide des anomalies basée sur des critères précis plutôt que sur des alertes de mouvement génériques.
Le rôle de la détection d'objets dans la VQA#
Bien que certains modèles de VQA soient entraînés de bout en bout, beaucoup s'appuient d'abord sur un réseau dorsal de détection d'objets robuste pour identifier les éléments de la scène. Localiser précisément les objets fournit le contexte nécessaire au moteur de raisonnement. Le modèle Ultralytics YOLO26 constitue une excellente base pour ces pipelines grâce à sa grande précision et à ses performances en temps réel.
Par exemple, les développeurs peuvent utiliser YOLO26 pour extraire les classes d'objets et les boîtes englobantes, qui sont ensuite transmises à un grand modèle de langage (LLM) ou à un module de raisonnement spécialisé afin de répondre aux requêtes des utilisateurs. La gestion des jeux de données servant à entraîner ces réseaux dorsaux de détection est souvent simplifiée grâce à l'Ultralytics Platform, qui facilite l'annotation et l'entraînement dans le cloud.
L'exemple Python suivant montre comment utiliser Ultralytics YOLO26 pour extraire le contexte visuel (les objets et leur position) d'une image, ce qui constitue l'étape principale d'un workflow de VQA :
from ultralytics import YOLO
# Load the YOLO26 model (latest generation)
model = YOLO("yolo26n.pt")
# Run inference to detect objects, providing context for VQA
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display detected classes (e.g., 'bus', 'person') to verify scene understanding
for result in results:
result.show() # Visualize the detectionsDistinguer la VQA des concepts associés#
Il est utile de distinguer la VQA des tâches similaires de vision et de langage afin de comprendre sa portée spécifique.
- VQA et description d'image : La description d'image génère une description générique et statique de l'ensemble d'une image (par exemple : « Un chien joue dans le parc »). La VQA est interactive et spécifique ; elle fournit une réponse ciblée à la question d'un utilisateur plutôt qu'un résumé général.
- VQA et ancrage visuel : L'ancrage visuel consiste à localiser un objet précis mentionné dans une expression textuelle en traçant une boîte englobante autour de celui-ci. La VQA va plus loin en analysant les attributs, les actions ou les quantités des objets trouvés.
- VQA et OCR : Alors que la reconnaissance optique de caractères (OCR) sert strictement à extraire du texte à partir d'images, la VQA peut intégrer l'OCR pour répondre à des questions comme « Que dit le panneau de signalisation ? » Cependant, la fonction principale de la VQA comprend une compréhension plus large de la scène, au-delà de la simple lecture du texte.
Les chercheurs continuent de faire progresser ce domaine grâce à des références à grande échelle telles que le jeu de données VQA, qui aide les modèles à se généraliser sur des millions de paires image-question. À mesure que le matériel évolue et permet une latence d'inférence plus faible, la VQA devient de plus en plus viable pour les applications mobiles et edge en temps réel.









