Visual Reasoning
Explore le raisonnement visuel en IA et découvre comment les modèles déduisent la logique spatiale. Découvre comment créer des pipelines de raisonnement avancés avec Ultralytics YOLO26.
Le raisonnement visuel en intelligence artificielle désigne la capacité d'un modèle à analyser, interpréter et tirer des déductions logiques à partir de données visuelles et spatiales. Alors que les systèmes standards de vision par ordinateur (CV) excellent à identifier les objets présents dans une scène, le raisonnement visuel va plus loin en cherchant à comprendre comment et pourquoi ces objets interagissent. Inspirée par la faculté cognitive humaine du raisonnement visuel et évaluée au moyen de tests standards de psychologie cognitive, cette capacité permet aux modèles d'IA d'effectuer des analyses complexes d'images, de déduire des relations spatiales et de résoudre des problèmes en plusieurs étapes en se fondant uniquement sur le contexte visuel. Il s'agit d'un composant essentiel pour combler le fossé entre la perception brute et une intelligence exploitable dans les systèmes d'IA multimodale.
Concepts fondamentaux et paradigme « penser avec des images »#
Historiquement, les modèles d'apprentissage automatique convertissaient les données d'image en texte avant d'appliquer une déduction logique. Cependant, les avancées récentes de 2024 et 2025 ont popularisé un paradigme dans lequel les modèles pensent intrinsèquement avec des images. En s'appuyant sur le raisonnement visuel latent, les modèles vision-langage (VLM) avancés peuvent générer des représentations visuelles intermédiaires — de la même manière qu'un humain pourrait visualiser une carte mentale telle qu'elle est définie dans les paramètres spatiaux de la NIH Toolbox — avant de parvenir à une conclusion.
Cette approche utilise souvent un mécanisme appelé Visualisation multimodale de la pensée (MVoT). Au lieu de s'appuyer uniquement sur une chaîne de pensée textuelle, les systèmes peuvent explorer le raisonnement par visualisation spatiale afin de vérifier les changements géométriques, d'évaluer les occultations et de suivre les mouvements continus dans un espace 3D.
Raisonnement visuel et capacités connexes#
Il est utile de distinguer le raisonnement visuel des autres terminologies de l'IA qui se recoupent :
- Modèles de raisonnement : Il s'agit d'une catégorie plus large qui englobe les modèles conçus pour effectuer des déductions logiques en plusieurs étapes, généralement dans les domaines du texte, des mathématiques ou du codage. Le raisonnement visuel applique ces principes déductifs spécifiquement aux données visuelles et spatiales.
- Réponse à des questions visuelles (VQA) : La VQA est une application ou une tâche spécifique dans laquelle une IA fournit une réponse en langage naturel à l'invite d'un utilisateur concernant une image. Le raisonnement visuel est la capacité cognitive sous-jacente qui permet la VQA, en permettant au modèle de déduire la bonne réponse à partir du contexte spatial.
Applications concrètes#
La capacité à interpréter dynamiquement les contextes spatiaux ouvre la voie à des flux de travail agentiques transformateurs dans les domaines physiques et numériques.
- IA en robotique et intelligence incarnée : Les agents autonomes et les bras robotiques ont besoin d'une intelligence spatiale sophistiquée pour évoluer dans des environnements complexes. Grâce au raisonnement visuel, un robot peut déduire qu'un objet fragile est empilé sous une boîte lourde et planifier logiquement une séquence de mouvements pour le récupérer sans l'endommager, en s'appuyant largement sur l'évaluation des contraintes physiques dynamiques.
- IA pour le diagnostic médical : En imagerie médicale, les professionnels utilisent des systèmes de raisonnement visuel pour aller au-delà de la simple détection d'anomalies. Les modèles peuvent évaluer des examens IRM en 3D afin de raisonner structurellement sur la trajectoire de croissance d'une tumeur par rapport aux organes environnants, en fournissant un contexte géométrique essentiel à la planification chirurgicale.
Mise en œuvre de la perception pour les pipelines de raisonnement#
Pour créer des systèmes de raisonnement efficaces, les développeurs s'appuient sur des modèles de perception haute vitesse afin d'extraire le contexte structurel du monde physique. Ultralytics YOLO26 constitue une puissante couche fondamentale qui convertit rapidement les pixels en coordonnées structurées de boîtes englobantes et en classes d'objets. Ces données structurées sont ensuite transmises à des moteurs spécialisés de raisonnement visuel, conçus avec des frameworks comme PyTorch ou TensorFlow, afin d'évaluer la logique spatiale.
Si tu compares YOLO26 et YOLO11 pour cette tâche, l'architecture native de bout en bout de YOLO26 réduit la latence d'inférence, ce qui la rend idéale pour les pipelines logiques en temps réel.
L'extrait de code Python suivant montre comment utiliser Ultralytics YOLO26 pour extraire des coordonnées spatiales et fournir les entrées perceptuelles essentielles nécessaires au raisonnement spatial en aval :
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Run inference to detect objects in a scene
results = model("https://ultralytics.com/images/bus.jpg")
# Extract structured spatial data for the visual reasoning engine
for result in results:
for box in result.boxes:
cls_name = model.names[int(box.cls)]
# xyxy provides exact spatial coordinates (left, top, right, bottom)
coords = box.xyxy[0].tolist()
print(f"Object: {cls_name}, Spatial Coordinates: {coords}")La mise à l'échelle de ces applications complexes et multimodales nécessite une infrastructure robuste. L'Ultralytics Platform fournit un environnement unifié pour annoter facilement des jeux de données d'intelligence spatiale, entraîner des modèles dans le cloud et déployer des systèmes de perception fiables en périphérie. À mesure que le domaine évolue vers des frameworks agentiques plus avancés pour les tâches spatiales, et avec le soutien de la recherche avancée en vision, associer une détection d'objets très précise à la déduction logique représente la prochaine frontière de l'intelligence artificielle.









