Stereo Vision
La vision stéréoscopique calcule la profondeur en 3D en comparant des images d’une scène prises sous des angles légèrement différents, comme le font les yeux humains. Présentation des usages et de l’estimation de profondeur monoculaire.
La vision stéréo, également appelée vision stéréoscopique, est une technique de vision par ordinateur utilisée pour extraire des informations de profondeur 3D à partir d’images numériques. En comparant deux images 2D ou plus d’une même scène, prises sous des angles légèrement différents — à l’image de la vision binoculaire humaine —, les systèmes d’IA peuvent calculer avec précision la distance des objets. Cette capacité est fondamentale pour l’intelligence spatiale, qui permet aux machines de se déplacer dans leur environnement et d’interagir en toute sécurité avec des objets physiques.
Fonctionnement de la vision stéréo#
Le processus repose sur la recherche des différences entre les vues des caméras gauche et droite. Le principal défi est le problème de correspondance, qui consiste à identifier exactement les mêmes pixels ou caractéristiques dans les deux images. Une fois les points correspondants trouvés, le système calcule le décalage horizontal et crée une carte de disparité.
Dans une carte de disparité, les décalages plus importants indiquent des objets plus proches, tandis que les décalages plus faibles signalent des objets plus éloignés. Cette carte est ensuite convertie en un nuage de points 3D dense par triangulation. Alors que ces calculs reposaient traditionnellement sur des algorithmes mathématiques, les approches modernes font de plus en plus appel aux réseaux neuronaux convolutifs (CNNs) et à l’apprentissage profond pour améliorer la précision de l’appariement des caractéristiques dans des conditions d’éclairage complexes ou dans des zones sans texture ; ce sujet fait l’objet de recherches actives en vision par ordinateur à l’IEEE.
Vision stéréo et estimation de profondeur monoculaire#
Il est important de distinguer la vision stéréo des techniques d’estimation de profondeur qui n’utilisent qu’une seule caméra. L’estimation monoculaire de la profondeur fait appel à des modèles d’apprentissage profond pour prédire les structures 3D à partir d’une seule image 2D, en s’appuyant sur des indices visuels comme la perspective et les ombres. En revanche, les systèmes stéréo mesurent directement la profondeur grâce à la relation géométrique entre deux objectifs de caméra. Les méthodes monoculaires demandent moins de calcul, mais la vision stéréo fournit généralement des mesures de profondeur plus précises et en temps réel, indispensables aux systèmes de sécurité critiques.
Applications de l’IA en conditions réelles#
Les systèmes stéréo sont essentiels dans de nombreux secteurs qui nécessitent une détection d’objets 3D dans le monde réel et une perception spatiale.
- Navigation autonome : Les systèmes d’aide à la conduite et de conduite autonome utilisent des caméras stéréo pour estimer en temps réel la distance aux piétons, aux autres véhicules et aux obstacles. Ils transmettent ces données de profondeur aux systèmes de modélisation prédictive afin de planifier des itinéraires sûrs, tandis que des entreprises comme Waymo s’appuient également sur le lidar pour mesurer directement la profondeur.
- Automatisation robotique industrielle : Les robots de fabrication utilisent la vision stéréo pour les tâches complexes de prélèvement dans des bacs. En calculant la profondeur et l’orientation exactes de pièces dispersées sur un tapis roulant, les systèmes robotiques peuvent aligner parfaitement leurs pinces, ce qui améliore l’efficacité des chaînes de fabrication intelligente.
- Imagerie médicale avancée : Les robots chirurgicaux et les systèmes de diagnostic utilisent des caméras stéréoscopiques pour fournir aux chirurgiens une vue 3D très précise de l’anatomie du patient pendant les interventions mini-invasives ; l’endoscopie stéréo reste un sujet de recherche actif dans les prépublications arXiv sur la vision par ordinateur.
Intégrer l’IA aux données stéréo#
Les développeurs utilisent souvent la vision stéréo avec la détection d’objets pour trouver à la fois quoi et à quelle distance. Le framework OpenCV sert couramment à générer des cartes de disparité, souvent intégrées à des pipelines plus larges sous PyTorch ou TensorFlow, tandis que les modèles d’IA assurent la perception. Voici un exemple conceptuel de détection d’objets avec Ultralytics YOLO26 et de récupération de leurs boîtes englobantes, qui pourraient ensuite servir à extraire des valeurs de distance moyenne d’une carte de disparité OpenCV associée.
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific regionProgrès et tendances futures#
L’entraînement et le déploiement de modèles de perception avancés sont devenus très simples. À l’aide d’outils comme la plateforme Ultralytics, les équipes peuvent annoter des paires stéréo en toute sécurité, entraîner des modèles robustes et les exporter vers des formats optimisés comme TensorRT pour une inférence à faible latence sur des appareils d’IA en périphérie.
La recherche sur la vision stéréo combine de plus en plus la vision stéréo avec les Vision Transformers (ViT) et de grands modèles de fondation préentraînés afin de résoudre plus efficacement le problème des correspondances, tandis que des laboratoires comme le Stanford Vision and Learning Lab et Google DeepMind font progresser la perception 3D connexe pour l’IA incarnée. En outre, à mesure que les modèles d’IA multimodale d’acteurs majeurs comme Anthropic et OpenAI évoluent, l’intégration de données spatiales 3D robustes continuera d’élargir les capacités de perception et de compréhension des agents d’IA incarnée.










