3D Object Detection
Explore la détection d’objets 3D pour maîtriser la perception spatiale en IA. Découvre comment Ultralytics YOLO26 permet d’estimer en conditions réelles la profondeur, l’orientation et les boîtes englobantes 3D.
La détection d'objets 3D est une tâche sophistiquée de vision par ordinateur qui permet aux machines d'identifier, de localiser et de déterminer la taille d'objets dans un espace tridimensionnel. Contrairement à la détection d'objets 2D traditionnelle, qui trace une boîte englobante plate autour d'un élément dans une image, la détection d'objets 3D estime un cuboïde (une boîte 3D) qui englobe l'objet. Elle fournit ainsi des informations essentielles sur la profondeur, l'orientation (direction) et les dimensions spatiales précises, permettant aux systèmes de comprendre non seulement ce qu'est un objet, mais aussi exactement où il se trouve par rapport au capteur dans le monde réel. Cette capacité est fondamentale pour les technologies qui doivent interagir physiquement avec leur environnement.
Fonctionnement de la détection d'objets 3D#
Pour percevoir la profondeur et le volume, les modèles de détection 3D s'appuient généralement sur des entrées de données plus riches que celles fournies par les caméras standard. Si certaines méthodes avancées peuvent déduire des structures 3D à partir d'images monoculaires (à objectif unique), la plupart des systèmes robustes utilisent des données provenant de capteurs LiDAR, de radars ou de caméras stéréo. Ces capteurs génèrent des nuages de points—d'immenses ensembles de points de données représentant la surface externe des objets.
Le processus comprend plusieurs étapes clés :
- Acquisition des données : Les capteurs capturent la géométrie de la scène. Le LiDAR, par exemple, utilise des impulsions laser pour mesurer les distances et créer une carte 3D précise.
- Extraction des caractéristiques : Les modèles de deep learning, souvent basés sur des réseaux neuronaux convolutifs (CNNs) ou des Transformers, traitent le nuage de points ou les données d'image fusionnées afin d'identifier des motifs.
- Prédiction de la boîte englobante : Le modèle produit une boîte englobante 3D définie par ses coordonnées centrales (x, y, z), ses dimensions (longueur, largeur, hauteur) et son angle de rotation (lacet).
- Classification : Comme pour la classification d'images, le système attribue une étiquette (par exemple, « piéton » ou « véhicule ») à l'objet détecté.
Différence entre la détection 2D et la détection 3D#
Il est important de distinguer ces deux concepts associés.
- Détection d'objets 2D : Elle fonctionne sur des images plates (des pixels). Elle indique qu'un objet se trouve dans le « coin supérieur gauche » ou le « coin inférieur droit » d'une image, mais ne peut pas évaluer efficacement la distance ou la taille réelle sans repères de référence. Elle est idéale pour des tâches comme l'identification de défauts de fabrication ou l'analyse de flux vidéo lorsque la profondeur est moins importante.
- Détection d'objets 3D : Elle fonctionne dans un espace volumétrique (voxels ou points). Elle fournit la distance par rapport à la caméra (profondeur), la taille physique de l'objet et son orientation. Elle est essentielle pour éviter les collisions dans des environnements dynamiques.
Applications concrètes#
Le passage de la perception 2D à la perception 3D ouvre la voie à de puissants cas d'utilisation dans les secteurs où la sécurité et la perception spatiale sont essentielles.
- Conduite autonome : Les voitures autonomes dépendent fortement de la détection 3D pour se déplacer en toute sécurité. En traitant les données provenant du LiDAR et des caméras, le véhicule peut détecter d'autres voitures, des piétons et des obstacles, et calculer leur distance et leur vitesse exactes. Le système de perception peut ainsi prédire les trajectoires et prendre des décisions de freinage ou de direction dans des scénarios d'inférence en temps réel. Des entreprises comme Waymo utilisent ces ensembles de capteurs sophistiqués pour cartographier instantanément les environnements urbains.
- Robotique et prélèvement en bacs : Dans la logistique et l'entreposage, les robots doivent saisir des objets de formes et de tailles variées dans des bacs. La détection 3D permet à un bras robotisé de comprendre l'orientation d'un colis, de déterminer le meilleur point de préhension et de planifier une trajectoire sans collision pour déplacer l'élément. Elle améliore l'efficacité de l'IA dans la logistique en automatisant des tâches manuelles complexes.
Implémentation de la détection d'objets avec Ultralytics#
Même si la détection 3D complète nécessite souvent des architectures spécialisées pour les nuages de points, les détecteurs 2D modernes comme YOLO26 sont de plus en plus utilisés comme composants de flux de travail pseudo-3D ou pour estimer la profondeur grâce à la mise à l'échelle des boîtes englobantes. Pour les développeurs qui souhaitent entraîner des modèles sur leurs propres jeux de données, l'Ultralytics Platform offre un environnement simplifié pour l'annotation et l'entraînement.
Voici un exemple simple d'exécution d'une détection standard à l'aide de l'API Python d'Ultralytics, qui constitue souvent la première étape d'un pipeline de perception plus vaste :
import cv2
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Perform inference on a local image
results = model("path/to/image.jpg")
# Visualize the results
for result in results:
# Plot predictions on the image (returns a numpy array)
im_array = result.plot()
# Display using OpenCV
cv2.imshow("Detections", im_array)
cv2.waitKey(0) # Press any key to close
cv2.destroyAllWindows()Défis et tendances futures#
Malgré son utilité, la détection d'objets 3D présente des difficultés liées au coût de calcul et au prix des capteurs. Le traitement de millions de points dans un nuage de points nécessite une puissance GPU importante, ce qui rend le déploiement sur des appareils edge difficile. Toutefois, les innovations en matière de quantification des modèles et d'architectures neuronales efficaces réduisent cette charge.
En outre, des techniques comme la fusion de capteurs améliorent la précision en combinant les informations riches en couleurs des caméras avec les données de profondeur précises du LiDAR. À mesure que ces technologies arrivent à maturité, on peut s'attendre à voir la perception 3D intégrée à des appareils plus accessibles, des lunettes de réalité augmentée aux appareils électroménagers intelligents.









