Qu’est-ce que l’estimation de profondeur monoculaire ? Présentation
Découvre le fonctionnement de l’estimation de profondeur monoculaire, sa comparaison avec les méthodes de profondeur fondées sur des capteurs et son rôle dans une perception 3D évolutive pour les systèmes de vision.

Les voitures autonomes sont conçues pour comprendre ce qui se passe autour d’elles afin de pouvoir se déplacer en toute sécurité. Cela implique d’aller au-delà de la simple reconnaissance d’objets comme les piétons ou les autres véhicules.
Elles doivent également savoir à quelle distance se trouvent ces objets afin de réagir correctement. Cependant, donner aux machines cette perception de la distance n’est pas simple. Contrairement aux humains, elles ne perçoivent pas naturellement la profondeur à partir d’images et doivent apprendre explicitement à le faire.
L’une des raisons est que la plupart des caméras capturent le monde sous forme d’images plates et bidimensionnelles. Transformer ces images en une représentation reflétant la profondeur et la structure 3D du monde réel est complexe, en particulier lorsque les systèmes doivent fonctionner de manière fiable dans des conditions quotidiennes.
Fait intéressant, la vision par ordinateur, une branche de l’IA qui se concentre sur l’interprétation et la compréhension des données visuelles, permet aux machines de mieux comprendre le monde à partir d’images. Par exemple, l’estimation de la profondeur monoculaire est une technique de vision par ordinateur qui estime la distance des objets à partir d’une seule image prise par une caméra.
En apprenant des indices visuels comme la taille des objets, la perspective, la texture et l’ombrage, ces modèles peuvent prédire la profondeur sans dépendre de capteurs supplémentaires comme le LiDAR (détection et télémétrie par la lumière) ou les caméras stéréo. Dans cet article, tu découvriras ce qu’est l’estimation de la profondeur monoculaire, son fonctionnement et certaines de ses applications concrètes. Commençons !
Brève introduction à l’estimation de la profondeur monoculaire#
L’estimation de la profondeur monoculaire permet à une machine de comprendre à quelle distance se trouvent les objets en utilisant une seule image. Comme elle repose sur une seule caméra, cette approche offre plusieurs avantages, notamment un coût réduit et des exigences matérielles plus simples.
Elle peut par exemple être utilisée dans des robots domestiques abordables fonctionnant avec une seule caméra. Même à partir d’une seule image, le système robotique peut identifier les murs les plus proches et les portes les plus éloignées, puis déduire la profondeur globale de l’espace.
Souvent, une seule image ne contient pas d’informations à la bonne échelle. L’estimation de la profondeur monoculaire se concentre donc généralement sur la profondeur relative. Autrement dit, elle peut déterminer quels objets sont les plus proches et lesquels sont les plus éloignés, même si les distances exactes sont inconnues.
Lorsqu’un modèle est entraîné sur des données contenant des distances de référence ou une profondeur absolue, comme des mesures de profondeur provenant de capteurs tels que le LiDAR, il peut apprendre à prédire des distances dans des unités réelles, comme les mètres. Sans ce type de données de référence, le modèle peut toujours déduire la profondeur relative, mais il ne peut pas estimer de manière fiable les distances absolues.
La sortie de l’estimation de la profondeur monoculaire est généralement une carte de profondeur, c’est-à-dire une image dans laquelle chaque pixel représente la proximité ou l’éloignement de la partie correspondante de la scène. Une carte de profondeur fournit aux systèmes de vision une compréhension de base de la structure 3D de l’environnement.

Fig. 1. Exemple de carte de profondeur prédite créée à l’aide de l’estimation de la profondeur monoculaire (Source)
Des capteurs aux images : estimer la profondeur#
L’estimation de la profondeur peut être abordée de plusieurs façons, selon les capteurs disponibles, les contraintes matérielles et les exigences de précision. Les méthodes traditionnelles s’appuient souvent sur plusieurs points de vue ou sur des capteurs spécialisés pour mesurer directement la distance.
Une approche courante est la vision stéréo, qui estime la profondeur en comparant deux images synchronisées prises depuis des points de vue légèrement différents. En mesurant la différence entre les points correspondants dans les deux images, le système peut déduire la distance des objets par rapport à la caméra.
Une autre approche repose sur les systèmes RGB-D (rouge, vert, bleu et profondeur), qui utilisent des capteurs de profondeur actifs pour mesurer directement la distance au niveau de chaque pixel. Ces systèmes peuvent fournir des informations de profondeur précises dans des environnements contrôlés, mais nécessitent du matériel supplémentaire.
De leur côté, les méthodes fondées sur le LiDAR utilisent des impulsions laser pour générer des représentations tridimensionnelles précises d’une scène. Bien que très précis, les capteurs LiDAR sont souvent coûteux et ajoutent une complexité matérielle importante.
À l’inverse, l’estimation de la profondeur monoculaire déduit la profondeur à partir d’une seule image RGB. Comme elle ne dépend ni de plusieurs caméras ni de capteurs spécialisés, elle est plus facile à déployer à grande échelle et constitue une bonne option lorsque le coût et les ressources matérielles sont limités.
Apprendre la profondeur à partir d’une seule image#
Lorsqu’ils estiment la profondeur à partir d’une seule image, les modèles monoculaires apprennent à reconnaître les indices visuels que les humains utilisent instinctivement pour évaluer la distance. Ces indices comprennent les lignes de perspective, la taille des objets, la densité des textures, le chevauchement des objets et l’ombrage, qui donnent tous des indications sur la distance des objets par rapport à la caméra.
Ces indices agissent ensemble pour créer une perception de la profondeur. Les objets qui paraissent plus petits ou qui sont partiellement occultés sont souvent plus éloignés, tandis que des détails plus nets et une apparence visuelle plus grande suggèrent généralement qu’un élément est plus proche.
Pour apprendre ces motifs, les modèles de profondeur monoculaire sont entraînés sur des jeux de données d’images à grande échelle, souvent associés à des informations de profondeur obtenues auprès d’autres sources comme le LiDAR ou les systèmes stéréo. Pendant l’entraînement, les modèles apprennent comment les indices visuels sont liés à la profondeur, ce qui leur permet de déduire la distance à partir d’une seule image lors de l’inférence.
Grâce à des données d’entraînement variées, les modèles de vision modernes peuvent généraliser cette compréhension acquise à un large éventail d’environnements, notamment des scènes intérieures et extérieures, et gérer des points de vue inconnus.
Tour d’horizon de différentes techniques d’estimation de la profondeur monoculaire#
Nous allons maintenant examiner les principales approches utilisées pour estimer la profondeur à partir d’une seule image et voir comment ces méthodes ont évolué au fil du temps.
Approches classiques et fondées sur la géométrie#
Les premières méthodes d’estimation de la profondeur reposaient sur des règles visuelles simples liées à la géométrie de la caméra. Des indices comme la perspective, la taille des objets et le fait qu’un objet en masque un autre servaient à estimer la distance.
Par exemple, lorsque deux objets similaires apparaissaient avec des tailles différentes, on supposait que le plus petit était plus éloigné. Ces approches fonctionnaient assez bien dans des environnements contrôlés où des facteurs comme l’éclairage, la position de la caméra et la disposition de la scène restaient constants.
Cependant, ces hypothèses sont souvent mises en défaut dans les scènes du monde réel. Les variations d’éclairage, les changements de point de vue et la complexité accrue des scènes peuvent entraîner des estimations de profondeur peu fiables, ce qui limite l’efficacité des méthodes classiques dans des environnements non contrôlés.
Premières approches d’apprentissage automatique#
Les premières méthodes d’apprentissage automatique ont apporté davantage de flexibilité à l’estimation de la profondeur en apprenant directement les motifs à partir des données. Plutôt que de s’appuyer uniquement sur des règles géométriques fixes, ces modèles tentaient d’apprendre la relation entre les informations visuelles et la distance, en traitant la prédiction de profondeur comme un problème de régression fondé sur des indices tels que les contours, les textures et les variations de couleur.
La sélection de ces caractéristiques constituait une étape essentielle du processus. Les ingénieurs devaient décider quels signaux visuels extraire et comment les représenter, et les performances du modèle dépendaient fortement de ces choix.
Bien que cette approche fût plus performante que les méthodes précédentes, elle présentait encore des limites. Si les caractéristiques sélectionnées ne contenaient pas suffisamment de contexte, les prédictions de profondeur étaient moins précises. À mesure que les scènes devenaient plus complexes et variées, ces modèles peinaient souvent à produire des résultats fiables.
Algorithmes d’apprentissage profond#
La plupart des systèmes modernes d’estimation de la profondeur monoculaire utilisent l’apprentissage profond, c’est-à-dire des réseaux neuronaux comportant de nombreuses couches et capables d’apprendre des motifs complexes à partir de données. Ces modèles apprennent à prédire directement la profondeur à partir d’images et produisent des cartes de profondeur.
De nombreuses approches sont construites à l’aide de réseaux neuronaux convolutifs (CNNs), un type de réseau neuronal conçu pour traiter les images en détectant des motifs comme les contours et les formes. Ces modèles utilisent souvent une architecture encodeur-décodeur : l’encodeur extrait les caractéristiques visuelles de l’image et le décodeur transforme ces caractéristiques en carte de profondeur. Le traitement de l’image à plusieurs échelles aide le modèle à capturer la disposition générale de la scène tout en préservant des contours d’objets nets.
Les modèles plus récents se concentrent sur la compréhension des relations entre les différentes parties d’une image. Les modèles fondés sur les Transformer et les Vision Transformer (ViT) utilisent des mécanismes d’attention qui permettent au modèle d’identifier les régions d’une image les plus pertinentes et de relier des zones éloignées entre elles. Cela aide le modèle à construire une compréhension plus cohérente de la profondeur dans l’ensemble de la scène.
Certains systèmes combinent ces deux idées. Les modèles hybrides CNN–Transformer utilisent les CNN pour capturer les détails locaux fins et les Transformer pour modéliser le contexte global de la scène. Bien que cela améliore souvent la précision, cette approche nécessite généralement davantage de ressources de calcul, comme de la mémoire et de la puissance de traitement supplémentaires.
Pourquoi la compréhension de la profondeur est importante pour les systèmes d’IA de vision#
En découvrant l’estimation de la profondeur monoculaire, tu te demandes peut-être pourquoi la compréhension de la profondeur constitue une partie si importante des systèmes d’IA fondés sur la vision.
Lorsqu’un système peut estimer la distance des objets et des surfaces, il comprend mieux la disposition d’une scène et les relations entre ses différents éléments. Cette conscience spatiale est essentielle pour prendre des décisions fiables, en particulier dans des applications concrètes comme la conduite autonome.
Les informations de profondeur ajoutent également un contexte précieux à d’autres tâches de vision par ordinateur. Par exemple, la détection d’objets, prise en charge par des modèles comme Ultralytics YOLO26, peut indiquer à un système ce qui est présent dans une scène, tandis que la profondeur aide à déterminer où ces objets se trouvent par rapport à la caméra et les uns par rapport aux autres.
Ensemble, ces capacités permettent un large éventail d’applications d’IA de vision, comme la création de cartes 3D, la navigation dans des environnements complexes et la compréhension globale d’une scène.
Les robots et les véhicules autonomes dépendent de ces informations pour se déplacer en toute sécurité, éviter les obstacles et réagir aux changements en temps réel. Par exemple, l’approche de conduite basée uniquement sur la vision de Tesla repose sur des images prises par des caméras combinées à l’estimation de la profondeur, plutôt que sur le LiDAR, pour comprendre à quelle distance se trouvent les objets et comment ils sont positionnés sur la route.
Fonctionnement des modèles d’estimation de la profondeur monoculaire#
Bien que les architectures des modèles varient, la plupart des modèles d’estimation de la profondeur monoculaire suivent un processus similaire pour convertir une seule image en carte de profondeur. Voici un aperçu rapide des principales étapes :
- Entrée et prétraitement : Le flux de travail commence par une image d’entrée. Avant d’être transmise au modèle, l’image originale est généralement redimensionnée, normalisée et convertie en tenseur, un format que les réseaux neuronaux utilisent pour traiter efficacement les données d’image.
- Extraction des caractéristiques : Un réseau encodeur analyse l’image afin d’en extraire des caractéristiques visuelles pertinentes. Ces caractéristiques capturent des informations comme les textures, les contours des objets et la disposition générale de la scène. La plupart des modèles opèrent à plusieurs échelles pour comprendre à la fois les détails fins et la structure globale.
- Raisonnement sur la profondeur : À partir des caractéristiques extraites, le modèle combine les détails locaux avec le contexte global pour raisonner sur les relations spatiales dans la scène. À cette étape, il apprend quelles régions de l’image sont les plus proches de la caméra et lesquelles sont les plus éloignées.
- Génération de la carte de profondeur : Un décodeur transforme ensuite ces informations en une carte de profondeur dense. Une valeur de profondeur est attribuée à chaque pixel de l’image, souvent en combinant des prédictions provenant de différentes échelles afin d’améliorer la précision et la cohérence.
Entraînement des modèles d’estimation de la profondeur monoculaire#
Le processus que nous venons de décrire suppose que nous disposons déjà d’un modèle entraîné ou préentraîné. Mais comment l’entraînement d’un modèle d’estimation de la profondeur monoculaire fonctionne-t-il concrètement ?
L’entraînement commence par la préparation des données d’image afin qu’elles puissent être traitées efficacement par le réseau. Les images d’entrée sont redimensionnées et normalisées à une échelle cohérente, puis transmises au modèle pour générer une carte de profondeur prédite qui estime la distance au niveau de chaque pixel.
La carte de profondeur prédite est ensuite comparée aux données de profondeur de référence à l’aide d’une fonction de perte, qui mesure l’écart entre la prédiction du modèle et la profondeur de référence. Cette valeur de perte représente l’erreur actuelle du modèle et fournit un signal d’amélioration.
Un optimiseur utilise ce signal pour mettre à jour le modèle en ajustant ses poids internes. Pour cela, l’optimiseur calcule le gradient, qui décrit la variation de la perte par rapport à chaque paramètre du modèle, puis applique ces mises à jour de manière répétée au cours de plusieurs époques, c’est-à-dire des passages complets sur le jeu de données d’entraînement.
Ce processus itératif d’entraînement supervisé est guidé par des hyperparamètres comme le taux d’apprentissage, qui contrôle l’importance de chaque étape de mise à jour, et la taille du lot, qui détermine le nombre d’images traitées simultanément. Comme l’entraînement implique un grand nombre d’opérations mathématiques, il est généralement accéléré à l’aide d’une unité de traitement graphique (GPU), particulièrement adaptée aux calculs parallèles.
Une fois l’entraînement terminé, le modèle est évalué à l’aide de métriques d’évaluation standard sur un jeu de validation composé d’images qui n’ont pas été utilisées pendant l’entraînement. Cette évaluation aide à mesurer la capacité du modèle à généraliser à de nouvelles données.
Le modèle entraîné peut ensuite être réutilisé ou ajusté pour de nouveaux scénarios. Globalement, ce processus d’entraînement permet aux modèles d’estimation de la profondeur monoculaire de produire des estimations cohérentes de la profondeur, essentielles à des tâches en aval comme la reconstruction 3D et le déploiement dans le monde réel.
Exploration des modèles de pointe et des tendances de la recherche#
L’estimation de la profondeur monoculaire a rapidement progressé à mesure que les modèles sont devenus meilleurs pour comprendre des scènes entières plutôt que de simples détails visuels. Les premières approches produisaient souvent des cartes de profondeur irrégulières, notamment dans les environnements complexes.
Les modèles plus récents, comme le montrent les travaux de recherche récemment publiés sur arXiv, se concentrent davantage sur le contexte global, ce qui conduit à des prédictions de profondeur plus stables et réalistes. Des modèles reconnus comme MiDaS et DPT ont contribué à cette évolution en apprenant la profondeur à partir de jeux de données diversifiés et haute résolution, tout en généralisant efficacement à de nombreuses scènes.
Les modèles plus récents, notamment ZoeDepth et Depth Anything V2, s’appuient sur ces travaux en améliorant la cohérence d’échelle tout en conservant de bonnes performances dans un large éventail de configurations. Ces progrès sont souvent mesurés à l’aide de jeux de données de référence courants comme KITTI et NYU, qui couvrent des scènes extérieures et intérieures.
Une autre tendance claire consiste à trouver un équilibre entre précision et aspects pratiques. Les modèles plus compacts sont optimisés pour la vitesse et peuvent fonctionner en temps réel sur des appareils edge ou mobiles, tandis que les modèles plus volumineux privilégient une résolution supérieure et une précision accrue de la profondeur à longue distance.
Applications de l’estimation de la profondeur monoculaire#
Examinons maintenant quelques exemples concrets montrant comment l’estimation de la profondeur monoculaire permet d’interpréter la structure 3D d’une scène à partir d’une seule image.
Dans tous ces cas, il est important de garder à l’esprit que les informations de profondeur sont une estimation déduite d’indices visuels, et non une mesure précise. L’estimation de la profondeur monoculaire est donc utile pour comprendre la disposition relative et les relations spatiales, mais elle ne remplace pas les capteurs conçus pour mesurer précisément la distance, comme le LiDAR ou les systèmes stéréo.
Cartographie et navigation de terrain par drone#
Les drones opèrent souvent dans des environnements où les signaux GPS sont peu fiables, comme les forêts, les chantiers, les zones sinistrées ou les zones urbaines denses. Pour voler en toute sécurité dans ces conditions, ils doivent comprendre le terrain environnant et savoir à quelle distance se trouvent les obstacles. Auparavant, cela nécessitait généralement d’ajouter des capteurs comme le LiDAR ou des caméras stéréo, ce qui augmentait le poids, la consommation d’énergie et le coût global.
L’estimation de la profondeur monoculaire constitue une alternative plus simple. À l’aide d’une seule caméra RGB, les drones peuvent estimer la profondeur à partir d’images et construire une compréhension 3D élémentaire de leur environnement. Ils peuvent ainsi détecter des obstacles comme des bâtiments, des arbres ou des changements brusques de terrain, puis ajuster leur trajectoire en temps réel.
Ces estimations de profondeur facilitent des tâches essentielles de navigation, notamment l’évitement d’obstacles, le contrôle de l’altitude et l’atterrissage sécurisé. Ainsi, des drones légers peuvent effectuer des tâches de cartographie, d’inspection et de navigation sans dépendre de capteurs de profondeur spécialisés.

Fig. 2. L’estimation de la profondeur monoculaire peut être utilisée pour analyser des images prises par drone (Source)
Combler les angles morts des véhicules de course autonomes#
Les véhicules autonomes dépendent généralement fortement des capteurs LiDAR, qui utilisent des impulsions laser pour mesurer la distance et construire une vue 3D de la route. Bien que très précis, le LiDAR peut rencontrer des difficultés au niveau des sommets de route prononcés, des pentes raides, des occultations ou des changements brusques d’assiette du véhicule, et produire parfois des données de profondeur éparses ou manquantes.
L’estimation de la profondeur monoculaire peut contribuer à combler ces lacunes en fournissant des informations de profondeur denses à partir d’une seule image RGB, même lorsque les données LiDAR sont incomplètes. Imagine une voiture autonome qui approche rapidement du sommet d’une colline. Les faisceaux LiDAR peuvent dépasser la route au-delà du sommet, laissant planer une incertitude sur ce qui se trouve devant le véhicule.
L’estimation de la profondeur fondée sur une caméra peut toutefois encore déduire la forme de la route à partir d’indices visuels comme la perspective et la texture, aidant le véhicule à maintenir une perception fiable jusqu’à la stabilisation des données LiDAR. Ensemble, le LiDAR et l’estimation de la profondeur monoculaire permettent une perception plus stable et un contrôle plus sûr dans des conditions de conduite difficiles.

Fig. 3. Visualisation de l’utilisation de l’estimation de la profondeur monoculaire pour la course autonome (Source)
Navigation robotique et évitement d’obstacles#
Les robots sont souvent utilisés dans des lieux où des cartes détaillées ne sont pas disponibles et où les conditions changent constamment. Pour se déplacer en toute sécurité, ils doivent disposer d’une perception fiable de l’espace qui les entoure et de l’emplacement des obstacles.
L’estimation de la profondeur monoculaire peut fournir cette conscience spatiale à l’aide d’une seule caméra RGB, sans dépendre d’un matériel lourd ou coûteux. En apprenant des indices visuels comme l’échelle et la perspective, les modèles d’estimation de la profondeur peuvent générer des cartes de profondeur denses de l’environnement. Les robots disposent ainsi d’une vision claire de la distance qui les sépare des surfaces et des objets.
En particulier, lorsque les informations de profondeur sont combinées à des tâches de vision par ordinateur comme la détection d’objets et la segmentation sémantique, les robots peuvent obtenir une vision plus complète de leur environnement. Ils peuvent identifier les objets, comprendre leur distance et décider où il est possible de se déplacer en toute sécurité. Cela facilite l’évitement d’obstacles, la détection des espaces libres et la planification de trajectoires en temps réel.

Fig. 4. Détection d’objets à l’aide de l’estimation de la profondeur monoculaire et de la détection d’objets (Source)
Avantages et inconvénients de l’estimation de la profondeur monoculaire#
Voici quelques-uns des principaux avantages de l’utilisation de l’estimation de la profondeur monoculaire :
- Légère et économe en énergie : L’utilisation d’une seule caméra réduit le poids du système et la consommation d’énergie, ce qui est particulièrement important pour les robots mobiles, les drones et les systèmes embarqués.
- Compatible avec la fusion de capteurs : La profondeur monoculaire peut compléter d’autres capteurs, comme le LiDAR ou le radar, en comblant les lacunes ou en fournissant une redondance.
- Fonctionne dans de nombreux environnements : La même approche fondée sur une caméra peut être utilisée en intérieur, en extérieur et sur différentes plateformes sans nécessiter de modifications matérielles.
Bien que l’estimation de la profondeur monoculaire offre des avantages évidents, voici certaines limites à prendre en compte :
- Précision inférieure à celle des capteurs actifs : Bien qu’elle progresse rapidement, l’estimation de la profondeur monoculaire ne peut généralement pas égaler la précision absolue du LiDAR ou des capteurs à lumière structurée dans des conditions contrôlées.
- Sensibilité aux conditions d’éclairage : Les performances peuvent se dégrader dans les environnements peu éclairés, en présence d’ombres fortes, d’éblouissements ou de scènes présentant peu de textures.
- Difficultés de généralisation : Un modèle entraîné dans un environnement donné ne se transpose pas toujours de manière fiable à des domaines inconnus sans adaptation ou ajustement fin.
Quand ne pas se fier à l’estimation de la profondeur monoculaire#
Bien que l’estimation de la profondeur monoculaire soit un domaine de recherche intéressant, il est important de comprendre dans quelles situations elle peut être utilisée concrètement et dans lesquelles elle ne le peut pas. Les distances qu’elle produit sont des estimations fondées sur ce que le modèle voit dans une image, et non des mesures exactes prises dans le monde réel.
Par conséquent, la qualité des résultats peut varier selon des facteurs comme l’éclairage, la complexité de la scène et la similarité entre la scène et les données sur lesquelles le modèle a été entraîné. L’estimation de la profondeur monoculaire permet généralement de déterminer ce qui est le plus proche et ce qui est le plus éloigné, mais elle n’est pas fiable lorsque des distances exactes sont nécessaires.
Dans les situations où la précision est essentielle, comme les systèmes critiques pour la sécurité, l’inspection industrielle ou les robots qui doivent interagir avec des objets avec une grande précision, la profondeur doit être mesurée directement. Des capteurs comme le LiDAR, le radar, les caméras stéréo ou les systèmes à lumière structurée sont conçus pour cela et fournissent des informations de distance bien plus fiables.
L’estimation de la profondeur monoculaire peut également rencontrer des difficultés dans des conditions visuellement complexes. Un mauvais éclairage, des ombres fortes, des surfaces réfléchissantes ou transparentes, le brouillard, la fumée ou des scènes présentant très peu de texture visuelle peuvent rendre les estimations de profondeur moins fiables. L’estimation de la profondeur à longue distance est un autre cas où les capteurs dédiés donnent généralement de meilleurs résultats.
Pour les solutions concrètes, l’estimation de la profondeur monoculaire fonctionne mieux comme outil complémentaire que comme solution autonome. Elle peut ajouter un contexte spatial utile, contribuer à combler les lacunes lorsque les autres capteurs sont limités et améliorer la compréhension globale de la scène. Toutefois, elle ne devrait pas être l’unique source d’informations de profondeur lorsque la précision, la sécurité ou des exigences strictes de fiabilité sont importantes.
Points clés à retenir#
L’estimation de la profondeur monoculaire est une technique de vision par ordinateur qui permet aux machines d’estimer la distance à laquelle se trouvent les objets à partir d’une seule image prise par une caméra. En apprenant des indices visuels tels que la perspective, la taille des objets, la texture et l’ombrage, ces modèles d’IA peuvent déduire la structure 3D d’une scène sans dépendre de capteurs comme le LiDAR ou de caméras stéréo. L’estimation de la profondeur monoculaire constitue ainsi une approche économique et évolutive pour des applications telles que la conduite autonome, la robotique et la compréhension de scènes 3D.
Pour en savoir plus sur l’IA pour la vision, consulte notre dépôt GitHub et rejoins notre communauté. Consulte nos pages de solutions pour en savoir plus sur l’IA dans la robotique et la vision par ordinateur dans l’industrie manufacturière. Découvre nos options de licence pour commencer dès aujourd’hui avec la vision par ordinateur !









