Sécurité prête pour l'entreprise : Conforme ISO 27001 + SOC 2 Type I.
Blog

Ultralytics YOLO26 prend désormais en charge l'estimation de profondeur monoculaire

Apprends comment la nouvelle tâche d'estimation de profondeur dans Ultralytics YOLO26 prédit la profondeur à l'échelle métrique par pixel à partir d'une seule image RVB, sans nécessiter de capteur stéréo ni de LiDAR.

NUNuvola Ladi
Ultralytics YOLO26 prend désormais en charge l'estimation de profondeur monoculaire

Jusqu'à présent, ajouter de la profondeur à un pipeline YOLO signifiait l'assembler toi-même. Le schéma établi consistait à exécuter YOLO pour la détection et à l'associer à un modèle de profondeur distinct provenant d'un autre projet, tel que MiDaS ou Depth Anything. Cela impliquait une deuxième dépendance, un second framework et deux jeux de formats d'entrée et de sortie à concilier.

L'estimation de la profondeur monoculaire est désormais une tâche native dans Ultralytics YOLO26. Une seule image RGB produit une valeur de distance pour chaque pixel, en utilisant le même package, le même flux de travail et le même chemin d'exportation que la détection, la segmentation et la pose.

Link to this sectionQu'est-ce que l'estimation de la profondeur ?#

L'estimation de la profondeur prédit une carte de profondeur par pixel à partir d'une seule image RGB, sans qu'une deuxième caméra ou un capteur supplémentaire ne soit impliqué. Chaque pixel de sortie contient une valeur de profondeur en mètres, représentant la distance estimée de la caméra à ce point de surface.

La sortie est une carte de nombres à virgule flottante dense de forme (H, W), alignée sur l'entrée, où chaque pixel porte une distance absolue en mètres ; une distance par rapport à la caméra, et non un ordre relatif de ce qui est plus proche ou plus éloigné.

La profondeur est une tâche autonome dotée de son propre point de contrôle, et sa sortie est la seule carte de profondeur ; elle ne renvoie pas de boîtes englobantes ou de masques de segmentation. Combiner la détection avec la profondeur nécessite donc d'exécuter deux modèles et deux passes directes. Ce qui diffère de la pratique précédente, c'est que les deux se trouvent désormais dans un seul package, partageant une seule installation, une seule interface d'entraînement et de prédiction, un seul chemin d'exportation et une seule version à suivre, plutôt de nécessiter qu'un second framework soit entretenu aux côtés du premier.

Cette sortie par pixel est ce qui rend la profondeur utile pour la détection d'obstacles et d'espaces libres, la vérification du dégagement, la disposition des scènes et la compréhension de ce qui se trouve devant quoi.

Frame 1077243491 Fig 1. Estimation de la profondeur par Ultralytics YOLO26 pour la surveillance de la sécurité et de la conformité.

Ultralytics YOLO26 propose cinq modèles de profondeur pré-entraînés, de yolo26n-depth jusqu'à yolo26x-depth, entraînés sur un vaste mélange multi-ensembles de données couvrant environ 2,19 millions d'images intérieures et extérieures. Sur l'ensemble NYU Depth V2, ils vont d'une précision δ1 de 0,882 sur le modèle nano à 0,933 sur le modèle extra-large, afin que tu puisses choisir le compromis entre vitesse et précision qui correspond à ta cible de déploiement.

Link to this sectionProfondeur illimitée par conception#

La plupart des modèles de profondeur limitent leurs prédictions à une plage fixe, comme 0 à 10 mètres, ce qui fonctionne bien pour les scènes d'intérieur mais échoue à l'extérieur. Ultralytics prédit plutôt la profondeur sur une échelle logarithmique ouverte, sans coupure stricte.

La différence se voit lors des tests. Un modèle plafonné atteint un plateau presque immédiatement lorsqu'il est entraîné sur des données mixtes intérieures et extérieures, et s'effondre sur des ensembles de données à plus longue portée comme KITTI, où les objets peuvent se trouver à 80 mètres. L'approche de YOLO26 n'a pas un tel plafond, elle continue donc de s'améliorer avec plus de données et tient le coup de quelques centimètres à quelques centaines de mètres. Sur KITTI, δ1 atteint 0,942 à une portée de 80 m. Cela signifie qu'une seule famille de modèles gère aussi bien une scène de table qu'une scène d'autoroute.

Link to this sectionComparaison entre la profondeur d'Ultralytics YOLO26 et Depth Anything V2#

Si tu exécutes actuellement Depth Anything aux côtés de YOLO, la différence réside dans la vitesse et la facture de calcul qui l'accompagne. La profondeur de YOLO26 s'exécute jusqu'à 20,3× plus rapidement que Depth Anything V2 Base et 7,7× plus rapidement que Depth Anything V2 Small, à partir d'un modèle beaucoup plus petit, inférieur à 10M de paramètres en version nano, contre environ 24M pour le point de contrôle plus petit de DA V2.

Screenshot 2026-07-29 at 15.02.18 Fig 2. Repères de vitesse pour la profondeur d'Ultralytics YOLO26 par rapport à Depth Anything V2.

Cet écart est la raison d'être de la conception. Les modèles de Depth Anything V2 sont nettement plus grands ; YOLO26-Depth est conçu pour des performances de profondeur élevées à une taille et une vitesse qui coûtent moins de calcul par image et se déplient sur du matériel que ces modèles ne peuvent pas atteindre. Les chiffres de précision par modèle sur NYU Depth V2 et KITTI sont publiés dans la documentation, tu peux donc les vérifier par rapport à ton besoin réel.

Link to this sectionOù cela s'exécute-t-il#

Cette différence de taille est ce qui détermine où la profondeur peut réellement aller. La plupart des équipes évaluant la profondeur ne manquent pas d'idées ; elles manquent de puissance de calcul. Les drones à faible consommation, les robots quadrupèdes, les objets connectés portables, les caméras de tableau de bord, le matériel de visioconférence et les PC industriels atteignent tous un plafond de puissance et de coût avant d'atteindre un plafond de précision.

La profondeur est livrée sous forme de cinq modèles pré-entraînés, tu peux donc choisir la taille qui correspond à la cible plutôt que la taille qui gagne un benchmark. Étant donné que la profondeur est une tâche native de YOLO26, elle utilise le même chemin d'exportation que la détection, la segmentation et la pose avec les formats suivants : ONNX, TensorRT, CoreML, NCNN, LiteRT.

Link to this sectionPour commencer avec la profondeur d'Ultralytics YOLO26#

Le package Python d'Ultralytics fournit une interface unique et unifiée pour l'entraînement, la validation et l'exécution de l'inférence sur toutes les tâches de YOLO26, y compris la profondeur. L'exécution d'un modèle de profondeur pré-entraîné ne prend qu'une seule commande :

from ultralytics import YOLO

from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load an official model
model = YOLO("path/to/best.pt")  # load a custom model

# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg")  # predict on an image

# Access the results
for result in results:
    depth_map = result.depth.data.cpu().numpy()  # torch.Tensor → NumPy float32, shape (H, W), meters

Ou depuis la CLI :

yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg'  # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg'   # predict with custom model

La distance absolue dépend de ta caméra et de ta scène. Si la forme de la carte de profondeur est correcte mais que l'échelle est fausse, model.calibrate() ajuste seulement deux variables dans la tête de profondeur du modèle, une échelle et un décalage, sur environ 100 images étiquetées, en quelques secondes, sans entraînement et sans modification du reste du réseau.

Link to this sectionRéglage fin sur tes propres données#

Pour adapter un modèle de profondeur pré-entraîné à ta propre caméra ou à ton domaine, pars des poids pré-entraînés, utilise AdamW, et baisse le taux d'apprentissage bien en dessous de la valeur par défaut pour un entraînement à partir de zéro afin que le réglage fin affine le modèle au lieu de l'écraser :

from ultralytics import YOLO

from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt")  # start from pretrained weights
model.train(
    data="path/to/your_dataset.yaml",
    epochs=20,
    imgsz=640,
    optimizer="AdamW",
    lr0=1e-4,  # ~100x below the from-scratch default
    warmup_bias_lr=1e-4,  # keep warmup gentle too
)

Puisque la tête logarithmique par défaut est non bornée, cela fonctionne immédiatement, que ton ensemble de données soit à courte portée ou à longue portée, sans avoir besoin de régler max_depth. Si seule l'échelle absolue est erronée pour ta caméra spécifique, model.calibrate() ajuste une correction légère et sous forme fermée sur un petit sous-ensemble étiqueté, en quelques secondes, sans toucher aux poids du réseau.

Les ensembles de données associent chaque image RGB à un fichier de profondeur .npy dans une structure de dossiers correspondante, et Ultralytics propose des configurations intégrées pour NYU Depth V2, KITTI, Hypersim, SUN RGB-D et ARKitScenes, afin que la plupart des équipes puissent commencer à valider immédiatement par rapport à un benchmark standard.

Pour plus d'informations, consulte notre guide de démarrage rapide.

Link to this sectionCas d'utilisation clés pour l'estimation de la profondeur#

Étant donné que cette nouvelle fonctionnalité peut fonctionner à partir d'une seule caméra ordinaire, l'estimation de la profondeur monoculaire ouvre d'innombrables opportunités pour les produits et les industries qui ne peuvent pas autrement justifier le coût, la consommation électrique ou la charge de calibration d'une configuration stéréo ou LiDAR. Jetons donc un coup d'œil à quelques industries et cas d'utilisation clés qui peuvent bénéficier de cette fonctionnalité :

  • Robotique et navigation autonome. Les robots mobiles et les drones peuvent estimer la distance des obstacles et l'espace libre à partir d'une seule caméra embarquée, prenant en charge la planification de trajectoire en temps réel sans matériel de profondeur dédié.
  • Sensibilisation industrielle et logistique. Vérification du dégagement, détection de l'espace libre et contexte d'étagère ou d'allée à partir d'une seule caméra fixe, partout où l'ajout d'un second capteur n'est pas pratique.
  • Surveillance de la sécurité et de la conformité. Zones de sécurité pour chariots élévateurs et entrepôts, détection d'incidents ferroviaires, détection de personnes tombées et d'objets abandonnés sur des caméras de vidéosurveillance existantes : un contexte de distance ajouté aux flux de caméras déjà installés, aux côtés des capteurs certifiés de sécurité existants plutôt qu'à leur place.
  • Inspection des infrastructures et des actifs. Analyse du dégagement des lignes aériennes, inspection d'actifs et de corrosion par drone, et travaux de levés aériens, où la même famille de modèles doit gérer à la fois les détails rapprochés et les scènes à longue portée.
  • Aide à la conduite et perception automobile. Une sortie de profondeur à longue portée et non bornée signifie que la même famille de modèles qui gère une scène d'intérieur rapprochée se généralise également à des scènes de conduite de 80 m et plus.
  • Réalité augmentée et contenu spatial. Placer de manière crédible des objets virtuels dans une scène réelle, ou appliquer des effets sensibles à la profondeur, commence par savoir à quelle distance se trouve réellement chaque pixel par rapport à la caméra.

Link to this sectionApporter l'estimation de la profondeur à chaque déploiement de YOLO26#

L'estimation de la profondeur étant désormais une tâche native de YOLO26, les équipes peuvent exploiter la distance par pixel à partir de n'importe quelle caméra RGB dans tous les secteurs, en utilisant le même flux de travail d'entraînement, de validation, de prédiction et d'exportation qu'elles connaissent déjà pour la détection, la segmentation et la pose, avec une dépendance tierce de moins à maintenir.

Alors que tu planifies ton déploiement avec la profondeur d'Ultralytics YOLO26, jetons un coup d'œil à quelques points clés à garder à l'esprit :

  • Ultralytics YOLO Depth est conçu pour les caméras RGB. N'importe quelle caméra standard fonctionne, y compris les webcams, les téléphones, les caméras industrielles ou les drones. Cependant, d'autres modalités telles que les nuages de points LiDAR, le radar, le sonar, les bandes thermiques et multispectrales, ou les données de maillage et IFC se trouvent en dehors du format d'entrée du modèle.
  • Distance métrique pour les décisions de perception. La sortie est une distance réelle en mètres, ce qui la rend bien adaptée à la navigation, au dégagement et à la surveillance. Cependant, pour toute application où une tolérance certifiée est requise, l'équipement de métrologie dédié reste l'instrument approprié.
  • Inférence par image. La profondeur s'exécute sur chaque image indépendamment, de manière cohérente avec toutes les autres tâches de YOLO26, s'intégrant ainsi dans un pipeline existant par image sans modification. Le raisonnement sur une séquence reste dans ta couche d'application.
  • Ultralytics YOLO26-Depth est plus performant sur les surfaces texturées et opaques. Le verre, les miroirs, l'eau stagnante, le métal poli et le ciel ouvert sont intrinsèquement ambigus pour toute méthode à une seule caméra, il est donc utile de valider sur des scènes représentatives de ton environnement.

Curieux de l'IA en vision ? Explore nos options de licence pour intégrer la vision par ordinateur à tes projets. Visite notre dépôt GitHub pour découvrir toute la gamme de tâches et d'intégrations d'Ultralytics, et consulte Ultralytics Platform pour commencer à créer tes propres flux de travail d'IA de vision de bout en bout.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique