В Ultralytics YOLO26 теперь поддерживается оценка монокулярной глубины
Узнай, как новая задача оценки глубины в Ultralytics YOLO26 предсказывает метрическую глубину для каждого пикселя по одному RGB-изображению без использования стереосистемы или LiDAR.

До сих пор добавление оценки глубины в конвейер YOLO означало ее самостоятельную сборку. Установившийся подход заключался в запуске YOLO для детектирования с последующим сопряжением с отдельной моделью глубины из другого проекта, такой как MiDaS или Depth Anything. Это влекло за собой вторую зависимость, второй фреймворк и два набора форматов ввода и вывода, которые приходилось согласовывать.
Оценка монокулярной глубины теперь является встроенной задачей в Ultralytics YOLO26. Одно RGB-изображение выдает значение расстояния для каждого пикселя, используя тот же пакет, рабочий процесс и путь экспорта, что и для детектирования, сегментации и позы.
Link to this sectionЧто такое оценка глубины?#
Оценка глубины прогнозирует карту глубин для каждого пикселя по одному RGB-изображению без использования второй камеры или дополнительного датчика. Каждый выходной пиксель содержит значение глубины в метрах, представляющее предполагаемое расстояние от камеры до данной точки поверхности.
На выходе получается плотная карта с плавающей запятой размерности (H, W), выровненная по входу, где каждый пиксель несет абсолютное расстояние в метрах — расстояние от камеры, а не относительный порядок того, что находится ближе, а что дальше.
Глубина — это автономная задача с собственным чекпоинтом, и ее выходом является исключительно карта глубин; она не возвращает ограничивающие рамки ( bounding boxes ) или маски сегментации. Поэтому объединение детектирования с глубиной требует запуска двух моделей и двух проходов прямых вычислений (forward passes). Отличие от прошлой практики заключается в том, что теперь обе задачи находятся в рамках одного пакета, разделяя единую установку, один интерфейс обучения и прогнозирования, один путь экспорта и единственную версию для отслеживания, избавляя от необходимости поддерживать второй фреймворк параллельно с первым.
Этот попиксельный вывод и делает глубину полезной для обнаружения препятствий и свободного пространства, проверки зазоров, анализа компоновки сцены и понимания того, что находится перед чем.
Рис. 1. Оценка глубины с помощью Ultralytics YOLO26 для контроля безопасности и соблюдения норм.
Ultralytics YOLO26 поставляется с пятью предобученными моделями глубины: от yolo26n-depth до yolo26x-depth, обученными на обширном наборе данных, состоящем примерно из 2,19 млн изображений интерьеров и уличных сцен. На наборе NYU Depth V2 их точность δ1 варьируется от 0,882 для нано-модели до 0,933 для сверхкрупной модели, поэтому ты можешь выбрать компромисс между скоростью и точностью, подходящий под твою целевую среду развертывания.
Link to this sectionНеограниченная глубина по задумке#
Большинство моделей глубины ограничивают свои предсказания фиксированным диапазоном, например 0–10 метров, что отлично работает для интерьеров, но перестает работать на открытом воздухе. Вместо этого Ultralytics прогнозирует глубину по открытой логарифмической шкале без жесткого ограничения.
Разница видна при тестировании. Модель с ограничением выходит на плато почти сразу при обучении на смешанных данных помещений и улицы и ломается на датасетах с большим диапазоном расстояний, таких как KITTI, где объекты могут находиться на расстоянии 80 метров. Подход YOLO26 не имеет такого ограничения, поэтому он продолжает улучшаться с ростом объема данных и отлично работает как на расстоянии нескольких сантиметров, так и сотен метров. На KITTI показатель δ1 достигает 0,942 на расстоянии 80 м. Это означает, что одно семейство моделей одинаково хорошо справляется как со сценой на столе, так и с дорожной ситуацией на шоссе.
Link to this sectionСравнение глубины Ultralytics YOLO26 и Depth Anything V2#
Если ты используешь Depth Anything вместе с YOLO сегодня, разница заключается в скорости и сопутствующих затратах на вычисления. Глубина YOLO26 работает до 20,3 раза быстрее, чем Depth Anything V2 Base, и в 7,7 раза быстрее, чем Depth Anything V2 Small, при значительно меньшем размере модели (менее 10 млн параметров у nano-версии против примерно 24 млн у меньшего чекпоинта DA V2).
Рис. 2. Бенчмарки скорости оценки глубины Ultralytics YOLO26 по сравнению с Depth Anything V2.
Этот разрыв и заложен в основу архитектуры. Модели Depth Anything V2 значительно крупнее; YOLO26-Depth создана для обеспечения высокой производительности глубины при таких размерах и скорости, которые требуют меньше вычислительных ресурсов на кадр и позволяют развертывать ее на аппаратном обеспечении, недоступном для тех моделей. Показатели точности для отдельных моделей на NYU Depth V2 и KITTI опубликованы в документации, поэтому ты можешь сопоставить их со своими требованиями.
Link to this sectionГде это работает#
Именно разница в размере определяет, куда именно можно внедрить оценку глубины. У большинства команд, оценивающих глубину, нет недостатка в идеях — им не хватает вычислительной мощности. Маломощные дроны, роботы-четвероногие, носимые устройства, видеорегистраторы, конференц-оборудование и промышленные ПК упираются в ограничения по питанию и стоимости задолго до того, как упираются в ограничения по точности.
Модуль глубины поставляется в виде пяти предобученных моделей, что позволяет выбрать размер под конкретную задачу, а не тот, который выигрывает в бенчмарках. Поскольку глубина является встроенной задачей YOLO26, она использует те же пути экспорта, что и детектирование, сегментация и поза, со следующими форматами: ONNX, TensorRT, CoreML, NCNN, LiteRT.
Link to this sectionНачало работы с оценкой глубины Ultralytics YOLO26#
Пакет Ultralytics Python предоставляет единый унифицированный интерфейс для обучения, валидации и запуска инференса для всех задач YOLO26, включая глубину. Запуск предобученной модели глубины требует всего одной команды:
from ultralytics import YOLO
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-depth.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg") # predict on an image
# Access the results
for result in results:
depth_map = result.depth.data.cpu().numpy() # torch.Tensor → NumPy float32, shape (H, W), metersИли из CLI:
yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg' # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg' # predict with custom modelAbsolute distance depends on your camera and your scene. If the shape of the depth map is right but the scale is off, model.calibrate() fits just two variables in the model's depth head, a scale and an offset, on around 100 labeled frames, in seconds, with no training and no change to the rest of the network.
Link to this sectionДообучение (fine-tuning) на собственных данных#
Чтобы адаптировать предобученную модель глубины под свою камеру или домен, начни с предобученных весов, используй AdamW и снизь скорость обучения (learning rate) значительно ниже значения по умолчанию для обучения с нуля, чтобы дообучение уточняло модель, а не перезаписывало ее:
from ultralytics import YOLO
from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt") # start from pretrained weights
model.train(
data="path/to/your_dataset.yaml",
epochs=20,
imgsz=640,
optimizer="AdamW",
lr0=1e-4, # ~100x below the from-scratch default
warmup_bias_lr=1e-4, # keep warmup gentle too
)Поскольку логарифмическая голова по умолчанию не имеет ограничений, это работает «из коробки» независимо от того, ближний или дальний диапазон у твоего датасета, без необходимости настраивать max_depth. Если для твоей конкретной камеры неверно только абсолютное значение масштаба, model.calibrate() за считанные секунды выполняет легкую коррекцию в замкнутой форме на небольшом размеченном срезе, не затрагивая веса сети.
Датасеты связывают каждое RGB-изображение с файлом глубины .npy в соответствующей структуре папок, и Ultralytics поставляется со встроенными конфигурациями для NYU Depth V2, KITTI, Hypersim, SUN RGB-D и ARKitScenes, поэтому большинство команд могут сразу начать валидацию по стандартному бенчмарку.
Для получения дополнительной информации посмотри наше руководство по быстрому старту.
Link to this sectionКлючевые варианты использования оценки глубины#
Поскольку эта новая функция может работать с одной обычной камеры, оценка монокулярной глубины открывает бесчисленные возможности для продуктов и отраслей, которые иначе не смогли бы оправдать стоимость, энергопотребление или накладные расходы на калибровку стереосистемы или LiDAR. Давай рассмотрим ключевые отрасли и сценарии использования, которые могут извлечь выгоду из этой функции:
- Робототехника и автономная навигация. Мобильные роботы и дроны могут оценивать расстояние до препятствий и свободное пространство с одной бортовой камеры, поддерживая планирование пути в реальном времени без специализированного оборудования глубины.
- Промышленность и логистический мониторинг. Проверка зазоров, обнаружение свободного пространства, контекст стеллажей или проходов с одной фиксированной камеры везде, где установка второго датчика нецелесообразна.
- Контроль безопасности и соответствия требованиям. Зоны безопасности вилочных погрузчиков и складов, обнаружение инцидентов на железнодорожном транспорте, обнаружение упавших людей и оставленных предметов на существующих камерах видеонаблюдения: добавление контекста расстояния к уже установленным камерам в дополнение к существующим сертифицированным датчикам безопасности, а не вместо них.
- Инфраструктура и инспекция активов. Анализ зазоров воздушных линий электропередач, инспекция активов и коррозии с помощью дронов, а также аэрофотосъемка, где одно и то же семейство моделей должно справляться как с деталями крупным планом, так и с дальнобойными сценами.
- Помощь водителю и автомобильное восприятие. Дальнобойный неограниченный вывод глубины означает, что то же семейство моделей, которое справляется со сценой в помещении крупным планом, также обобщается на дорожные сцены на расстоянии 80 м+.
- AR и пространственный контент. Убедительное размещение виртуальных объектов в реальной сцене или применение эффектов с учетом глубины начинается с понимания того, на каком расстоянии от камеры находится каждый пиксель.
Link to this sectionВнедрение оценки глубины в любое развертывание YOLO26#
Теперь, когда оценка глубины стала встроенной задачей YOLO26, команды могут использовать попиксельное расстояние с любой RGB-камеры в самых разных отраслях, применяя те же рабочие процессы обучения, валидации, прогнозирования и экспорта, которые они уже знают по задачам детектирования, сегментации и позы, и на одну стороннюю зависимость меньше для поддержки.
Поэтому, оценивая масштабы своего развертывания с помощью глубины Ultralytics YOLO26, давай рассмотрим несколько ключевых моментов, о которых следует помнить:
- Ultralytics YOLO Depth создана для RGB-камер. Подойдет любая стандартная камера, включая веб-камеры, телефоны, промышленные камеры или дроны. Тем не менее, другие модальности, такие как облака точек LiDAR, радар, гидролокатор, тепловизионные и мультиспектральные диапазоны, а также данные мешей и IFC, находятся вне формата ввода модели.
- Метрическое расстояние для задач восприятия. Выходные данные представляют собой реальное расстояние в метрах, что делает модель отлично подходящей для навигации, контроля зазоров и мониторинга. Однако для любого применения, где требуется сертифицированный допуск, правильным инструментом остается специализированное метрологическое оборудование.
- Покадровая инференция. Глубина работает с каждым кадром независимо, что согласуется со всеми остальными задачами YOLO26, поэтому она легко встраивается в существующий покадровый конвейер без изменений. Анализ последовательности остается на уровне твоего приложения.
- Ultralytics YOLO26-Depth наиболее эффективна на текстурированных непрозрачных поверхностях. Стекло, зеркала, стоячая вода, полированный металл и открытое небо по своей сути неоднозначны для любого метода с одной камерой, поэтому стоит протестировать модель на сценах, характерных для твоей среды.
Интересуешься компьютерным зрением ИИ? Ознакомься с нашими вариантами лицензирования, чтобы внедрить компьютерное зрение в свои проекты. Посети наш репозиторий на GitHub, чтобы открыть для себя весь спектр задач и интеграций Ultralytics, и загляни на Ultralytics Platform, чтобы начать создание собственных сквозных рабочих процессов компьютерного зрения.






