Что такое оценка глубины по одному изображению? Обзор
Узнай, как работает оценка глубины по одному изображению, чем она отличается от методов определения глубины на основе датчиков и как обеспечивает масштабируемое 3D-восприятие в системах компьютерного зрения.

Беспилотные автомобили созданы для понимания происходящего вокруг, чтобы безопасно двигаться. Это означает, что им недостаточно просто распознавать такие объекты, как пешеходы или другие автомобили.
Им также нужно знать, насколько далеко находятся эти объекты, чтобы правильно реагировать. Однако наделить машины таким чувством расстояния непросто. В отличие от людей, они не воспринимают глубину по изображениям естественным образом, поэтому этому навыку их нужно обучать.
Одна из причин заключается в том, что большинство камер фиксируют мир в виде плоских двумерных изображений. Преобразовать эти изображения в представление, отражающее реальную глубину и трехмерную структуру, непросто, особенно когда системы должны надежно работать в повседневных условиях.
Интересно, что компьютерное зрение, являющееся направлением ИИ, сосредоточенным на интерпретации и понимании визуальных данных, позволяет машинам лучше понимать мир по изображениям. Например, монокулярная оценка глубины — это метод компьютерного зрения, который оценивает расстояние до объектов, используя изображение только с одной камеры.
Изучая такие визуальные признаки, как размер объекта, перспектива, текстура и затенение, эти модели могут предсказывать глубину без дополнительных датчиков, например LiDAR (обнаружение и определение дальности с помощью света), или стереокамер. В этой статье мы рассмотрим, что такое монокулярная оценка глубины, как она работает и где применяется в реальном мире. Давай начнем!
Краткое введение в монокулярную оценку глубины#
Монокулярная оценка глубины позволяет машине понимать, насколько далеко от нее находятся объекты, используя всего одно изображение. Поскольку этот подход работает только с одной камерой, он дает несколько преимуществ, включая более низкую стоимость и более простые требования к аппаратному обеспечению.
Например, ее можно использовать в доступных домашних роботах, работающих с одной камерой. Даже по одному изображению роботизированная система может определить, какие стены расположены ближе, а какие двери — дальше, и сделать вывод об общей глубине пространства.
Зачастую одно изображение не содержит информации в правильном масштабе, поэтому монокулярная оценка глубины обычно сосредоточена на относительной глубине. Иными словами, она может определить, какие объекты находятся ближе, а какие дальше, даже если точные расстояния неизвестны.
Если модель обучается на данных с истинными расстояниями или абсолютной глубиной, например на измерениях глубины с датчиков вроде LiDAR, она может научиться предсказывать расстояния в реальных единицах, например в метрах. Без таких эталонных данных модель по-прежнему может оценивать относительную глубину, но не способна надежно определять абсолютные расстояния.
Результатом монокулярной оценки глубины обычно является карта глубины — изображение, в котором каждый пиксель показывает, насколько близко или далеко находится соответствующая часть сцены. Карта глубины дает системам компьютерного зрения базовое представление о трехмерной структуре окружающей среды.

Рис. 1. Пример предсказанной карты глубины, созданной с помощью монокулярной оценки глубины (источник)
От датчиков к изображениям: оценка глубины#
Оценивать глубину можно несколькими способами — выбор зависит от доступных датчиков, аппаратных ограничений и требований к точности. Традиционные методы часто используют несколько ракурсов или специализированные датчики для непосредственного измерения расстояния.
Один из распространенных подходов — стереозрение, которое оценивает глубину путем сравнения двух синхронизированных изображений, снятых с немного разных ракурсов. Измеряя разницу между соответствующими точками на двух изображениях, система может определить, насколько далеко объекты находятся от камеры.
Другой подход — системы RGB-D (красный, зеленый, синий и глубина), использующие активные датчики глубины для непосредственного измерения расстояния в каждом пикселе. Такие системы могут предоставлять точную информацию о глубине в контролируемых условиях, но требуют дополнительного оборудования.
Методы на основе LiDAR используют лазерные импульсы для создания точных трехмерных представлений сцены. Несмотря на высокую точность, датчики LiDAR часто стоят дорого и существенно усложняют аппаратную часть системы.
В отличие от них, монокулярная оценка глубины определяет глубину, используя только одно RGB-изображение. Поскольку ей не нужны несколько камер или специализированные датчики, ее проще развертывать в больших масштабах, и это хороший вариант при ограниченном бюджете и аппаратных ресурсах.
Обучение оценке глубины по одному изображению#
При оценке глубины по одному изображению монокулярные модели глубины учатся распознавать визуальные признаки, которые люди инстинктивно используют для определения расстояния. К ним относятся линии перспективы, размер объекта, плотность текстуры, перекрытие объектов и затенение — все они дают подсказки о том, насколько далеко объекты находятся от камеры.
Эти признаки работают вместе, создавая ощущение глубины. Объекты, которые выглядят меньше или частично закрыты, обычно находятся дальше, тогда как более четкие детали и крупный вид объекта обычно указывают на его близкое расположение.
Чтобы изучить эти закономерности, монокулярные модели глубины обучают на больших наборах изображений, часто дополненных информацией о глубине, полученной из других источников, например LiDAR или стереосистем. Во время обучения модели учатся связывать визуальные признаки с глубиной, что позволяет им оценивать расстояние по одному изображению на этапе инференса.
Благодаря разнообразным обучающим данным современные модели компьютерного зрения могут обобщать полученное понимание на широкий спектр сред, включая внутренние и наружные сцены, а также работать с незнакомыми ракурсами.
Обзор различных методов монокулярной оценки глубины#
Далее мы рассмотрим основные подходы к оценке глубины по одному изображению и то, как эти методы развивались со временем.
Классические подходы и методы на основе геометрии#
Ранние методы оценки глубины опирались на простые визуальные правила, связанные с геометрией камеры. Для оценки расстояния использовались такие признаки, как перспектива, размер объекта и перекрытие одного объекта другим.
Например, если два похожих объекта имели разный размер, считалось, что меньший объект находится дальше. Эти подходы достаточно хорошо работали в контролируемых условиях, где освещение, положение камеры и структура сцены оставались неизменными.
Однако в реальных сценах такие предположения часто оказываются неверными. Изменения освещения и ракурса, а также возросшая сложность сцены могут приводить к ненадежным оценкам глубины, ограничивая эффективность классических методов в неконтролируемых условиях.
Ранние подходы машинного обучения#
Ранние методы машинного обучения сделали оценку глубины более гибкой, поскольку учились выявлять закономерности непосредственно по данным. Вместо того чтобы полагаться только на фиксированные геометрические правила, эти модели пытались изучить связь между визуальной информацией и расстоянием, рассматривая предсказание глубины как задачу регрессии на основе таких признаков, как границы, текстуры и изменения цвета.
Выбор этих признаков был важной частью процесса. Инженерам приходилось решать, какие визуальные сигналы извлекать и как их представлять, а производительность модели сильно зависела от этих решений.
Хотя этот подход работал лучше предыдущих методов, у него все еще были ограничения. Если выбранным признакам не хватало важного контекста, предсказания глубины становились менее точными. По мере усложнения и разнообразия сцен этим моделям часто было трудно выдавать надежные результаты.
Алгоритмы глубокого обучения#
В большинстве современных систем монокулярной оценки глубины используется глубокое обучение — нейронные сети с множеством слоев, способные изучать сложные закономерности по данным. Эти модели учатся напрямую предсказывать глубину по изображениям и создавать карты глубины.
Многие подходы построены на сверточных нейронных сетях (CNNs) — разновидности нейронных сетей, предназначенной для обработки изображений путем обнаружения таких закономерностей, как границы и формы. Эти модели часто используют архитектуру «кодировщик–декодировщик»: кодировщик извлекает визуальные признаки из изображения, а декодировщик преобразует их в карту глубины. Обработка изображения в нескольких масштабах помогает модели уловить общую структуру сцены и одновременно сохранить четкие границы объектов.
Более новые модели сосредоточены на понимании связей между разными частями изображения. Модели на основе Transformer и Vision Transformer (ViT) используют механизмы внимания, которые позволяют модели определять наиболее важные области изображения и связывать удаленные области друг с другом. Благодаря этому модель формирует более согласованное представление о глубине всей сцены.
Некоторые системы объединяют оба подхода. Гибридные модели CNN–Transformer используют CNN для захвата мелких локальных деталей, а Transformer — для моделирования глобального контекста сцены. Хотя это часто повышает точность, обычно требуется больше вычислительных ресурсов, например дополнительная память и вычислительная мощность.
Почему понимание глубины важно для систем ИИ, работающих с изображениями#
Изучая монокулярную оценку глубины, ты можешь задуматься, почему понимание глубины настолько важно для систем ИИ, основанных на компьютерном зрении.
Когда система может оценить расстояние до объектов и поверхностей, она лучше понимает структуру сцены и взаимосвязи между ее элементами. Такое пространственное восприятие необходимо для принятия надежных решений, особенно в реальных приложениях, например в автономном вождении.
Информация о глубине также добавляет ценный контекст другим задачам компьютерного зрения. Например, обнаружение объектов с помощью таких моделей, как Ultralytics YOLO26, может сообщить системе, что присутствует в сцене, а глубина помогает определить, где эти объекты находятся относительно камеры и друг друга.
Вместе эти возможности поддерживают широкий спектр приложений ИИ для компьютерного зрения, включая создание 3D-карт, навигацию в сложных средах и целостное понимание сцены.
Роботы и автономные транспортные средства используют эту информацию, чтобы безопасно перемещаться, избегать препятствий и реагировать на изменения в реальном времени. Например, подход Tesla к вождению только на основе компьютерного зрения использует изображения с камер в сочетании с оценкой глубины, а не LiDAR, чтобы понимать, насколько далеко находятся объекты и как они расположены на дороге.
Как работают модели монокулярной оценки глубины#
Хотя архитектуры моделей различаются, большинство моделей монокулярной оценки глубины используют схожий процесс преобразования одного изображения в карту глубины. Ниже кратко описаны основные этапы:
- Ввод и предварительная обработка: процесс начинается с входного изображения. Перед передачей в модель исходное изображение обычно изменяют по размеру, нормализуют и преобразуют в тензор — формат, который нейронные сети используют для эффективной обработки данных изображения.
- Извлечение признаков: сеть-кодировщик анализирует изображение и извлекает значимые визуальные признаки. Они содержат информацию о текстурах, границах объектов и общей структуре сцены. Большинство моделей работают в нескольких масштабах, чтобы понимать как мелкие детали, так и глобальную структуру.
- Анализ глубины: используя извлеченные признаки, модель объединяет локальные детали с глобальным контекстом, чтобы рассуждать о пространственных взаимосвязях в сцене. На этом этапе она учится определять, какие области изображения находятся ближе к камере, а какие — дальше.
- Создание карты глубины: затем декодировщик преобразует эту информацию в плотную карту глубины. Каждому пикселю изображения присваивается значение глубины, часто путем объединения предсказаний в разных масштабах для повышения точности и согласованности.
Как обучаются модели монокулярной оценки глубины#
Описанный выше процесс предполагает, что у нас уже есть обученная или предварительно обученная модель. Но как на самом деле обучается модель монокулярной оценки глубины?
Обучение начинается с подготовки данных изображений, чтобы сеть могла эффективно их обрабатывать. Входные изображения изменяют по размеру и нормализуют до единого масштаба, а затем пропускают через модель для создания предсказанной карты глубины, оценивающей расстояние в каждом пикселе.
Затем предсказанную карту глубины сравнивают с эталонными данными о глубине с помощью функции потерь, которая измеряет отклонение предсказания модели от истинной глубины. Это значение потерь отражает текущую ошибку модели и служит сигналом для ее улучшения.
Оптимизатор использует этот сигнал для обновления модели, корректируя ее внутренние веса. Для этого оптимизатор вычисляет градиент, описывающий изменение функции потерь относительно каждого параметра модели, и многократно применяет эти обновления на протяжении нескольких эпох, то есть полных проходов по обучающему набору данных.
Этот итеративный процесс обучения с учителем управляется такими гиперпараметрами, как скорость обучения, определяющая размер каждого шага обновления, и размер пакета, определяющий количество одновременно обрабатываемых изображений. Поскольку обучение включает большое количество математических операций, его обычно ускоряют с помощью графического процессора (GPU), который отлично подходит для параллельных вычислений.
После завершения обучения модель оценивают с помощью стандартных метрик на валидационном наборе, состоящем из изображений, не использовавшихся во время обучения. Такая оценка помогает измерить, насколько хорошо модель обобщает знания на новые данные.
Затем обученную модель можно повторно использовать или дообучить для новых сценариев. В целом этот процесс обучения позволяет моделям монокулярной оценки глубины создавать согласованные оценки глубины, необходимые для последующих задач, таких как 3D-реконструкция и развертывание в реальном мире.
Обзор передовых моделей и исследовательских тенденций#
Монокулярная оценка глубины быстро развивалась по мере того, как модели учились лучше понимать сцены целиком, а не только небольшие визуальные детали. Ранние подходы часто создавали неравномерные карты глубины, особенно в сложных условиях.
Более новые модели, представленные в недавних исследованиях на arXiv, сильнее ориентируются на глобальный контекст, благодаря чему предсказания глубины выглядят более стабильными и реалистичными. Известные модели, такие как MiDaS и DPT, помогли ускорить этот переход, обучаясь на разнообразных наборах данных изображений высокого разрешения и хорошо обобщая знания на множество сцен.
Более новые модели, включая ZoeDepth и Depth Anything V2, развивают эти идеи, повышая согласованность масштаба и сохраняя высокую производительность в самых разных условиях. Такой прогресс часто измеряется на распространенных эталонных наборах данных, таких как KITTI и NYU, включающих наружные и внутренние сцены.
Еще одна очевидная тенденция — поиск баланса между точностью и практичностью. Небольшие модели оптимизируют для скорости, и они могут работать в реальном времени на периферийных или мобильных устройствах, тогда как крупные модели ориентированы на более высокое разрешение и точность оценки глубины на больших расстояниях.
Применение монокулярной оценки глубины#
Далее рассмотрим несколько примеров из реального мира, показывающих, как монокулярная оценка глубины используется для анализа трехмерной структуры сцены по одному изображению.
Во всех этих случаях важно помнить, что информация о глубине представляет собой оценку, выведенную из визуальных признаков, а не точное измерение. Поэтому монокулярная оценка глубины полезна для понимания относительного расположения объектов и пространственных взаимосвязей, но не заменяет датчики, предназначенные для точного измерения расстояния, например LiDAR или стереосистемы.
Картографирование местности и навигация с помощью дронов#
Дроны часто работают в средах, где сигналы GPS ненадежны, например в лесах, на строительных площадках, в зонах бедствий или плотной городской застройке. Для безопасного полета в таких условиях им нужно понимать окружающий рельеф и знать, насколько далеко находятся препятствия. Раньше для этого обычно требовалось устанавливать дополнительные датчики, такие как LiDAR или стереокамеры, которые увеличивают вес, энергопотребление и общую стоимость.
Монокулярная оценка глубины — более простой вариант. Используя всего одну RGB-камеру, дроны могут оценивать глубину по изображениям и создавать базовое трехмерное представление окружающей среды. Это позволяет им обнаруживать такие препятствия, как здания, деревья или резкие изменения рельефа, и корректировать траекторию полета в реальном времени.
Эти оценки глубины поддерживают ключевые навигационные задачи, включая обход препятствий, управление высотой и безопасную посадку. В результате легкие дроны могут выполнять задачи картографирования, инспекции и навигации без специализированных датчиков глубины.

Рис. 2. Монокулярная оценка глубины может использоваться для анализа изображений с дрона (источник)
Заполнение слепых зон у автономных гоночных автомобилей#
Автономные транспортные средства обычно сильно зависят от датчиков LiDAR, которые используют лазерные импульсы для измерения расстояния и создания трехмерного вида дороги. Несмотря на высокую точность, LiDAR может испытывать трудности при резких перегибах дороги, крутых склонах, перекрытиях или внезапном наклоне автомобиля, иногда возвращая разреженные или отсутствующие данные о глубине.
Монокулярная оценка глубины помогает восполнять эти пробелы, предоставляя плотную информацию о глубине по одному RGB-изображению, даже когда данные LiDAR неполны. Представь ситуацию, в которой беспилотный автомобиль на высокой скорости приближается к вершине холма. Лучи LiDAR могут проходить над дорогой за вершиной, оставляя неопределенность относительно того, что находится впереди.
Однако оценка глубины по камере все еще может определить форму дороги по таким визуальным признакам, как перспектива и текстура, помогая автомобилю сохранять надежное восприятие до стабилизации данных LiDAR. Вместе LiDAR и монокулярная оценка глубины обеспечивают более стабильное восприятие и безопасное управление в сложных дорожных условиях.

Рис. 3. Визуализация использования монокулярной оценки глубины для автономных гонок (источник)
Роботизированная навигация и обход препятствий#
Роботы часто работают в местах, где подробные карты недоступны, а условия постоянно меняются. Для безопасного перемещения им нужно надежно понимать, сколько свободного пространства вокруг них и где расположены препятствия.
Монокулярная оценка глубины обеспечивает такое пространственное восприятие с помощью одной RGB-камеры, без тяжелого или дорогостоящего оборудования. Изучая такие визуальные признаки, как масштаб и перспектива, модели оценки глубины могут создавать плотные карты глубины окружающего пространства. Это дает роботам четкое представление о расстоянии до поверхностей и объектов.
В частности, если объединить информацию о глубине с такими задачами компьютерного зрения, как обнаружение объектов и семантическая сегментация, роботы получат более полное представление об окружающей среде. Они смогут распознавать объекты, понимать расстояние до них и решать, где безопасно двигаться. Это поддерживает обход препятствий, обнаружение свободного пространства и планирование маршрута в реальном времени.

Рис. 4. Обнаружение объектов с помощью монокулярной оценки глубины и обнаружения объектов (источник)
Преимущества и недостатки монокулярной оценки глубины#
Вот некоторые основные преимущества использования монокулярной оценки глубины:
- Малый вес и энергоэффективность: использование одной камеры снижает вес системы и энергопотребление, что особенно важно для мобильных роботов, дронов и встраиваемых систем.
- Удобство объединения с датчиками: монокулярная глубина может дополнять другие датчики, например LiDAR или радар, заполняя пробелы или обеспечивая резервирование.
- Работа в различных средах: один и тот же подход на основе камеры можно использовать в помещениях, на открытом воздухе и на разных платформах без изменения оборудования.
Хотя монокулярная оценка глубины дает очевидные преимущества, важно учитывать следующие ограничения:
- Более низкая точность по сравнению с активными датчиками: несмотря на быстрое развитие, монокулярная оценка глубины обычно не может сравниться с абсолютной точностью LiDAR или датчиков структурированного света в контролируемых условиях.
- Чувствительность к условиям освещения: производительность может снижаться при слабом освещении, сильных тенях, бликах или на сценах с недостаточной текстурой.
- Проблемы обобщения: модель, обученная в одной среде, не всегда надежно переносится на неизвестные области без адаптации или дообучения.
Когда не стоит полагаться на монокулярную оценку глубины#
Хотя монокулярная оценка глубины представляет собой интересное направление исследований, важно понимать, где ее можно применять на практике, а где нельзя. Расстояния, которые она выдает, являются оценками на основе того, что модель видит на изображении, а не точными измерениями реального мира.
Поэтому качество результатов может меняться в зависимости от таких факторов, как освещение, сложность сцены и ее сходство с данными, на которых обучалась модель. Монокулярная оценка глубины обычно хорошо определяет, что находится ближе, а что дальше, но ненадежна, когда требуются точные расстояния.
В ситуациях, где точность действительно важна, например в критически важных для безопасности системах, при промышленной инспекции или работе роботов, которым нужно очень точно взаимодействовать с объектами, глубину необходимо измерять напрямую. Для этого предназначены такие датчики, как LiDAR, радар, стереокамеры или системы структурированного света; они предоставляют гораздо более надежную информацию о расстоянии.
Монокулярная оценка глубины также может испытывать трудности в визуально сложных условиях. Плохое освещение, сильные тени, отражающие или прозрачные поверхности, туман, дым и сцены с очень слабой визуальной текстурой могут сделать оценки глубины менее надежными. Оценка глубины на больших расстояниях — еще один случай, когда специализированные датчики обычно работают лучше.
Когда речь идет о решениях для реального мира, оценка глубины по одному изображению лучше всего работает как вспомогательный инструмент, а не как самостоятельное решение. Она может добавлять полезный пространственный контекст, помогать восполнять пробелы при ограниченных возможностях других датчиков и улучшать общее понимание сцены. Однако при высоких требованиях к точности, безопасности или надежности не следует использовать ее как единственный источник информации о глубине.
Основные выводы#
Оценка глубины по одному изображению — это метод компьютерного зрения, который позволяет машинам оценивать расстояние до объектов, используя только изображение с одной камеры. Изучая такие визуальные признаки, как перспектива, размер объекта, текстура и затенение, эти AI-модели могут восстанавливать трехмерную структуру сцены без использования таких датчиков, как LiDAR или стереокамеры. Благодаря этому оценка глубины по одному изображению становится экономичным и масштабируемым подходом для таких задач, как автономное вождение, робототехника и понимание трехмерных сцен.
Чтобы узнать больше о vision AI, посети наш репозиторий GitHub и присоединись к нашему сообществу. Посети страницы наших решений, чтобы узнать больше об AI в робототехнике и компьютерном зрении в производстве. Ознакомься с нашими вариантами лицензирования, чтобы начать работу с компьютерным зрением уже сегодня!









