Semantic Mapping
Узнай, как семантическое картографирование объединяет семантическую сегментацию, глубину, локализацию и слияние данных с датчиков для более интеллектуальной навигации роботов с помощью Ultralytics YOLO26.
Семантическое картографирование — это процесс построения пространственного представления окружающей среды и присвоения значимых классовых меток — например, «дорога», «стена», «дверной проём», «человек», «полка» или «растительность» — расположенным в ней объектам. В AI и робототехнике семантическая карта отвечает сразу на два вопроса: «Где находится объект?» и «Что это?». В отличие от представления сцены только как свободного и занятого пространства, она предоставляет контекстную информацию, поддерживающую навигацию, планирование, взаимодействие и понимание сцены.
Как работает семантическое картографирование#
Система семантического картографирования обычно объединяет восприятие, геометрию, локализацию и временное объединение данных. Сначала модель семантической сегментации классифицирует каждый пиксель изображения. Например, все пиксели с меткой «дорога» образуют область дороги, а пиксели с меткой «автомобиль» обозначают области с транспортными средствами. В введении NVIDIA в сегментацию изображений в робототехнике показано, как такие попиксельные метки поддерживают восприятие роботом.
Одни лишь метки пикселей остаются привязанными к двумерному изображению с камеры. Системе необходима геометрия, часто получаемая от LiDAR, стереокамер или оценки глубины, чтобы сопоставить пиксели с физическими позициями. В рабочем процессе Open3D для RGB-D-изображений показано, как зарегистрированные цветные изображения и изображения глубины могут создавать 3D-облако точек.
Точная проекция также зависит от внутренних и внешних параметров камеры. В документации OpenCV по калибровке камеры объясняются параметры, используемые для сопоставления пикселей изображения с 3D-точками, а определение сообщения CameraInfo в ROS стандартизирует эту калибровочную информацию в роботизированных системах.
Наконец, объединение данных с сенсоров объединяет наблюдения во времени. Положения робота и преобразования координат помещают каждое размеченное наблюдение в общую систему координат карты. Преобразования координат tf2 в ROS предоставляют единый распространённый механизм для поддержания этих связей.
Связанные понятия и ключевые различия#
Семантическое картографирование связано с несколькими концепциями компьютерного зрения и робототехники, но каждая из них решает разные задачи:
- Визуальная SLAM оценивает положение камеры или робота и одновременно строит геометрическую карту. Семантическое картографирование добавляет смысл классов этой геометрии. Поэтому система может использовать SLAM для оценки положения, а семантическое восприятие — для разметки.
- Картографирование занятости описывает, являются ли ячейки свободными, занятыми или неизвестными. В руководстве Nav2 по картографированию и локализации объясняется, как сетки занятости поддерживают планирование маршрута. Семантическая карта дополнительно может отличать стену от человека или проезжую дорогу от тротуара.
- Сегментация экземпляров разделяет отдельные объекты, например два разных автомобиля. Семантическая сегментация объединяет оба автомобиля в один класс пикселей. Семантические карты могут использовать любое из этих представлений в зависимости от того, требуется ли сохранять идентичность объектов.
- Семантический поиск организует информацию по концептуальному сходству, тогда как семантическое картографирование в робототехнике связывает значения с физическими местоположениями.
Практические применения#
Автономная навигация: робот-доставщик может помечать полы как проходимые поверхности, стены и бордюры — как препятствия, а людей — как динамические опасности. Эти метки можно преобразовать в навигационные стоимости, чтобы планировщик отдавал предпочтение безопасным поверхностям, а не обрабатывал все видимые области одинаково. В руководстве Nav2 по навигации с семантической сегментацией показано, как маски классов и зарегистрированные облака точек могут обновлять карту стоимостей робота.
Городское вождение: автономный автомобиль может проецировать данные о дорогах, тротуарах, зданиях, растительности, пешеходах и транспортных средствах в постоянную карту окружающего мира. Это помогает системе понимать границы полос, распознавать непроезжие участки и определять, где могут появиться уязвимые участники дорожного движения. Официальный датасет городских сцен Cityscapes предоставляет изображения улиц с плотной разметкой для разработки такого понимания сцены.
Семантическое восприятие с Ultralytics YOLO#
Следующий рабочий процесс Ultralytics для семантической сегментации создаёт плотную карту классов с использованием YOLO26. Позднее эти выходные данные можно спроецировать в двумерную сетку или в трёхмерную систему мировых координат с помощью конвейера картографирования.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")semantic_mask содержит один идентификатор класса для каждого пикселя изображения. Он предоставляет слой семантического восприятия, однако для построения постоянной пространственной карты по-прежнему необходимы данные о глубине, калибровка, локализация и временное объединение данных. Пользовательские датасеты с попиксельной разметкой можно размечать и обрабатывать с помощью инструментов аннотирования Ultralytics Platform.
Практические аспекты проектирования#
Надёжные семантические карты требуют согласованных определений классов, точной калибровки сенсоров, синхронизированных временных меток и репрезентативных обучающих данных. Дрейф положения может привести к размещению правильных меток в неправильных местах, а ошибки сегментации — к обозначению препятствий как проходимого пространства. Динамические объекты также требуют правил удаления устаревших данных или отслеживания, чтобы припаркованный автомобиль или пешеход не оставались навсегда встроенными в карту.
Команды должны проверять как точность восприятия, так и пространственную согласованность, тестировать сложные границы и небольшие структуры, по возможности сохранять уверенность предсказаний и определять правила обновления конфликтующих наблюдений. В навигации, критичной с точки зрения безопасности, семантическая информация должна дополнять, а не автоматически заменять геометрическое обнаружение препятствий и проверки столкновений.









