Semantic Mapping
Узнай, как семантическое картирование объединяет семантическую сегментацию, оценку глубины, локализацию и слияние датчиков для более интеллектуальной навигации роботов с помощью Ultralytics YOLO26.
Семантическое отображение — это процесс построения пространственного представления окружающей среды и привязки значимых меток классов (таких как дорога, стена, дверной проем, человек, полка или растительность) к определенным локациям в нем. В сфере ИИ и робототехники семантическая карта отвечает как на вопрос «Где находится объект?», так и на вопрос «Что это такое?». Вместо того чтобы представлять сцену только в виде занятого и свободного пространства, она предоставляет контекстную информацию, которая поддерживает навигацию, планирование, взаимодействие и понимание сцены.
Как работает семантическое отображение#
Система семантического отображения обычно объединяет восприятие, геометрию, локализацию и темпоральное слияние. Сначала модель семантической сегментации классифицирует каждый пиксель изображения. Все пиксели с меткой «дорога», например, образуют область дороги, а пиксели с меткой «автомобиль» определяют области транспортных средств. В введении NVIDIA в сегментацию изображений в робототехнике показано, как эти попиксельные метки поддерживают восприятие робота.
Сами по себе метки пикселей остаются привязанными к двумерному изображению камеры. Системе необходима геометрия, часто получаемая с помощью LiDAR, стереокамер или оценки глубины, чтобы сопоставить пиксели с физическими координатами. Рабочий процесс с RGB-D изображениями Open3D демонстрирует, как зарегистрированные изображения цвета и глубины могут создавать трехмерное облако точек.
Точность проецирования также зависит от внутренних и внешних параметров камеры. В документации по калибровке камер OpenCV объясняются параметры, используемые для связи пикселей изображения с 3D-точками, в то время как определение сообщения CameraInfo в ROS стандартизирует эту информацию о калибровке в роботизированных системах.
Наконец, слияние датчиков объединяет наблюдения с течением времени. Позы робота и преобразования координат помещают каждое размеченное наблюдение в общее пространство карты. Преобразования координат tf2 в ROS предоставляют один из распространенных механизмов поддержания этих взаимосвязей.
Связанные концепции и ключевые различия#
Семантическое отображение пересекается с несколькими концепциями компьютерного зрения и робототехники, но они решают разные задачи:
- Визуальный SLAM оценивает положение камеры или робота при построении геометрической карты. Семантическое отображение добавляет к этой геометрии смысловое значение классов. Поэтому система может использовать SLAM для оценки позы, а семантическое восприятие — для разметки.
- Отображение занятости описывает, являются ли ячейки свободными, занятыми или неизвестными. Руководство по отображению и локализации Nav2 объясняет, как сетки занятости поддерживают планирование пути. Семантическая карта дополнительно позволяет отличать стену от человека или пригодную для движения дорогу от тротуара.
- Сегментация экземпляров разделяет отдельные объекты, например два разных автомобиля. Семантическая сегментация группирует оба автомобиля в один класс пикселей. Семантические карты могут использовать любое из этих представлений в зависимости от того, нужно ли сохранять индивидуальность объекта.
- Семантический поиск организует информацию по концептуальному сходству, тогда как семантическое отображение в робототехнике связывает значения с физическими местоположениями.
Реальные приложения#
Автономная навигация: Робот-доставщик может размечать полы как проходимые, стены и бордюры как препятствия, а людей как динамические опасности. Эти метки можно преобразовать в навигационные стоимости, чтобы планировщик отдавал предпочтение безопасным поверхностям, а не относился ко всем видимым областям одинаково. Учебное пособие Nav2 по навигации с использованием семантической сегментации показывает, как маски классов и зарегистрированные облака точек могут обновлять карту стоимостей робота.
Городское вождение: Автономное транспортное средство может проецировать предсказания дороги, тротуара, зданий, растительности, пешеходов и транспортных средств на постоянную карту мира. Это помогает системе понимать границы полос, распознавать непригодные для движения зоны и рассуждать о том, где могут появиться уязвимые участники дорожного движения. Официальный датасет городской среды Cityscapes предоставляет детально размеченные изображения улиц для разработки такого понимания сцены.
Семантическое восприятие с Ultralytics YOLO#
Следующий рабочий процесс семантической сегментации Ultralytics создает плотную карту классов с использованием YOLO26. Этот вывод впоследствии может быть проецирован конвейером отображения в двумерную сетку или трехмерную систему координат мира.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")semantic_mask содержит один ID класса на один пиксель изображения. Она обеспечивает слой семантического восприятия, в то время как для построения постоянной пространственной карты по-прежнему требуются глубина, калибровка, локализация и темпоральное слияние. Пользовательские попиксельные датасеты можно размечать и обрабатывать с помощью инструментов аннотирования на платформе Ultralytics Platform.
Практические соображения по проектированию#
Для надежных семантических карт требуются согласованные определения классов, точная калибровка датчиков, синхронизированные метки времени и репрезентативные обучающие данные. Дрейф позы может поместить правильные метки в неверные места, в то время как ошибки сегментации могут отметить препятствия как проходимое пространство. Динамические объекты также требуют правил удаления или отслеживания, чтобы припаркованный автомобиль или пешеход не оставались навсегда зафиксированными на карте.
Командам следует проверять как точность восприятия, так и пространственную согласованность, тестировать сложные границы и небольшие структуры, сохранять достоверность предсказаний везде, где это возможно, и определять, как обновляются противоречащие друг другу наблюдения. Для критически безопасной навигации семантическая информация должна дополнять, а не автоматически заменять геометрическое обнаружение препятствий и проверку столкновений.






