Panoptic Segmentation
Изучи паноптическую сегментацию, объединяющую семантическую сегментацию и сегментацию экземпляров. Узнай, как Ultralytics YOLO26 обеспечивает точное понимание сцены для проектов AI.
Паноптическая сегментация — это комплексная задача компьютерного зрения (CV), объединяющая две различные формы анализа изображений: семантическую сегментацию и сегментацию экземпляров. В то время как традиционные методы рассматривают эти задачи по отдельности — либо в общих чертах классифицируют фоновые области, такие как «небо» или «трава», либо обнаруживают конкретные объекты, такие как «автомобиль» или «человек», — паноптическая сегментация объединяет их в единую согласованную систему. Этот подход назначает уникальное значение каждому пикселю изображения, обеспечивая полное понимание сцены и различая исчисляемые объекты (так называемые «things») и аморфные фоновые области (так называемые «stuff»). Благодаря тому, что каждый пиксель учитывается и классифицируется, эта технология точнее имитирует человеческое зрительное восприятие, чем изолированные методы обнаружения.
Основная концепция: stuff и things#
Чтобы полностью понять паноптическую сегментацию, полезно разобраться в дихотомии визуальной информации, которую она обрабатывает. Задача разделяет визуальный мир на две основные категории:
- Категории stuff: Они представляют собой аморфные области с похожей текстурой или материалом, которые нельзя посчитать. Примеры включают дороги, воду, траву, небо и стены. При паноптическом анализе все пиксели, относящиеся к «дороге», объединяются в одну семантическую область, поскольку обычно неважно различать «участок дороги A» и «участок дороги B».
- Категории things: Это исчисляемые объекты с определённой геометрией и границами. Примеры включают пешеходов, транспортные средства, животных и инструменты. Паноптические модели должны идентифицировать каждый «thing» как уникальный объект, чтобы два человека, стоящие рядом, распознавались как отдельные экземпляры (например, «Человек A» и «Человек B»), а не как единая слитная область.
Это различие крайне важно для продвинутых систем искусственного интеллекта (AI), поскольку позволяет им ориентироваться в окружающей среде и одновременно взаимодействовать с конкретными объектами.
Как работают паноптические архитектуры#
Современные архитектуры паноптической сегментации обычно используют мощный бэкбон на основе глубокого обучения (DL), например свёрточную нейронную сеть (CNN) или Vision Transformer (ViT), для извлечения богатых представлений признаков из изображения. Обычно сеть разделяется на две ветви, или «головы»:
-
Семантическая голова: Эта ветвь предсказывает метку класса для каждого пикселя, создавая плотную карту «stuff» на сцене.
-
Голова экземпляров: Одновременно эта ветвь использует методы, похожие на обнаружение объектов, чтобы локализовать «things» и создавать для них маски.
Затем модуль слияния или этап постобработки устраняет конфликты между этими результатами — например, определяет, принадлежит ли пиксель экземпляру «человека» или расположенной за ним фоновой стене, — чтобы получить итоговую неперекрывающуюся паноптическую карту сегментации.
Практические применения#
Целостный характер паноптической сегментации делает её незаменимой в отраслях, где безопасность и контекст имеют первостепенное значение.
- Автономные транспортные средства: Беспилотные автомобили используют паноптическое восприятие для безопасной навигации. Семантический компонент определяет проезжаемые поверхности (дороги) и границы (тротуары), а компонент экземпляров отслеживает динамические препятствия, такие как пешеходы и другие транспортные средства. Это единое представление помогает алгоритмам планирования автомобиля принимать более безопасные решения в сложных сценариях управления дорожным движением.
- Анализ медицинских изображений: В цифровой патологии анализ образцов тканей часто требует сегментации общей структуры ткани (stuff) с одновременным подсчётом и измерением определённых типов клеток или опухолей (things). Такая подробная разбивка помогает врачам точно оценивать степень заболевания и ставить диагноз.
- Робототехника: Сервисным роботам, работающим в неструктурированной среде, например в домах или на складах, необходимо отличать пол, по которому они могут перемещаться (фон), от объектов, которыми им нужно манипулировать или которых следует избегать (экземпляры).
Реализация сегментации с помощью Ultralytics#
Хотя полноценное обучение паноптической модели может быть сложным, разработчики могут добиться высокоточной сегментации экземпляров — важнейшего компонента паноптической задачи — с помощью Ultralytics YOLO26. Эта современная модель обеспечивает работу в реальном времени и оптимизирована для развёртывания на периферийных устройствах.
В следующем примере на Python показано, как загрузить предварительно обученную модель сегментации и выполнить инференс для выделения отдельных объектов:
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to segment individual instances
# The model identifies 'things' and generates pixel-perfect masks
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with overlaid segmentation masks
results[0].show()Командам, которые хотят управлять своими данными для обучения и автоматизировать процесс аннотирования, Ultralytics Platform предоставляет набор инструментов для управления наборами данных и обучения моделей. Качественная разметка данных крайне важна для задач сегментации, поскольку моделям необходимы точные попиксельные метки для эффективного обучения.
Различия между связанными терминами#
Понимание различий между типами сегментации крайне важно для выбора подходящей модели для твоего проекта:
- Семантическая сегментация: Фокусируется только на классификации пикселей по категориям. Она отвечает на вопрос «к какому классу относится этот пиксель?» (например, дерево, небо), но не может разделять отдельные объекты одного класса. Если два автомобиля перекрываются, они выглядят как одна большая область «автомобиль».
- Сегментация экземпляров: Фокусируется только на обнаружении и маскировании исчисляемых объектов. Она отвечает на вопрос «какой это объект?», но обычно полностью игнорирует контекст фона.
- Паноптическая сегментация: Объединяет оба подхода. Она отвечает на вопросы «что это за пиксель?» и «какому экземпляру объекта он принадлежит?» для всего изображения, гарантируя, что ни один пиксель не останется неклассифицированным.
Чтобы подробнее изучить форматы наборов данных, используемые в этих задачах, можно ознакомиться с документацией по набору данных COCO, который является стандартным бенчмарком для оценки качества сегментации.









