YOLO Vision 2026:
Vision AI

Что такое Mask R-CNN и как это работает?

Узнай, как Mask R-CNN можно использовать для точной сегментации объектов на изображениях и видео для различных задач в разных секторах.

ABAbirami Vina4 min read
Сегментация экземпляров с помощью Mask R-CNN

Инновации вроде роботов на складах, беспилотных автомобилей, безопасно маневрирующих на оживленных улицах, дронов, проверяющих посевы, и систем ИИ, контролирующих продукцию на фабриках, становятся все более привычными по мере распространения ИИ. Ключевой технологией, лежащей в основе этих инноваций, является computer vision — ветвь ИИ, которая позволяет машинам понимать и интерпретировать визуальные данные.

Например, обнаружение объектов (object detection) — это задача computer vision, которая помогает находить и локализовать объекты на изображениях с помощью ограничивающих рамок (bounding boxes). Хотя эти рамки предоставляют полезную информацию, они дают лишь приблизительную оценку положения объекта и не могут передать его точную форму или границы. Это делает их менее эффективными в задачах, требующих точной идентификации.

Для решения этой проблемы исследователи разработали модели сегментации, которые позволяют улавливать точные контуры объектов, предоставляя детализацию на уровне пикселей для более точного обнаружения и анализа.

Mask R-CNN — одна из таких моделей. Представленная в 2017 году подразделением Facebook AI Research (FAIR), она базируется на более ранних моделях, таких как R-CNN, Fast R-CNN и Faster R-CNN. Будучи важной вехой в истории computer vision, Mask R-CNN проложила путь к более продвинутым моделям, например Ultralytics YOLO11.

В этой статье мы рассмотрим, что такое Mask R-CNN, как она работает, где применяется и какие улучшения появились после нее, что привело к созданию Ultralytics YOLO11.

Обзор Mask R-CNN#

Mask R-CNN, что расшифровывается как Mask Region-based Convolutional Neural Network, представляет собой модель глубокого обучения, разработанную для computer vision tasks, таких как обнаружение объектов и сегментация по экземплярам.

Сегментация экземпляров выходит за рамки традиционного обнаружения объектов: она не только идентифицирует объекты на изображении, но и точно очерчивает каждый из них. Модель присваивает уникальную метку каждому обнаруженному объекту и фиксирует его точную форму на уровне пикселей. Такой детальный подход позволяет четко различать перекрывающиеся объекты и точно работать со сложными формами.

Mask R-CNN основана на Faster R-CNN, которая находит и подписывает объекты, но не определяет их точные формы. Mask R-CNN улучшает этот процесс, выявляя конкретные пиксели, составляющие каждый объект, что позволяет проводить гораздо более детальный и точный анализ изображений.

Comparison of object detection and instance segmentation

Fig 1. Сравнение обнаружения объектов и сегментации по экземплярам.

Взгляд на архитектуру Mask R-CNN и принципы ее работы#

Mask R-CNN использует пошаговый подход для точного обнаружения и сегментации объектов. Сначала она извлекает ключевые признаки с помощью глубокой нейронной сети (многослойной модели, обучающейся на данных), затем определяет потенциальные области объектов с помощью сети формирования предложений регионов (Region Proposal Network — компонент, предлагающий вероятные области объектов) и, наконец, уточняет эти области, создавая подробные маски сегментации (точные контуры объектов), которые фиксируют точную форму каждого из них.

Далее мы подробно разберем каждый шаг, чтобы лучше понять, как работает Mask R-CNN.

Overview of the Mask R-CNN architecture

Рис. 2. Обзор архитектуры Mask R-CNN (Источник: researchgate.net).

Начиная с извлечения признаков#

Первый шаг в архитектуре Mask R-CNN — разбиение изображения на ключевые компоненты, чтобы модель могла понять, что на нем изображено. Представь, что ты смотришь на фото и естественным образом замечаешь детали: формы, цвета и края. Модель делает нечто подобное, используя глубокую нейронную сеть, называемую «основой» или «бэкбоном» (часто ResNet-50 или ResNet-101), которая работает как ее глаза, сканируя изображение и выделяя важные детали.

Поскольку объекты на изображениях могут быть как очень маленькими, так и очень большими, Mask R-CNN использует Feature Pyramid Network (пирамидальную сеть признаков). Это похоже на использование разных увеличительных стекол, которые позволяют модели видеть как мелкие детали, так и общую картину, гарантируя, что объекты всех размеров будут замечены.

После извлечения этих важных features are extracted модель переходит к определению местоположения потенциальных объектов на изображении, подготавливая почву для дальнейшего анализа.

Предложение потенциальных областей с объектами на изображении#

После того как изображение было обработано для извлечения ключевых признаков, в дело вступает Region Proposal Network. Эта часть модели изучает изображение и предлагает области, в которых вероятнее всего находятся объекты.

Она делает это, генерируя множество возможных точек расположения объектов, называемых anchors. Затем сеть оценивает эти анкеры и выбирает наиболее перспективные для дальнейшего анализа. Таким образом модель фокусируется только на тех областях, которые с наибольшей вероятностью представляют интерес, вместо того чтобы проверять каждую точку на изображении.

Diagram of a Region Proposal Network

Fig 3. Пример сети предложений регионов (Region Proposal Network).

Улучшение извлеченных признаков#

Когда ключевые области определены, следующий шаг — уточнение деталей, извлеченных из этих регионов. В более ранних моделях использовался метод ROI Pooling (объединение областей интереса) для захвата признаков из каждой области, но эта техника иногда приводила к небольшим смещениям при изменении размера регионов, что делало ее менее эффективной, особенно для маленьких или перекрывающихся объектов.

Mask R-CNN улучшает этот процесс с помощью техники, называемой ROI Align (выравнивание областей интереса). Вместо округления координат, как в ROI Pooling, ROI Align использует билинейную интерполяцию для более точной оценки значений пикселей. Билинейная интерполяция — это метод, который вычисляет новое значение пикселя путем усреднения значений его четырех ближайших соседей, что создает более плавные переходы. Это позволяет признакам оставаться правильно выровненными относительно исходного изображения, что приводит к более точному обнаружению и сегментации объектов.

Например, в футбольном матче двух игроков, стоящих близко друг к другу, можно ошибочно принять за одного из-за перекрытия их ограничивающих рамок. ROI Align помогает разделить их, сохраняя границы их форм четкими.

Diagram of how Mask R-CNN uses ROI Align

Fig 4. Mask R-CNN использует ROI Align.

Классификация объектов и предсказание их масок#

После того как ROI Align обработает изображение, следующий шаг — классификация объектов и точная настройка их расположения. Модель анализирует каждый извлеченный регион и решает, какой именно объект в нем находится. Она присваивает балл вероятности различным категориям и выбирает лучшее совпадение.

Одновременно с этим она корректирует ограничивающие рамки, чтобы они лучше соответствовали объектам. Первоначальные рамки могут быть расположены неидеально, поэтому этот шаг помогает повысить точность, гарантируя, что каждая рамка плотно охватывает обнаруженный объект.

Наконец, Mask R-CNN делает дополнительный шаг: параллельно генерирует подробную segmentation mask для каждого объекта.

Mask R-CNN и приложения реального времени#

Когда эта модель появилась, ее с большим энтузиазмом встретило сообщество ИИ, и вскоре она нашла применение в самых разных областях. Способность обнаруживать и сегментировать объекты в реальном времени изменила правила игры в различных индустриях.

Например, tracking endangered animals в дикой природе — сложная задача. Многие виды перемещаются по густым лесам, из-за чего защитникам природы трудно следить за ними. Традиционные методы используют камеры-ловушки, дроны и спутниковые снимки, но ручная сортировка всех этих данных отнимает много времени. Ошибки в идентификации и пропущенные наблюдения могут замедлить природоохранные мероприятия.

Распознавая уникальные черты, такие как полоски тигра, пятна жирафа или форму ушей слона, Mask R-CNN может обнаруживать и сегментировать животных на изображениях и видео с гораздо большей точностью. Даже когда животные частично скрыты деревьями или стоят близко друг к другу, модель может отделить их и идентифицировать каждое по отдельности, делая мониторинг дикой природы быстрее и надежнее.

Detecting and segmenting animals using Mask R-CNN

Fig 5. Обнаружение и сегментация животных с помощью Mask R-CNN.

Ограничения Mask R-CNN#

Несмотря на свою историческую значимость в задачах обнаружения и сегментации объектов, у Mask R-CNN есть ключевые недостатки. Вот некоторые проблемы, связанные с Mask R-CNN:

  • High computational demand: модель зависит от мощных GPU, что может делать ее запуск дорогим и замедлять обработку больших объемов данных.
  • Более низкая скорость обработки: многоэтапный процесс делает ее медленнее по сравнению с быстрыми моделями реального времени, такими как YOLO, что может быть не лучшим решением для задач, чувствительных ко времени.
  • Зависимость от качества данных: модель лучше всего работает с четкими, хорошо размеченными изображениями. Размытые или плохо освещенные изображения могут значительно снизить ее точность.
  • Сложность реализации: многоэтапная архитектура может быть трудна в настройке и оптимизации, особенно при работе с большими наборами данных или ограниченными ресурсами.

От Mask R-CNN к Ultralytics YOLO11#

Mask R-CNN отлично подходила для задач сегментации, но многие отрасли стремились внедрять computer vision, отдавая приоритет скорости и работе в реальном времени. Это требование подтолкнуло исследователей к разработке одноэтапных моделей, которые обнаруживают объекты за один проход, значительно повышая эффективность.

В отличие от многошагового процесса Mask R-CNN, одноэтапные computer vision models, такие как YOLO (You Only Look Once), ориентированы на задачи компьютерного зрения в реальном времени. Вместо того чтобы обрабатывать обнаружение и сегментацию раздельно, модели YOLO способны анализировать изображение за один проход. Это делает их идеальными для таких применений, как автономное вождение, здравоохранение, производство и робототехника, где критически важна скорость принятия решений.

В частности, Ultralytics YOLO11 идет еще дальше, будучи одновременно быстрым и точным. Она использует на 22% меньше параметров, чем YOLOv8m, но при этом достигает более высокой средней точности (mAP) на датасете COCO, что означает более точное обнаружение объектов. Улучшенная скорость обработки делает ее хорошим выбором для приложений реального времени, где важна каждая миллисекунда.

Производительность Ultralytics YOLO11 по сравнению с другими моделями

Fig 6. Производительность YOLO11 по сравнению с другими моделями.

Основные выводы#

Оглядываясь на историю computer vision, Mask R-CNN признается как прорыв в обнаружении и сегментации объектов. Она выдает очень точные результаты даже в сложных условиях благодаря тщательно проработанному многоэтапному процессу.

Тем не менее, этот же процесс делает ее медленнее по сравнению с моделями реального времени, такими как YOLO. Поскольку потребность в скорости и эффективности растет, во многих приложениях сейчас используются одноэтапные модели, такие как Ultralytics YOLO11, которые предлагают быстрое и точное обнаружение объектов. Хотя Mask R-CNN важна для понимания эволюции computer vision, тенденция к решениям реального времени подчеркивает растущий спрос на более быстрые и эффективные технологии компьютерного зрения.

Присоединяйся к нашему растущему community! Изучи наш GitHub repository, чтобы узнать больше об искусственном интеллекте. Готов начать свои собственные проекты в области computer vision? Ознакомься с нашими licensing options. Узнай про AI in agriculture и vision AI in healthcare, посетив страницы наших решений!

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения