Ultralytics YOLO27:
Интеграции

Руководство по архитектуре U-Net и её применениям

Узнай об архитектуре U-Net, о том, как она поддерживает сегментацию изображений, где применяется и почему она важна для развития компьютерного зрения.

ABAbirami Vina8 min read
Архитектура U-Net для сегментации изображений

Компьютерное зрение — это область искусственного интеллекта (AI), связанная с анализом визуальных данных. Оно проложило путь ко множеству передовых систем, например к автоматизации проверки продукции на фабриках и помощи автономным транспортным средствам в навигации по дорогам.

Одна из самых известных задач компьютерного зрения — обнаружение объектов. Эта задача позволяет моделям находить и идентифицировать объекты на изображении с помощью ограничивающих рамок. Хотя ограничительные рамки полезны в различных приложениях, они дают лишь приблизительную оценку положения объекта.

Однако в таких областях, как здравоохранение, где точность имеет критическое значение, варианты применения ИИ в компьютерном зрении зависят не только от идентификации объекта. Зачастую также требуется информация о точной форме и положении объектов.

Именно для этого предназначена такая задача компьютерного зрения, как сегментация. Вместо ограничительных рамок модели сегментации обнаруживают объекты на уровне пикселей. За прошедшие годы исследователи разработали специализированные модели компьютерного зрения для сегментации.

Одна из таких моделей — U-Net. Хотя более новые и продвинутые модели превзошли её по производительности, U-Net занимает важное место в истории компьютерного зрения. В этой статье мы подробнее рассмотрим архитектуру U-Net, принцип её работы, области применения и сравнение с более современными моделями сегментации, доступными сегодня.

Сегментация аэрофотоснимка с помощью модели глубокого обучения U-Net

Рис. 1. Пример сегментации с помощью модели глубокого обучения U-Net. (Источник)

История сегментации изображений#

Прежде чем перейти к тому, что такое U-Net, давай сначала разберёмся, как развивались модели сегментации изображений.

Изначально компьютерное зрение опиралось на традиционные методы, такие как обнаружение границ, пороговая обработка и наращивание областей, для разделения объектов на изображении. Эти методы использовались для определения границ объектов по краям, разделения областей по интенсивности пикселей и группировки похожих пикселей. Они хорошо работали в простых случаях, но часто давали сбои, когда изображения содержали шум, перекрывающиеся формы или нечёткие границы.

После подъёма глубокого обучения в 2012 году исследователи в 2014 году представили концепцию полностью сверточных сетей (FCNs) для таких задач, как семантическая сегментация. Эти модели заменили отдельные части сверточной сети, чтобы компьютер мог одновременно анализировать всё изображение, а не разбивать его на небольшие фрагменты. Благодаря этому модель смогла создавать подробные карты, более наглядно показывающие содержимое изображения.

Хронология развития алгоритмов сегментации на основе глубокого обучения

Рис. 2. Развитие алгоритмов сегментации на основе глубокого обучения. (Источник)

Основываясь на FCNs, исследователи из Фрайбургского университета представили U-Net в 2015 году. Изначально она предназначалась для сегментации биомедицинских изображений. В частности, U-Net создавалась для эффективной работы в условиях ограниченного объёма размеченных данных.

Тем временем более поздние версии, такие как UNet++ и TransUNet, получили улучшения, включая слои внимания и более качественное извлечение признаков. Слои внимания помогают модели сосредоточиться на ключевых областях, а улучшенное извлечение признаков позволяет получать более подробную информацию.

Что такое U-Net и как признаки проходят через модель?#

U-Net — это модель глубокого обучения, специально созданная для сегментации изображений. Она принимает изображение на входе и создаёт маску сегментации, классифицирующую каждый пиксель в соответствии с объектом или областью, к которым он относится.

Модель получила название благодаря своей U-образной архитектуре. Она состоит из двух основных частей: энкодера, который сжимает изображение и извлекает его признаки, и декодера, который восстанавливает его до исходного размера. Такая конструкция образует симметричную U-образную форму, помогая модели понимать как общую структуру изображения, так и его мелкие детали.

Одна из ключевых особенностей U-Net — использование пропускающих соединений, которые позволяют напрямую передавать информацию от энкодера к декодеру. Это означает, что модель может сохранять важные детали, которые могли бы потеряться при сжатии изображения.

Обзор архитектуры U-Net#

Вот краткий обзор принципа работы архитектуры U-Net:

  • Входное изображение: U-Net начинает работу с 2D-изображения, например медицинского снимка или спутниковой фотографии. Цель состоит в том, чтобы присвоить каждому пикселю изображения метку класса.
  • Уменьшение размера: Изображение проходит через сверточные слои, которые извлекают важные визуальные признаки. По мере прохождения изображения через разные слои его разрешение уменьшается, а модель выявляет более общие закономерности.
  • Узкое место: В центре сети карты признаков достигают минимального пространственного разрешения, одновременно сохраняя высокоуровневые семантические признаки. Проще говоря, это сжатое представление карт признаков содержит общий контекст входных данных.
  • Увеличение размера: Затем сеть восстанавливает изображение, постепенно повышая разрешение. Транспонированные свертки помогают расширить карты признаков обратно до размера, близкого к исходному.
  • Пропускающие соединения: Карты признаков из пути уменьшения размера объединяются с картами из пути увеличения размера. Это помогает сохранять мелкие пространственные детали и одновременно интегрировать высокоуровневую контекстную информацию.
  • Результат — карта сегментации: Итоговый результат представляет собой попиксельную маску сегментации, соответствующую размеру входного изображения. Каждый пиксель классифицируется как объект, фон или интересующая область.

Схема архитектуры U-Net с энкодером и декодером

Рис. 3. Схема архитектуры U-Net. (Источник)

Понимание различий между ViT и U-Net#

Изучая U-Net, ты можешь задуматься, чем она отличается от других моделей глубокого обучения, например трансформера для обработки изображений (ViT), который также может выполнять задачи сегментации. Хотя обе модели способны выполнять похожие задачи, они различаются устройством и способом обработки сегментации.

U-Net обрабатывает изображения на уровне пикселей с помощью сверточных слоёв в структуре энкодер–декодер. Её часто используют для задач, требующих точной сегментации, например для анализа медицинских снимков или сцен, снятых беспилотными автомобилями.

В свою очередь, трансформер для обработки изображений (ViT) разбивает изображения на фрагменты и одновременно обрабатывает их с помощью механизмов внимания. В отличие от сверточного подхода U-Net, он использует самооб внимание — механизм, позволяющий модели оценивать важность разных частей изображения относительно друг друга, — чтобы учитывать взаимосвязи между этими частями.

Ещё одно важное различие заключается в том, что ViT обычно требуется больше данных для эффективной работы, зато он хорошо выявляет сложные закономерности. U-Net, напротив, хорошо работает с небольшими наборами данных, быстрее обучается и часто требует меньше времени на обучение.

Применение модели U-Net#

Теперь, когда мы лучше понимаем, что такое U-Net и как она работает, давай рассмотрим её применение в различных областях.

Сегментация кровоизлияний в мозге на медицинских изображениях#

U-Net стала надёжным методом попиксельной сегментации сложных медицинских изображений, особенно на пике её популярности в исследованиях. Исследователи использовали её для выделения ключевых областей на медицинских снимках, таких как опухоли и признаки внутреннего кровотечения на изображениях КТ и МРТ. Такой подход значительно повысил точность диагностики и упростил анализ сложных медицинских данных в исследовательских условиях.

Один из примеров влияния U-Net на исследования в здравоохранении — её применение для выявления инсультов и кровоизлияний в мозге на медицинских снимках. Исследователи могли использовать U-Net для анализа снимков головы и выделения подозрительных областей, что позволяло быстрее обнаруживать случаи, требующие немедленного внимания.

Сегментация очагов геморрагического инсульта на медицинских снимках с помощью 3D U-Net

Рис. 4. Сегментация очагов геморрагического инсульта с помощью 3D U-Net. (Источник)

Сегментация сельскохозяйственных культур#

Ещё одна область применения U-Net исследователями — сельское хозяйство, в частности сегментация сельскохозяйственных культур, сорняков и почвы. Она помогает фермерам контролировать состояние растений, оценивать урожайность и принимать более взвешенные решения на больших фермах. Например, U-Net может отделять культурные растения от сорняков, повышая эффективность применения гербицидов и сокращая потери.

Чтобы решить такие проблемы, как размытие движения на изображениях с дронов, исследователи усовершенствовали U-Net с помощью методов устранения размытия изображений. Это обеспечивает более чёткую сегментацию даже при сборе данных в движении, например во время аэрофотосъёмки.

Отделение сельскохозяйственных культур от сорняков на поле с помощью U-Net

Рис. 5. Отделение сельскохозяйственных культур от сорняков на полях с помощью U-Net. (Источник)

Автономное вождение#

До появления более продвинутых моделей ИИ U-Net играла важную роль в изучении того, как сегментация может улучшить автономное вождение. В автономных транспортных средствах семантическую сегментацию U-Net можно использовать для классификации каждого пикселя изображения по категориям, таким как дорога, транспортное средство, пешеход и дорожная разметка. Это даёт автомобилю чёткое представление об окружающей обстановке, помогая безопасно ориентироваться и эффективно принимать решения.

Дорожная сцена с сегментированной с помощью U-Net областью, доступной для движения

Рис. 6. Дорожная сцена, в которой с помощью U-Net сегментирована область, доступная для движения. (Источник)

Преимущества и недостатки U-Net#

Даже сегодня U-Net остаётся хорошим выбором для сегментации изображений среди исследователей благодаря сочетанию простоты, точности и адаптивности. Вот некоторые ключевые преимущества, которые выделяют её среди других моделей:

  • Адаптивность к разным модальностям: U-Net адаптировали для разных типов данных, включая 3D-медицинские снимки, спутниковые изображения и даже видеокадры.
  • Быстрый вывод после оптимизации: При правильной настройке U-Net может работать эффективно, что делает её подходящей для приложений реального или близкого к реальному времени.
  • Открытый исходный код и сообщество: U-Net доступна в основных библиотеках глубокого обучения и поддерживается большим сообществом разработчиков и исследователей.

Несмотря на многочисленные преимущества U-Net, у неё есть и несколько ограничений, о которых стоит помнить. Вот некоторые факторы, которые следует учитывать:

  • Чувствительность к качеству данных: На производительность U-Net могут негативно влиять данные низкого качества, например зашумленные изображения или изображения с низким разрешением.
  • Склонность к переобучению на небольших наборах данных: Хотя U-Net хорошо работает с ограниченным объёмом данных, без надлежащей регуляризации она всё равно может переобучиться, особенно если набор данных слишком мал или недостаточно разнообразен.
  • Вычислительные ресурсы: U-Net может требовать значительных вычислительных затрат, особенно при работе с большими наборами данных, поэтому для обучения необходимы существенные аппаратные ресурсы.

Основные выводы#

U-Net стала важной вехой в развитии сегментации изображений. Она доказала, что модели глубокого обучения могут обеспечивать точные результаты на небольших наборах данных, особенно в таких областях, как анализ медицинских изображений.

Этот прорыв проложил путь к более продвинутым приложениям в различных областях. По мере развития компьютерного зрения модели сегментации, такие как U-Net, остаются фундаментальными инструментами, позволяющими машинам с высокой точностью понимать и интерпретировать визуальные данные.

Хочешь создавать собственные проекты в области компьютерного зрения? Изучи наш репозиторий на GitHub, чтобы глубже погрузиться в ИИ, и ознакомься с нашими вариантами лицензирования. Узнай, как компьютерное зрение в здравоохранении повышает эффективность, и изучи влияние ИИ в розничной торговле на страницах наших решений! Присоединяйся к нашему растущему сообществу прямо сейчас!

Explore solutions

Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше

Давай вместе создавать будущее AI!

Начни свой путь в будущее машинного обучения