Разбираемся в сегментации концепций по текстовым запросам
Изучи сегментацию концепций по текстовым запросам, ее отличия от традиционных методов и то, как родственные модели, например YOLOE-26, обеспечивают работу с открытым словарем.

Vision AI стремительно развивается и широко используется для анализа изображений и видео в реальных условиях. Например, приложения — от систем управления дорожным движением до аналитики розничной торговли — интегрируются с моделями компьютерного зрения.
Во многих таких приложениях модели компьютерного зрения, например модели обнаружения объектов, обучаются распознавать заранее определённый набор объектов, включая транспортные средства, людей и оборудование. Во время обучения этим моделям показывают множество размеченных примеров, чтобы они научились распознавать внешний вид каждого объекта и отличать его от других объектов в сцене.
В задачах сегментации модели идут дальше и создают точные контуры этих объектов на уровне пикселей. Это позволяет системам точно понимать, где расположен каждый объект на изображении.
Это хорошо работает, пока системе нужно распознавать только те объекты, на которых она обучалась. Однако в реальных условиях это бывает редко.
Визуальные сцены обычно динамичны. Появляются новые объекты и визуальные концепты, условия меняются, а пользователи часто хотят сегментировать объекты, которые не входили в исходную конфигурацию обучения.
Эти ограничения особенно заметны в задачах сегментации. По мере развития Vision AI растёт потребность в более гибких моделях сегментации, способных адаптироваться к новым концептам без повторного обучения. Поэтому сегментация концептов с поддержкой промптов (PCS) привлекает всё больше внимания.
Вместо использования фиксированного списка категорий объектов пользователи могут описать, что нужно сегментировать, с помощью текста, визуальных промптов или примерных изображений. Затем эти модели могут находить и сегментировать все области, соответствующие описанному концепту, даже если этот концепт явно не был представлен в обучающих данных.
В этой статье мы разберём, как работает сегментация концептов с поддержкой промптов, чем она отличается от традиционных подходов и где она уже используется.
Что такое сегментация концептов с поддержкой промптов?#
В большинстве случаев модели сегментации обучаются распознавать небольшой список типов объектов. Это хорошо работает, когда системе Vision AI нужно обнаруживать и сегментировать только определённый набор объектов.
Однако в реальных приложениях визуальные сцены динамичны. Появляются новые объекты, требования к задачам меняются, а пользователям часто нужно сегментировать концепты, не входившие в исходный набор меток. Для поддержки таких ситуаций обычно требуется собрать новые качественные данные и аннотации, а затем переобучить модель, что увеличивает затраты и замедляет развёртывание.
Сегментация концептов с поддержкой промптов решает эту проблему, позволяя пользователям указывать модели, что искать, вместо выбора из фиксированного списка меток. Пользователь описывает нужный объект или идею, а модель выделяет все соответствующие области на изображении. Это значительно упрощает сопоставление намерения пользователя с фактическими пикселями изображения.

Рис. 1. Пример использования промптов концептов для сегментации (источник)
Управление сегментацией с помощью разных типов промптов#
Модели, поддерживающие сегментацию концептов с помощью промптов, отличаются гибкостью, поскольку могут принимать разные типы входных данных. Иными словами, есть несколько способов указать модели, что искать: текстовые описания, визуальные подсказки или примерные изображения.
Рассмотрим каждый подход подробнее:
- Текстовые промпты: Короткие фразы, например «школьный автобус» или «область опухоли», можно использовать для описания концепта, который нужно сегментировать. Модель интерпретирует значение слов и находит соответствующие области.
- Визуальные промпты: В таких промптах используются точки, рамки или наброски внутри изображения в качестве подсказок. Эти указания помогают определить область поиска и сформировать итоговую границу.
- Примеры изображений: Эталонные изображения или небольшие фрагменты представляют интересующий концепт. Модель ищет визуально похожие области и сегментирует их на основе внешнего вида.
Различия между PCS и традиционной сегментацией#
Прежде чем разбирать принцип работы сегментации концептов с поддержкой промптов, сначала сравним её с различными традиционными методами сегментации объектов.
PCS позволяет создавать модели с открытым словарём, управляемые промптами. Они могут работать с новыми идеями, описанными в промптах, в отличие от традиционной сегментации. Существует несколько типов традиционных подходов к сегментации, каждый со своими предположениями и ограничениями.
Вот некоторые основные типы традиционной сегментации:
- Семантическая сегментация: Каждый пиксель изображения помечается как часть такой категории, как дорога, здание или человек. Все пиксели с одинаковой меткой объединяются, поэтому модель не разделяет отдельные экземпляры объектов.
- Сегментация экземпляров: Модель обнаруживает и сегментирует отдельные объекты, поэтому два человека или две машины считаются разными объектами.
- Паноптическая сегментация: Этот метод объединяет семантическую сегментацию и сегментацию экземпляров, чтобы дать полное представление о сцене, охватывая фоновые области и отдельные объекты.
Все эти подходы используют заранее определённый список категорий объектов. В его рамках они работают хорошо, но плохо обрабатывают концепты за пределами этого списка. Когда нужно сегментировать новый конкретный объект, обычно требуются дополнительные обучающие данные и дообучение модели.
PCS стремится изменить эту ситуацию. Вместо привязки к заранее определённым категориям она позволяет описать, что нужно сегментировать на изображении, непосредственно во время инференса.
Эволюция моделей PCS#
Теперь рассмотрим, как модели сегментации развивались в направлении сегментации концептов с поддержкой промптов.
Популярной базовой моделью, ознаменовавшей перелом в сегментации, стала SAM, то есть модель сегментации чего угодно. Она была представлена в 2023 году. Вместо использования заранее определённых категорий объектов SAM позволила пользователям управлять сегментацией с помощью простых визуальных промптов, таких как точки или ограничивающие рамки.
С SAM пользователям больше не нужно было выбирать метку. Они могли просто указать, где находится объект, и модель создавала для него маску. Это сделало сегментацию более гибкой, но пользователям всё ещё требовалось показать модели, где искать.
Выпущенная в 2024 году SAM 2 развила эту идею: она научилась обрабатывать более сложные сцены и распространила сегментацию с поддержкой промптов на видео. Модель стала устойчивее к различным условиям освещения, формам объектов и движению, продолжая при этом в основном полагаться на визуальные промпты для управления сегментацией.
Модель SAM 3 стала следующим этапом этой эволюции. Выпущенная в прошлом году, она представляет собой унифицированную модель, объединяющую визуальное понимание с языковыми указаниями и обеспечивающую согласованное поведение в задачах сегментации изображений и видео.
С SAM 3 пользователи больше не ограничены указанием точек или рисованием промптов. Вместо этого они могут описать текстом, что нужно сегментировать, а модель ищет на изображении или кадрах видео области, соответствующие этому описанию.
Сегментация управляется концептами, а не фиксированными категориями объектов, что обеспечивает работу с открытым словарём в разных сценах и с течением времени. Фактически SAM 3 работает в большом пространстве изученных концептов, основанном на онтологии, полученной из таких источников, как Wikidata, и расширенной с помощью крупномасштабных обучающих данных.

Рис. 2. Пример использования промпта SAM 3 и сегментации одного изображения (источник)
По сравнению с ранними версиями, которые в основном использовали геометрические промпты, SAM 3 представляет собой шаг к более гибкой сегментации, управляемой концептами. Благодаря этому модель лучше подходит для реальных приложений, где интересующие объекты или идеи могут меняться и не всегда могут быть заранее определены.
Как работает визуальная сегментация с поддержкой промптов#
Итак, как работает сегментация концептов с поддержкой промптов? Она основана на больших предварительно обученных моделях компьютерного зрения и моделях зрения и языка, обученных на огромных наборах изображений и во многих случаях связанных с текстом. Благодаря такому обучению они учатся распознавать общие визуальные закономерности и семантический смысл.
Большинство моделей PCS используют архитектуры на основе Transformer, которые обрабатывают всё изображение целиком, чтобы понять взаимосвязи между разными областями. Визуальный Transformer извлекает из изображения визуальные признаки, а текстовый кодировщик преобразует слова в числовые представления, с которыми может работать модель.
Во время обучения эти модели могут использовать разные типы супервизии, включая маски на уровне пикселей, задающие точные границы объектов, ограничивающие рамки, приблизительно указывающие положение объектов, и метки на уровне изображения, описывающие содержимое изображения. Обучение на разных типах размеченных данных помогает модели захватывать как мелкие детали, так и более общие визуальные концепты.
Во время инференса, то есть при фактическом использовании модели для получения предсказаний, PCS работает по принципу управления промптами. Пользователь предоставляет указания в виде текстовых описаний, визуальных подсказок, например точек или рамок, либо примерных изображений. Модель кодирует и промпт, и изображение в общее внутреннее представление, или эмбеддинги, и находит области, соответствующие описанному концепту.
Затем декодер маски преобразует это общее представление в точные маски сегментации на уровне пикселей. Поскольку модель связывает визуальные признаки с семантическим смыслом, она может сегментировать новые концепты, даже если они явно не были представлены во время обучения.
Кроме того, результат часто можно уточнить, изменив промпт или добавив дополнительные указания, что помогает модели обрабатывать сложные или неоднозначные сцены. Такой итеративный процесс поддерживает практическую оптимизацию во время развёртывания.
Модели сегментации концептов с поддержкой промптов обычно оценивают по тому, насколько хорошо они сегментируют ранее не встречавшиеся концепты и насколько устойчиво работают в разных сценах. В бенчмарках часто учитываются качество масок, способность к обобщению и вычислительная эффективность, что отражает требования к развёртыванию в реальных условиях.
Практические применения PCS#
Теперь рассмотрим, где сегментация концептов с поддержкой промптов уже используется и начинает оказывать реальное влияние.
Гибкая сегментация изображений в медицинской визуализации#
Медицинская визуализация охватывает множество биологических структур, заболеваний и типов сканирования, а новые случаи появляются каждый день. Традиционным моделям сегментации сложно справляться с таким разнообразием.
PCS естественно подходит для этой области, поскольку позволяет врачам описывать, что они хотят найти, вместо выбора из короткого жёстко заданного списка. С помощью текстовых фраз или визуальных промптов PCS можно использовать для непосредственной сегментации органов или проблемных областей без переобучения модели для каждой новой задачи. Это упрощает работу с разнообразными клиническими потребностями, снижает необходимость ручного рисования масок и позволяет работать с разными типами медицинских изображений.
Отличный пример — MedSAM-3, адаптирующая архитектуру SAM 3 для текстовой PCS в медицинской визуализации. Эту модель можно направлять явными анатомическими и патологическими терминами, например названиями органов — печени или почки — и концептами, связанными с поражениями, такими как опухоль или очаг поражения. Получив промпт, модель напрямую сегментирует соответствующую область на медицинском изображении.
MedSAM-3 также интегрирует мультимодальные большие языковые модели (MLLM или мультимодальные LLM), способные анализировать и текст, и изображения. Эти модели работают в режиме взаимодействия с агентом, при котором результаты итеративно уточняются для повышения точности в более сложных случаях.

Рис. 3. Конвейер MedSAM-3 для сегментации опухолей в медицинских изображениях по текстовому промпту (источник)
MedSAM-3 хорошо работает с данными рентгенографии, MRI, CT, ультразвуковых исследований и видео, демонстрируя, как PCS может обеспечивать более гибкие и эффективные процессы медицинской визуализации в реальной клинической практике.
Адаптивная сегментация для роботизированной хирургии и автоматизации#
Роботизированная хирургия использует системы компьютерного зрения для отслеживания инструментов и понимания быстро меняющихся хирургических сцен. Инструменты движутся быстро, освещение меняется, а новые инструменты могут появиться в любой момент, из-за чего поддерживать заранее заданные системы меток сложно.
С помощью PCS роботы могут отслеживать инструменты, управлять камерами и в реальном времени следовать этапам хирургической процедуры. Это сокращает объём ручной разметки и упрощает адаптацию систем к разным процедурам. Хирурги или автоматизированные системы могут использовать текстовые промпты, такие как «зажим», «скальпель» или «хирургическая камера», чтобы указать, что нужно сегментировать на изображении.

Рис. 4. Сегментация хирургических инструментов, используемых во время роботизированной хирургии (источник)
Сегментация с открытым словарём с помощью Ultralytics YOLOE-26#
Ещё одна интересная современная модель, связанная с сегментацией концептов с поддержкой промптов, — наша Ultralytics YOLOE-26. Наша модель переносит сегментацию с открытым словарём и управлением промптами в семейство моделей Ultralytics YOLO.
YOLOE-26 построена на архитектуре Ultralytics YOLO26 и поддерживает сегментацию экземпляров с открытым словарём. YOLOE-26 позволяет пользователям управлять сегментацией несколькими способами.
Модель поддерживает текстовые промпты, в которых короткие визуально обоснованные фразы задают целевой объект, а также визуальные промпты, предоставляющие дополнительные указания на основе признаков изображения. Кроме того, YOLOE-26 включает режим без промптов для инференса в режиме zero-shot: модель обнаруживает и сегментирует объекты из встроенного словаря без промптов от пользователя.
YOLOE-26 отлично подходит для таких приложений, как видеоаналитика, восприятие окружающей среды роботами и периферийные системы, где категории объектов могут меняться, но низкая задержка и стабильная пропускная способность остаются критически важными. Модель также особенно полезна для разметки данных и формирования датасетов, поскольку автоматизирует часть процесса аннотирования и упрощает рабочие процессы.
Преимущества и недостатки сегментации концептов с поддержкой промптов#
Вот некоторые основные преимущества использования сегментации концептов с поддержкой промптов:
- Более быстрая итерация и прототипирование: Новые задачи сегментации можно быстро проверять, изменяя промпты вместо пересоздания датасетов или переобучения моделей, что ускоряет эксперименты и разработку.
- Адаптивность в разных областях: Одну и ту же модель PCS часто можно применять в разных областях, таких как медицинская визуализация, робототехника или видеоаналитика, минимально меняя рабочий процесс.
- Интерактивное уточнение: Пользователи могут итеративно изменять промпты или добавлять указания для улучшения результатов, что упрощает обработку неоднозначных сцен или нестандартных случаев без переобучения.
Несмотря на очевидные преимущества PCS, следует учитывать следующие ограничения:
- Чувствительность к промптам: Небольшие изменения в формулировке или способе подачи промпта могут повлиять на результат. Слишком расплывчатые или слишком конкретные промпты могут привести к неполной или ошибочной сегментации.
- Менее предсказуемое поведение: Поскольку модель интерпретирует промпты, а не выбирает из фиксированного набора меток, результаты могут сильнее различаться в зависимости от сцен и входных данных, что может быть проблемой для строго контролируемых конвейеров.
- Неоднозначная интерпретация концептов: Некоторые концепты субъективны или определены неточно, что может приводить к несогласованным результатам сегментации у разных пользователей или на разных изображениях.
- Ограниченная надёжность для очень специфичных целей: Модели на основе промптов обычно менее надёжны в узких задачах, связанных с конкретными экземплярами, например при обнаружении дефектов, где требуется точное и стабильное выявление малозаметных признаков.
Выбор между сегментацией с поддержкой промптов и традиционной сегментацией#
Изучая сегментацию с поддержкой промптов, ты можешь задуматься, для каких приложений она подходит лучше всего и когда традиционная модель компьютерного зрения, такая как Ultralytics YOLO26, будет более подходящим решением для твоей задачи. Сегментация с поддержкой промптов хорошо работает с общими объектами, но не подходит для сценариев, требующих очень точных и стабильных результатов.
Обнаружение дефектов — хороший пример. В производстве дефекты часто бывают небольшими и малозаметными: например, мелкие царапины, вмятины, смещения или неровности поверхности. Кроме того, они могут сильно различаться в зависимости от материалов, освещения и условий производства.
Такие проблемы трудно описать простым промптом, а универсальной модели ещё сложнее надёжно их обнаружить. В целом модели на основе промптов часто пропускают дефекты или дают нестабильные результаты, тогда как модели, специально обученные на данных о дефектах, гораздо надёжнее работают в реальных системах контроля.
Основные выводы#
Сегментация концептов с поддержкой промптов упрощает адаптацию систем компьютерного зрения к реальному миру, где постоянно появляются новые объекты и идеи. Вместо привязки к фиксированным меткам пользователи могут просто описать, что нужно сегментировать, и предоставить модели сделать остальное, экономя время и сокращая объём ручной работы. Несмотря на ограничения, PCS уже меняет практическое применение сегментации и, вероятно, станет важной частью будущих систем компьютерного зрения.
Узнай больше об AI, посетив наш репозиторий GitHub и присоединившись к нашему сообществу. Посети страницы наших решений, чтобы узнать об AI в робототехнике и компьютерном зрении в производстве. Ознакомься с вариантами лицензирования, чтобы начать использовать Vision AI уже сегодня!









