Что такое YOLOE? Развиваем модели компьютерного зрения
Узнай, как YOLOE позволяет находить объекты с помощью простого запроса или фото. Это делает компьютерное зрение умнее и быстрее без необходимости дообучения или настройки моделей.

Обнаружение объектов — это ключевая задача компьютерного зрения, цель которой заключается в идентификации и определении местоположения объектов на изображениях или видео. Это важнейшая часть компьютерного зрения, области искусственного интеллекта (ИИ), которая позволяет машинам понимать визуальные данные и интерпретировать их. Например, обнаружение объектов помогает распознать автомобиль на фотографии или заметить человека на видеопотоке.
Одной из самых известных серий моделей, поддерживающих задачи компьютерного зрения, такие как обнаружение объектов, является серия моделей YOLO (You Only Look Once). Созданные для скорости и точности, модели YOLO постоянно совершенствуются со временем. Например, одна из новейших версий, Ultralytics YOLO11, отлично проявляет себя в реальных условиях, обеспечивая точные результаты даже в более сложных средах.
Развивая этот прогресс, новая модель под названием YOLOE призвана расширить возможности моделей YOLO. В отличие от традиционных моделей, требующих дообучения для распознавания новых объектов, YOLOE может следовать простым текстовым или визуальным подсказкам (промптам) для детекции объектов, которые она раньше не видела, что делает ее намного более адаптивной к меняющейся среде.
В этой статье мы поближе познакомимся с тем, что делает YOLOE уникальным, сравним его с предыдущими моделями YOLO и узнаем, как ты можешь начать использовать его уже сегодня. Давай начнем!
Обзор YOLOE#
YOLOE — это модель компьютерного зрения, которая делает шаг вперед в детекции объектов. Она была представлена в марте 2025 года исследователями из Университета Цинхуа. Что отличает YOLOE от традиционных моделей, так это использование детекции с открытым словарем (open-vocabulary detection).
Хотя большинство моделей обучены распознавать фиксированный список объектов, YOLOE позволяет тебе указать, что искать, используя короткое описание или пример изображения. Например, если ты ищешь «зеленый рюкзак», ты можешь либо ввести это описание, либо показать модели фотографию, и YOLOE найдет его на сцене.
Кроме того, даже без каких-либо подсказок YOLOE может самостоятельно обнаруживать множество повседневных объектов. Эта способность распознавать объекты, которые он никогда раньше не видел, называется обнаружением с нулевым обучением (zero-shot). Это особенно полезно в динамичных условиях, где задача или интересующие объекты могут неожиданно меняться.

Рис. 1. Обзор возможностей YOLOE.
Ключевые особенности YOLOE#
YOLOE поддерживает широкий спектр функций, призванных улучшить его производительность в реальных приложениях. Благодаря возможности работать как со структурированными, так и с неструктурированными входными данными, YOLOE открывает новые возможности для обнаружения и сегментации объектов.
Вот некоторые из ключевых функций, которые предлагает модель:
- Детекция на основе подсказок: YOLOE может искать объекты на основе короткой текстовой подсказки или примера изображения. Это означает, что тебе не нужно переобучать модель каждый раз, когда меняется задача; просто опиши или покажи модели то, что ты ищешь.
- Сегментация экземпляров: помимо рисования ограничивающих рамок (BBox) вокруг объектов, YOLOE может обводить их точную форму с помощью сегментации экземпляров. Это особенно полезно, когда объекты перекрывают друг друга или когда тебе нужно узнать точные границы объекта.
- Распознавание объектов без подсказок: YOLOE может распознавать объекты даже без конкретных инструкций. Она использует набор заранее изученных описаний для быстрой идентификации объектов, что делает процесс быстрее и эффективнее.
Сравнение YOLOE с другими моделями YOLO#
Теперь, когда у тебя есть лучшее понимание того, что такое YOLOE, давай взглянем на некоторые похожие модели из семейства YOLO.
По мере развития компьютерного зрения развивались и модели YOLO. Например, Ultralytics YOLOv8 принесла поддержку новых задач, таких как сегментация и классификация, в то время как более поздние версии, такие как Ultralytics YOLO11, были сосредоточены на повышении точности и производительности для более широкого круга задач.
Кроме того, в январе 2024 года был выпущен YOLO-World, который добавил возможность использовать текстовые подсказки, позволяя пользователям описывать объекты, которые они хотят найти. Хотя YOLO-World был отличным вариантом для обнаружения с нулевым обучением (zero-shot), в нем не хватало таких функций, как сегментация экземпляров и поддержка визуальных подсказок.
YOLOE развивает идеи YOLO-World, добавляя эти возможности, улучшая гибкость и производительность, а также предлагая более эффективный инструмент для прикладных задач компьютерного зрения.

Рис. 2. YOLO-World и YOLOE поддерживают обнаружение с нулевым обучением (zero-shot).
Использование YOLOE с пакетом Ultralytics для Python#
Независимо от того, хочешь ли ты обнаружить конкретные объекты или изучить всё на изображении, начать работу с YOLOE просто. Эта модель поддерживается пакетом Ultralytics для Python, что упрощает ее интеграцию в твои проекты. Давай разберемся, как ее использовать.
Установка пакета Ultralytics#
Первый шаг — установить пакет Ultralytics Python с помощью менеджера пакетов вроде pip. Ты можешь сделать это, выполнив команду “pip install ultralytics” в своем терминале или командной строке.
После установки пакета у тебя будет все необходимое для загрузки модели, создания предсказаний и экспериментов с различными режимами обнаружения. Если во время установки возникнут какие-либо проблемы, в официальной документации Ultralytics есть полезный раздел по устранению неполадок.
Существует несколько способов использования YOLOE для запуска предсказаний. Запуск предсказаний означает использование обученной модели для идентификации и локализации объектов на изображениях или видео. Эти различные методы позволяют настроить взаимодействие с моделью в зависимости от твоих конкретных потребностей.
Давай разберем каждый из этих методов по очереди.
Детекция конкретных объектов с помощью текстовых или визуальных подсказок#
YOLOE может обнаруживать объекты на основе короткого текстового описания. Например, если ты ищешь лошадь в движении, ты можешь использовать подсказку вроде "horse walking".
Для начала загрузи предобученную модель YOLOE и задай свою подсказку (описание того, что модель должна искать), как показано в фрагменте кода ниже.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))Как только модель и подсказка заданы, ты можешь запустить модель на изображении или видео. Замени путь к файлу в коде на путь к своему изображению или видеофайлу:
results = model.predict("path/to/your/image.jpg")
results[0].show()Это отобразит изображение с четко отмеченным обнаруженным объектом на основе твоей подсказки. Ты можешь менять подсказку для поиска других объектов, таких как "red suitcase", "bicycle" или "zebra", в зависимости от того, что ты ищешь.

Рис. 3. Пример использования YOLOE для поиска конкретных объектов с помощью текстовой подсказки.
Аналогично, ты можешь использовать изображение, чтобы дать подсказку YOLOE с помощью пакета Ultralytics для Python. В режиме визуальных подсказок модель использует изображение для поиска похожих предметов на другой сцене. Это особенно полезно для объектов, которые трудно описать или которые не имеют четких меток.
Чтобы подробнее изучить код для этого, ты можешь заглянуть в документацию Ultralytics.
Общая детекция объектов с помощью YOLOE#
В некоторых случаях ты можешь не знать точно, что искать, или можешь не искать какой-то конкретный объект. В этом случае пригодится режим без подсказок.
С этой опцией тебе не нужно вводить описание или предоставлять пример изображения. YOLOE просто анализирует изображения самостоятельно и обнаруживает все, что может распознать, например людей, животных, мебель или повседневные предметы.
Это полезный способ изучить сцену, не давая модели никаких специфических инструкций. Независимо от того, сканируешь ли ты многолюдную комнату или просматриваешь записи с большим количеством активности, режим без подсказок дает тебе быстрый обзор того, что присутствует на изображении.
Ты можешь использовать следующий код для запуска YOLOE в режиме без подсказок. Сначала модель загружается, затем она обрабатывает изображение и автоматически обнаруживает объекты на нем. В конце результаты отображаются, а найденные объекты подсвечиваются.
Не забудь заменить путь к файлу на реальный путь к твоему изображению.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()Изображение ниже — это пример того, что YOLOE может обнаружить в режиме без подсказок.

Рис. 4. Использование YOLOE в режиме без подсказок.
Применение YOLOE в реальном времени#
Способность YOLOE реагировать как на текстовые, так и на визуальные подсказки делает ее надежным инструментом для приложений реального времени. Ее гибкость особенно полезна в динамичных условиях, где время и точность имеют решающее значение.
Давай рассмотрим несколько реальных примеров того, как можно использовать YOLOE.
Улучшение обработки багажа: детекция багажа в реальном времени#
В людных аэропортах поиск конкретного багажа может быть сложной задачей, особенно когда речь идет о пропавших сумках. YOLOE может упростить этот процесс, помогая сканировать видео в реальном времени и быстро идентифицировать предметы на основе простых подсказок, таких как «красная сумка».
Если сумка пропала или была перемещена, персонал может легко изменить подсказку для поиска другого предмета, например "black suitcase". Эта способность мгновенно адаптироваться может помочь сотрудникам аэропорта быстро находить нужный багаж без просмотра длинных часов записи или переобучения модели, делая обработку багажа и решение проблем с пропавшими вещами намного быстрее и эффективнее.
Мониторинг общественных мест с помощью YOLOE#
Записи камер наблюдения в общественных местах, таких как людные рынки и кафе, часто содержат множество людей, объектов и событий, которые меняются в течение дня. YOLOE может анализировать эти записи в реальном времени в режиме без подсказок, автоматически обнаруживая такие предметы, как сумки, столы или велосипеды, без необходимости в специальных инструкциях.

Рис. 5. YOLOE может обнаруживать различные объекты в людном общественном месте.
Это особенно полезно для служб безопасности, чтобы замечать оставленные без присмотра предметы или отслеживать движение толпы. Способность YOLOE обнаруживать несколько объектов одновременно облегчает управление общественными пространствами во время мероприятий или периодов высокой загруженности, помогая командам оставаться в курсе событий и оперативно реагировать.
Плюсы и минусы YOLOE#
Вот некоторые ключевые преимущества использования YOLOE для задач компьютерного зрения:
- Производительность в реальном времени: YOLOE оптимизирована для быстрой и эффективной обработки, что позволяет выполнять детекцию в реальном времени даже в динамичных условиях, таких как прямые видеотрансляции или людные общественные пространства.
- Масштабируемость: YOLOE масштабируем и отлично подходит для самых разных приложений: от безопасности и видеонаблюдения до ритейла, здравоохранения и автономных транспортных средств.
- Простота использования: Поскольку YOLOE поддерживается пакетом Ultralytics для Python, ее легко интегрировать в существующие проекты по компьютерному зрению.
Тем не менее, при использовании YOLOE следует учитывать несколько ограничений. Вот пара факторов, которые стоит принять во внимание:
- Требуются достаточные данные для обучения: Хотя YOLOE поддерживает zero-shot детекцию, ее эффективность на объектах, которые она не видела ранее, зависит от того, насколько хорошо она обобщает данные из обучающей выборки. В некоторых случаях могут потребоваться дополнительные данные или дообучение (fine-tuning) для качественной работы в узкоспециализированных задачах.
- Чувствительность к качеству входных данных: На точность модели могут повлиять изображения или видео низкого качества. Размытый или плохо освещенный входной сигнал может снизить способность модели точно обнаруживать объекты, поэтому высококачественные данные важны для оптимальной работы.
Основные выводы#
YOLOE привносит больше гибкости в компьютерное зрение, позволяя направлять детекцию с помощью текстовых или визуальных подсказок. Она хорошо работает в реальных условиях, где сцены быстро меняются, а переобучение невозможно.
От обработки багажа до мониторинга общественных мест — YOLOE легко адаптируется к новым задачам. Поскольку ИИ становится все более доступным, такие модели, как YOLOE, помогают большему количеству отраслей использовать технологии зрения практичными и эффективными способами.
Присоединяйся к нашему сообществу и изучай наш репозиторий на GitHub, чтобы узнать больше об инновациях в области ИИ. Открывай для себя последние достижения в таких областях, как ИИ в ритейле и компьютерное зрение в здравоохранении, на страницах наших решений. Ознакомься с нашими вариантами лицензирования и начни работу с компьютерным зрением уже сегодня!






