Что такое YOLOE? Расширяем возможности моделей компьютерного зрения
Узнай, как YOLOE позволяет находить объекты с помощью простого текстового запроса или фотографии. Он обеспечивает более интеллектуальное и быстрое компьютерное зрение без повторного обучения или тонкой настройки моделей.

Обнаружение объектов — это ключевая задача компьютерного зрения, цель которой — идентифицировать объекты на изображениях или видео и определить их местоположение. Это важная часть компьютерного зрения — области искусственного интеллекта (AI), которая позволяет машинам понимать и интерпретировать визуальные данные. Например, обнаружение объектов может помочь найти автомобиль на фотографии или заметить человека в видеопотоке.
Одна из самых известных серий моделей для поддержки задач компьютерного зрения, таких как обнаружение объектов, — это серия моделей YOLO («Смотришь только один раз»). Модели YOLO разработаны с учётом скорости и точности и постоянно совершенствовались со временем. Например, одна из последних версий, Ultralytics YOLO11, хорошо работает в реальных условиях и обеспечивает точные результаты даже в более сложной среде.
Развивая этот прогресс, новая модель под названием YOLOE стремится расширить возможности моделей YOLO. В отличие от традиционных моделей, которым для распознавания новых объектов требуется повторное обучение, YOLOE может использовать простые текстовые или графические подсказки для обнаружения объектов, которых она раньше не видела, что делает её гораздо более адаптивной к меняющимся условиям.
В этой статье мы подробнее рассмотрим, что делает YOLOE уникальной, чем она отличается от предыдущих моделей YOLO и как ты можешь начать использовать её уже сегодня. Давай начнём!
Обзор YOLOE#
YOLOE — это модель компьютерного зрения, которая выводит обнаружение объектов на новый уровень. Она была представлена в марте 2025 года исследователями из Университета Цинхуа. YOLOE отличается от традиционных моделей использованием обнаружения объектов с открытым словарём.
Большинство моделей обучаются распознавать фиксированный список объектов, а YOLOE позволяет указать, что нужно найти, с помощью краткого описания или примерного изображения. Например, если ты ищешь «зелёный рюкзак», можно либо ввести это описание, либо показать модели фотографию, и YOLOE найдёт его в сцене.
Кроме того, даже без подсказки YOLOE может самостоятельно обнаруживать множество повседневных объектов. Эта способность распознавать объекты, которых модель никогда раньше не видела, называется обнаружением без примеров. Она особенно полезна в динамичных условиях, где задача или интересующие объекты могут неожиданно измениться.

Рис. 1. Обзор возможностей YOLOE.
Ключевые возможности YOLOE#
YOLOE поддерживает широкий набор функций, предназначенных для повышения производительности в реальных приложениях. Благодаря способности работать как со структурированными, так и с неструктурированными входными данными YOLOE открывает новые возможности для обнаружения объектов и сегментации.
Вот некоторые ключевые возможности модели:
- Обнаружение по подсказке: YOLOE может искать объекты по краткой текстовой подсказке или примерному изображению. Это значит, что тебе не нужно переобучать модель при каждом изменении задачи: просто опиши или покажи модели, что именно ты ищешь.
- Сегментация экземпляров: помимо построения ограничивающих рамок вокруг объектов, YOLOE может обводить их точную форму с помощью сегментации экземпляров. Это особенно полезно, когда объекты перекрываются или нужно определить точные границы объекта.
- Распознавание объектов без подсказки: YOLOE может распознавать объекты даже без конкретных инструкций. Она использует набор заранее изученных описаний, чтобы быстро идентифицировать объекты, делая процесс быстрее и эффективнее.
Сравнение YOLOE с другими моделями YOLO#
Теперь, когда мы лучше понимаем, что такое YOLOE, давай рассмотрим похожие модели из семейства YOLO.
По мере развития компьютерного зрения развивались и модели YOLO. Например, Ultralytics YOLOv8 добавила поддержку новых задач, таких как сегментация и классификация, а более поздние версии, например Ultralytics YOLO11, сосредоточились на повышении точности и производительности для более широкого спектра задач.
Кроме того, YOLO-World, выпущенная в январе 2024 года, представила возможность использовать текстовые подсказки, позволяя пользователям описывать объекты, которые они хотят найти. Хотя YOLO-World была отличным вариантом для обнаружения без примеров, ей не хватало таких функций, как сегментация экземпляров и поддержка визуальных подсказок.
YOLOE развивает YOLO-World, добавляя эти возможности, повышая гибкость и производительность и предлагая более эффективный инструмент для реальных приложений компьютерного зрения.

Рис. 2. YOLO-World и YOLOE поддерживают обнаружение без примеров.
Использование YOLOE с пакетом Ultralytics для Python#
Если ты хочешь обнаруживать конкретные объекты или исследовать всё изображение, начать работу с YOLOE очень просто. Эта модель поддерживается пакетом Ultralytics для Python, поэтому её легко интегрировать в свои проекты. Далее рассмотрим, как её использовать.
Установка пакета Ultralytics#
Первый шаг — установить пакет Ultralytics для Python с помощью менеджера пакетов, например «pip». Для этого выполни команду «pip install ultralytics» в терминале или командной строке.
После установки пакета у тебя будет всё необходимое для загрузки модели, выполнения предсказаний и экспериментов с разными режимами обнаружения. Если во время установки возникнут проблемы, в официальной документации Ultralytics есть полезный раздел устранения неполадок.
Есть несколько способов использовать YOLOE для выполнения предсказаний. Выполнение предсказаний означает использование обученной модели для идентификации объектов на изображениях или видео и определения их местоположения. Эти разные методы позволяют настроить взаимодействие с моделью в соответствии с конкретными потребностями.
Давай рассмотрим каждый из этих методов по очереди.
Обнаружение конкретных объектов с помощью текстовых или графических подсказок#
YOLOE может обнаруживать объекты по краткому текстовому описанию. Например, если ты ищешь движущуюся лошадь, можно использовать подсказку «лошадь идёт».
Для начала загрузи предварительно обученную модель YOLOE и задай подсказку — описание того, что модель должна искать, — как показано в приведённом ниже фрагменте кода.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))После настройки модели и подсказки можно запустить модель на изображении или видео. Замени путь к файлу в коде на путь к своему файлу изображения или видео:
results = model.predict("path/to/your/image.jpg")
results[0].show()На изображении будет показан обнаруженный объект, чётко отмеченный в соответствии с твоей подсказкой. Ты можешь изменить подсказку для поиска других объектов, например «красный чемодан», «велосипед» или «зебра», в зависимости от того, что ты ищешь.

Рис. 3. Пример использования YOLOE для обнаружения конкретных объектов с помощью текстовой подсказки.
Аналогично, ты можешь использовать изображение в качестве подсказки для YOLOE с пакетом Ultralytics для Python. В режиме визуальной подсказки модель использует изображение, чтобы найти похожие объекты в другой сцене. Это особенно полезно для объектов, которые трудно описать или у которых нет понятных меток.
Чтобы подробнее изучить код, обратись к документации Ultralytics.
Общее обнаружение объектов с помощью YOLOE#
Иногда ты можешь не знать точно, что искать, или вообще не искать какой-то конкретный объект. В таких случаях пригодится режим без подсказки.
В этом режиме не нужно вводить описание или предоставлять пример изображения. YOLOE самостоятельно анализирует изображения и обнаруживает всё, что может распознать: людей, животных, мебель и повседневные предметы.
Это удобный способ исследовать сцену, не задавая модели конкретных инструкций. Сканируешь ли ты переполненное помещение или просматриваешь запись с большим количеством происходящих событий, режим без подсказки быстро показывает, что присутствует на изображении.
Для запуска YOLOE в режиме без подсказки можно использовать следующий код. Сначала загружается модель, затем она обрабатывает изображение и автоматически обнаруживает находящиеся на нём объекты. Наконец, результаты отображаются, а обнаруженные объекты выделяются.
Обязательно замени путь к файлу на фактический путь к своему изображению.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()Изображение ниже показывает пример того, что YOLOE может обнаружить в режиме без подсказки.

Рис. 4. Использование YOLOE в режиме без подсказки.
Применение YOLOE в реальном времени#
Способность YOLOE реагировать как на текстовые, так и на графические подсказки делает её надёжным инструментом для приложений реального времени. Её гибкость особенно полезна в быстро меняющихся условиях, где важны скорость и точность.
Давай рассмотрим несколько примеров использования YOLOE в реальных условиях.
Оптимизация обработки багажа: обнаружение багажа в реальном времени#
В загруженных аэропортах бывает сложно найти конкретный багаж, особенно при работе с пропавшими сумками. YOLOE может упростить этот процесс, помогая сканировать видео в реальном времени и быстро находить предметы по простым подсказкам, например «красная сумка».
Если сумка пропала или оказалась не на месте, сотрудники могут легко изменить подсказку и найти другой предмет, например «чёрный чемодан». Эта способность мгновенно адаптироваться помогает сотрудникам аэропорта быстро находить нужный багаж без просмотра многочасовых записей или переобучения модели, делая обработку багажа и решение проблем с пропавшими вещами гораздо быстрее и эффективнее.
Мониторинг общественных пространств с помощью YOLOE#
Записи с камер наблюдения в общественных местах, таких как переполненные рынки и кафе, часто содержат множество людей, объектов и меняющихся в течение дня действий. YOLOE может анализировать такие записи в реальном времени в режиме без подсказки, автоматически обнаруживая сумки, столы или велосипеды без конкретных инструкций.

Рис. 5. YOLOE может обнаруживать различные объекты в оживлённом общественном месте.
Это особенно полезно для служб безопасности, которым нужно замечать оставленные без присмотра предметы или отслеживать перемещение толпы. Способность YOLOE одновременно обнаруживать несколько объектов упрощает управление общественными пространствами во время мероприятий или в периоды высокой загруженности, помогая командам сохранять осведомлённость и оперативно реагировать.
Преимущества и недостатки YOLOE#
Вот некоторые ключевые преимущества использования YOLOE в приложениях компьютерного зрения:
- Производительность в реальном времени: YOLOE оптимизирована для быстрой и эффективной обработки, обеспечивая обнаружение в реальном времени даже в динамичных условиях, например в прямых видеопотоках или оживлённых общественных местах.
- Масштабируемость: YOLOE хорошо масштабируется и подходит для самых разных приложений — от безопасности и видеонаблюдения до розничной торговли, здравоохранения и автономных транспортных средств.
- Простота использования: поскольку YOLOE поддерживается пакетом Ultralytics для Python, её легко интегрировать в существующие проекты компьютерного зрения.
Однако при использовании YOLOE нужно учитывать некоторые ограничения. Вот несколько факторов, которые стоит принять во внимание:
- Требует достаточного объёма обучающих данных: хотя YOLOE поддерживает обнаружение без примеров, её производительность на ранее не встречавшихся объектах зависит от того, насколько хорошо она обобщает данные, использованные для обучения. В некоторых случаях для эффективной работы в узкоспециализированных задачах могут потребоваться дополнительные данные или дообучение.
- Чувствительность к качеству входных данных: на точность модели могут влиять изображения или видео низкого качества. Размытые или плохо освещённые входные данные могут снизить способность модели точно обнаруживать объекты, поэтому для оптимальной производительности важно использовать качественные входные данные.
Основные выводы#
YOLOE делает компьютерное зрение более гибким, позволяя пользователям управлять обнаружением с помощью текстовых или графических подсказок. Она хорошо работает в реальных условиях, где сцены быстро меняются, а повторное обучение невозможно.
От обработки багажа до мониторинга общественных пространств YOLOE легко адаптируется к новым задачам. По мере того как AI становится доступнее, такие модели, как YOLOE, помогают большему числу отраслей использовать технологии компьютерного зрения на практике и эффективно.
Присоединяйся к нашему сообществу и изучай наш репозиторий на GitHub, чтобы узнать больше о разработках в области AI. Познакомься с последними достижениями в таких сферах, как AI в розничной торговле и компьютерное зрение в здравоохранении, на наших страницах решений. Ознакомься с вариантами лицензирования и начни использовать компьютерное зрение уже сегодня!









