YOLO Vision 2026:
Назад к глоссарию Ultralytics

Vision Language Model (VLM)

Исследуй мультимодальные модели (VLM) с Ultralytics. Узнай, как они связывают компьютерное зрение и LLM для ответов на визуальные вопросы (VQA) и детекции с открытым словарем с помощью Ultralytics YOLO26.

Модель "Vision Language Model" (VLM) — это тип искусственного интеллекта, который может одновременно обрабатывать и интерпретировать как визуальную информацию (изображения или видео), так и текстовую информацию. В отличие от традиционных моделей computer vision, которые фокусируются исключительно на данных пикселей, или Large Language Models (LLMs), понимающих только текст, VLM стирают грань между этими двумя модальностями. Обучаясь на массивных датасетах, содержащих пары изображений и текста, эти модели учатся связывать визуальные признаки с лингвистическими концептами, что позволяет им описывать изображения, отвечать на вопросы о визуальных сценах и даже выполнять команды на основе того, что они «видят».

Как работают модели зрения и языка#

По своей сути VLM обычно состоят из двух основных компонентов: визуального энкодера и текстового энкодера. Визуальный энкодер обрабатывает изображения для извлечения feature maps и визуальных представлений, в то время как текстовый энкодер обрабатывает лингвистический ввод. Эти различные потоки данных затем объединяются с использованием таких механизмов, как cross-attention, чтобы сопоставить визуальную и текстовую информацию в общем пространстве эмбеддингов.

Недавние достижения 2024 и 2025 годов привели к созданию более унифицированных архитектур, в которых единый трансформер обрабатывает обе модальности. Например, такие модели, как Google PaliGemma 2, демонстрируют, насколько эффективная интеграция этих потоков может повысить производительность в сложных задачах рассуждения. Это сопоставление позволяет модели понимать контекст, например, распознавать, что слово «apple» относится к фрукту на изображении в продуктовом магазине, но к технологической компании в логотипе.

Реальные приложения#

Способность понимать мир через зрение и язык открывает разнообразные возможности применения в различных отраслях:

  • Визуальные ответы на вопросы (VQA): VLM активно используются в healthcare diagnostics для помощи рентгенологам. Врач может спросить систему: «Есть ли перелом на этом рентгеновском снимке?», и модель анализирует медицинское изображение для предоставления предварительной оценки, снижая количество диагностических ошибок.
  • Умный поиск в электронной коммерции: В retail environments VLM позволяют пользователям искать продукты с помощью текстовых описаний на естественном языке в сочетании с изображениями. Покупатель может загрузить фото наряда знаменитости и спросить: «Найди мне платье с таким же узором, но синее», и система использует semantic search для получения точных совпадений.
  • Автоматическое создание подписей и доступность: VLM автоматически генерируют описательный alt text для изображений в Интернете, делая цифровой контент более доступным для слабовидящих пользователей, использующих программы чтения с экрана.

Отличие VLM от связанных концепций#

Полезно отличать VLM от других категорий ИИ, чтобы понять их специфическую роль:

  • VLM против LLM: Large Language Model (например, текстовые версии GPT-4) обрабатывает только текстовые данные. Хотя она может генерировать творческие истории или код, она не может «видеть» изображение. VLM фактически дает глаза LLM.
  • VLM против обнаружения объектов: Традиционные модели object detection, такие как ранние версии YOLO, определяют, где находятся объекты и к какому классу они принадлежат (например, «Car: 99%»). VLM идет дальше, понимая взаимосвязи и атрибуты, такие как «красный спортивный автомобиль, припаркованный рядом с пожарным гидрантом».
  • VLM против мультимодального ИИ: Multimodal AI — это более широкое зонтичное понятие. Хотя все VLM являются мультимодальными (комбинируют зрение и язык), не все мультимодальные модели являются VLM; некоторые могут объединять аудио и текст (например, преобразование речи в текст) или видео и данные датчиков без языкового компонента.

Детектирование с открытым словарем (Open-Vocabulary Detection) с YOLO#

Современные VLM обеспечивают обнаружение с «открытым словарным запасом», когда ты можешь находить объекты с помощью текстовых подсказок в свободной форме, а не предопределенных классов. Это ключевая функция таких моделей, как Ultralytics YOLO-World, которая позволяет задавать динамические классы без переобучения.

Следующий пример демонстрирует, как использовать пакет ultralytics для обнаружения конкретных объектов, описанных текстом:

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Проблемы и будущие направления#

Обладая большой мощностью, модели Vision Language Model сталкиваются с серьезными трудностями. Одной из основных проблем является hallucination, когда модель уверенно описывает объекты или текст на изображении, которых на самом деле там нет. Исследователи активно работают над такими методами, как Reinforcement Learning from Human Feedback (RLHF), чтобы улучшить привязку к данным и точность.

Еще одной проблемой являются вычислительные затраты. Обучение этих массивных моделей требует значительных GPU resources. Тем не менее, выпуск эффективных архитектур, таких как Ultralytics YOLO26, помогает внедрять передовые возможности компьютерного зрения на периферийные устройства. Продвигаясь вперед, мы ожидаем, что VLM будут играть ключевую роль в robotic agents, позволяя роботам перемещаться и манипулировать объектами на основе сложных словесных инструкций.

Для тех, кто интересуется теоретическими основами, оригинальная CLIP paper by OpenAI дает отличный взгляд на контрастивное языково-визуальное преобучение. Кроме того, следить за CVPR conference papers крайне важно для отслеживания стремительной эволюции этих архитектур. Чтобы поэкспериментировать с обучением собственных моделей компьютерного зрения, ты можешь использовать Ultralytics Platform для упрощенного управления датасетами и развертывания моделей.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения