Vision Language Model (VLM)
Изучи визуально-языковые модели (VLM) вместе с Ultralytics. Узнай, как они объединяют компьютерное зрение и большие языковые модели для визуальных вопросов и ответов и обнаружения объектов с открытым словарем с помощью Ultralytics YOLO26.
Модель «зрение — язык» (VLM) — это разновидность искусственного интеллекта, способная одновременно обрабатывать и интерпретировать визуальную информацию (изображения или видео) и текстовые данные. В отличие от традиционных моделей компьютерного зрения, которые работают только с пикселями, и больших языковых моделей (LLMs), понимающих только текст, VLM связывают эти две модальности. Обучаясь на огромных наборах данных с парами изображение — текст, такие модели учатся связывать визуальные признаки с языковыми понятиями, описывать изображения, отвечать на вопросы о визуальных сценах и даже выполнять команды, основываясь на том, что они «видят».
Принцип работы моделей «зрение — язык»#
Обычно VLM состоят из двух основных компонентов: визуального и текстового энкодеров. Визуальный энкодер обрабатывает изображения, извлекая карты признаков и визуальные представления, а текстовый энкодер обрабатывает языковые входные данные. Затем эти отдельные потоки данных объединяются с помощью таких механизмов, как перекрёстное внимание, чтобы согласовать визуальную и текстовую информацию в общем пространстве эмбеддингов.
В последних разработках 2024 и 2025 годов наметился переход к более унифицированным архитектурам, в которых обе модальности обрабатывает единая базовая сеть трансформера. Например, модели вроде Google PaliGemma 2 показывают, насколько эффективно объединение этих потоков повышает производительность при решении сложных задач рассуждения. Такое согласование позволяет модели понимать контекст: например, распознавать, что слово «apple» на изображении из продуктового магазина относится к фрукту, а на логотипе — к технологической компании.
Примеры применения в реальных условиях#
Способность понимать мир с помощью зрения и языка открывает широкий спектр применений в различных отраслях:
- Ответы на вопросы по изображениям (VQA): VLM широко применяются в медицинской диагностике, помогая врачам-рентгенологам. Врач может спросить систему: «Есть ли на этом рентгеновском снимке перелом?», после чего модель проанализирует медицинское изображение и даст предварительную оценку, снижая количество диагностических ошибок.
- Умный поиск в электронной коммерции: В розничной торговле VLM позволяют искать товары с помощью описаний на естественном языке в сочетании с изображениями. Покупатель может загрузить фотографию наряда знаменитости и попросить: «Найди мне платье с таким же узором, но синего цвета», а система использует семантический поиск, чтобы найти подходящие варианты.
- Автоматическое создание подписей и обеспечение доступности: VLM автоматически создают описательный альтернативный текст для изображений в интернете, повышая доступность цифрового контента для людей с нарушениями зрения, которые пользуются программами экранного доступа.
Отличия VLM от родственных концепций#
Чтобы понять особую роль VLM, полезно отличать их от других категорий ИИ:
- VLM и LLM: Большая языковая модель, например текстовая версия GPT-4, обрабатывает только текстовые данные. Она может создавать интересные рассказы или код, но не может «видеть» изображение. VLM фактически наделяет LLM зрением.
- VLM и обнаружение объектов: Традиционные модели обнаружения объектов, например ранние версии YOLO, определяют, где находятся объекты и к какому классу они относятся (например, «Автомобиль: 99 %»). VLM идут дальше, понимая отношения и атрибуты, например: «красный спортивный автомобиль припаркован рядом с пожарным гидрантом».
- VLM и мультимодальный ИИ: Мультимодальный ИИ — более широкое понятие. Все VLM мультимодальны, поскольку объединяют зрение и язык, но не все мультимодальные модели являются VLM: некоторые объединяют аудио и текст, например для преобразования речи в текст, или видео и данные датчиков без языкового компонента.
Обнаружение объектов с открытым словарём с помощью YOLO#
Современные VLM поддерживают обнаружение объектов с «открытым словарём»: объекты можно распознавать по произвольным текстовым запросам, а не только по заранее заданным классам. Это ключевая возможность таких моделей, как Ultralytics YOLO-World, которая позволяет динамически задавать классы без повторного обучения.
В следующем примере показано, как использовать пакет ultralytics, чтобы обнаруживать объекты, описанные текстом:
from ultralytics import YOLOWorld
# Загружаем модель, способную понимать связь между изображением и языком
model = YOLOWorld("yolov8s-world.pt")
# Задаём пользовательские классы с помощью текстовых запросов на естественном языке
model.set_classes(["person wearing sunglasses", "red backpack"])
# Запускаем инференс, чтобы найти на изображении объекты, определённые текстом
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Покажи результаты обнаружения
results[0].show()Проблемы и направления дальнейших исследований#
Несмотря на свои возможности, модели «зрение — язык» сталкиваются с серьёзными проблемами. Одна из основных — галлюцинации: модель уверенно описывает объекты или текст на изображении, которых там на самом деле нет. Исследователи активно работают над такими методами, как обучение с подкреплением на основе обратной связи от людей (RLHF), чтобы улучшить привязку к исходным данным и точность.
Ещё одна проблема — вычислительные затраты. Для обучения этих огромных моделей требуются значительные ресурсы GPU. Однако появление эффективных архитектур, таких как Ultralytics YOLO26, помогает перенести передовые возможности компьютерного зрения на периферийные устройства. В будущем VLM будут играть важную роль в роботизированных агентах, позволяя роботам ориентироваться в пространстве и манипулировать объектами, выполняя сложные словесные инструкции.
Тем, кто интересуется теоретическими основами, оригинальная статья OpenAI о CLIP даст отличное представление о контрастивном предварительном обучении на парах языка и изображений. Кроме того, чтобы следить за быстрым развитием этих архитектур, важно изучать статьи с конференции CVPR. Если ты хочешь попробовать обучить собственные модели компьютерного зрения, воспользуйся платформой Ultralytics, чтобы упростить управление наборами данных и развертывание моделей.









