Multimodal RAG
Изучи мультимодальный RAG для обработки текста, изображений и видео. Узнай, как Ultralytics YOLO26 улучшает конвейеры поиска ИИ для более точных и контекстно-зависимых ответов.
Мультимодальная генерация с дополненным поиском (Multimodal RAG) — это передовой фреймворк искусственного интеллекта (ИИ), который расширяет традиционные системы RAG для обработки и анализа разнообразных типов данных, таких как текст, изображения, видео и аудио. В то время как стандартная генерация с дополненным поиском (RAG) повышает точность большой языковой модели (LLM) путем поиска релевантных текстовых документов, Multimodal RAG позволяет моделям «видеть» и «слышать», извлекая контекст из базы знаний со смешанными медиаданными. Этот подход обосновывает генерацию модели конкретными визуальными или звуковыми доказательствами, значительно сокращая галлюцинации в LLM и делая возможными такие сложные задачи, как визуальный ответ на вопросы по частным наборам данных. Задействуя модальное обучение, эти системы могут синтезировать информацию из запроса пользователя (например, текста) и извлеченных активов (например, диаграммы или кадра видеонаблюдения) для получения исчерпывающих ответов с учетом контекста.
Как работает Multimodal RAG#
Архитектура системы Multimodal RAG обычно повторяет стандартный конвейер «Поиск-затем-Генерация», но адаптирует его для нетекстовых данных. Этот процесс в значительной степени опирается на векторные базы данных и общие семантические пространства.
-
Индексация: Данные из различных источников — PDF-файлов, видео, презентаций — обрабатываются. Модели извлечения признаков преобразуют эти различные модальности в многомерные числовые векторы, известные как эмбеддинги. Например, такая модель, как CLIP от OpenAI, выравнивает эмбеддинги изображений и текста так, чтобы фотография собаки и слово «собака» были математически близки друг к другу.
-
Поиск: Когда пользователь задает вопрос (например, «Покажи мне дефект на этой печатной плате»), система выполняет семантический поиск по векторной базе данных, чтобы найти наиболее релевантные изображения или видеоклипы, соответствующие намерению запроса.
-
Генерация: Извлеченный визуальный контекст передается в модель «зрение-язык» (VLM). Модель VLM обрабатывает как текстовый запрос пользователя, так и извлеченные признаки изображения для формирования финального ответа, фактически «общаясь» с данными.
Реальные приложения#
Multimodal RAG трансформирует индустрии, позволяя агентам ИИ взаимодействовать с физическим миром посредством визуальных данных.
- Промышленное обслуживание и производство: Используя ИИ в производстве, технические специалисты могут отправить в систему запрос с фотографией сломанной детали машины. Система Multimodal RAG находит похожие исторические журналы обслуживания, технические схемы и видеоруководства, чтобы помочь в процессе ремонта. Это сокращает время простои и делает экспертные знания более доступными.
- Розничная торговля и поиск в электронной коммерции: Приложения на базе ИИ в ритейле позволяют клиентам загружать изображение понравившегося наряда. Система находит визуально похожие товары из текущего ассортимента и выдает советы по стилю или сравнения продуктов, создавая персонализированный процесс покупок.
Разграничение похожих терминов#
Чтобы понять специфическую нишу Multimodal RAG, полезно отличить его от смежных концепций:
- Multimodal RAG против мультимодальной модели: Мультимодальная модель (такая как GPT-4o или Gemini) создает ответ. Multimodal RAG — это архитектура, которая подает в эту модель внешние закрытые данные (изображения, документы), на которых та не обучалась. Модель — это двигатель, а RAG — топливопровод.
- Multimodal RAG против тонкой настройки: Тонкая настройка перманентно обновляет веса модели для освоения новой задачи или стиля. RAG предоставляет временные знания на этапе инференса. RAG предпочитают для динамических данных (например, ежедневных остатков на складе), где частое переобучение непрактично.
Реализация с помощью Ultralytics#
Разработчики могут создать компонент поиска для конвейера Multimodal RAG с помощью Ultralytics YOLO. Обнаруживая и классифицируя объекты на изображениях, YOLO формирует структурированные метаданные, которые можно индексировать для текстового поиска или использовать для обрезки нужных областей изображения для VLM. Платформа Ultralytics упрощает обучение этих специализированных моделей компьютерного зрения для распознавания пользовательских объектов, критически важных для твоей предметной области.
В следующем примере показано использование YOLO26 для извлечения визуального контекста (обнаруженных объектов) из изображения, который затем можно передать в LLM в рамках рабочего процесса RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personДополнительные материалы и ресурсы#
- Документация LangChain: Подробное руководство по созданию конвейеров поиска, включая поддержку мультимодальности.
- Мультимодальное руководство LlamaIndex: Подробная документация по индексации и поиску сложных типов данных для LLM.
- Google Cloud Vertex AI Search: Векторный поиск корпоративного уровня для создания масштабируемых приложений RAG.
- Решения Ultralytics: Узнай, как компьютерное зрение интегрируется с более широкими системами ИИ в различных отраслях.






