Multimodal RAG
Изучи мультимодальный RAG для обработки текста, изображений и видео. Узнай, как Ultralytics YOLO26 улучшает конвейеры извлечения данных AI, обеспечивая более точные ответы с учётом контекста.
Мультимодальная генерация с дополнением поиском (Multimodal RAG) — это современная платформа искусственного интеллекта (AI), которая расширяет традиционные системы RAG, позволяя обрабатывать данные разных типов и рассуждать на их основе, включая текст, изображения, видео и аудио. В то время как стандартная генерация с дополнением поиском (RAG) повышает точность большой языковой модели (LLM) за счёт поиска релевантных текстовых документов, мультимодальный RAG позволяет моделям «видеть» и «слышать», извлекая контекст из мультимедийной базы знаний. Такой подход основывает генерацию модели на конкретных визуальных или звуковых свидетельствах, значительно сокращает галлюцинации в LLM и позволяет решать сложные задачи, например отвечать на вопросы по изображениям в частных наборах данных. Благодаря мультимодальному обучению эти системы могут объединять информацию из запроса пользователя (например, текста) и найденных материалов (например, схемы или кадра с камеры наблюдения), чтобы формировать подробные ответы с учётом контекста.
Как работает мультимодальный RAG#
Архитектура системы мультимодального RAG обычно повторяет стандартный конвейер «поиск, затем генерация», но адаптирует его для нетекстовых данных. Этот процесс в значительной степени опирается на векторные базы данных и общие семантические пространства.
-
Индексация: Данные из различных источников — PDF-файлы, видео и презентации — обрабатываются. Модели извлечения признаков преобразуют эти разные модальности в многомерные числовые векторы, известные как эмбеддинги. Например, такая модель, как CLIP от OpenAI, согласует эмбеддинги изображений и текста, чтобы изображение собаки и слово «собака» были математически близки.
-
Поиск: Когда пользователь задаёт вопрос (например, «Покажи дефект на этой печатной плате»), система выполняет семантический поиск по векторной базе данных, чтобы найти наиболее релевантные изображения или видеоклипы, соответствующие смыслу запроса.
-
Генерация: Найденный визуальный контекст передаётся в визуально-языковую модель (VLM). VLM обрабатывает текстовый запрос пользователя и признаки найденного изображения, чтобы сформировать итоговый ответ, фактически «общаясь» с данными.
Практические применения#
Мультимодальный RAG преобразует различные отрасли, позволяя AI-агентам взаимодействовать с физическим миром посредством визуальных данных.
- Техническое обслуживание и производство: В сфере AI в производстве специалисты могут отправить системе фотографию сломанной детали станка. Система мультимодального RAG находит похожие исторические журналы технического обслуживания, технические схемы и видеоуроки, помогающие выполнить ремонт. Это сокращает простой и делает экспертные знания доступнее.
- Ритейл и поиск товаров в электронной коммерции: Приложения, использующие AI в ритейле, позволяют покупателям загрузить изображение понравившегося наряда. Система находит визуально похожие товары из текущего ассортимента и формирует рекомендации по стилю или сравнения продуктов, создавая персонализированный опыт покупок.
Различия между связанными терминами#
Чтобы понять специфику мультимодального RAG, полезно отличать его от связанных концепций:
- Мультимодальный RAG и мультимодальная модель: Ответ создаёт мультимодальная модель (например, GPT-4o или Gemini). Мультимодальный RAG — это архитектура, которая передаёт этой модели внешние частные данные (изображения и документы), на которых она не обучалась. Модель — это двигатель, а RAG — топливопровод.
- Мультимодальный RAG и дообучение: Дообучение навсегда обновляет веса модели, чтобы она освоила новую задачу или стиль. RAG предоставляет временные знания во время вывода. RAG предпочтителен для динамических данных (например, ежедневного ассортимента), когда частое переобучение непрактично.
Реализация с Ultralytics#
Разработчики могут создать компонент поиска в конвейере мультимодального RAG с помощью Ultralytics YOLO. Обнаруживая и классифицируя объекты на изображениях, YOLO предоставляет структурированные метаданные, которые можно индексировать для текстового поиска или использовать для обрезки релевантных областей изображения перед передачей в VLM. Ultralytics Platform упрощает обучение специализированных моделей компьютерного зрения для распознавания пользовательских объектов, важных для конкретной предметной области.
В следующем примере показано, как использовать YOLO26 для извлечения визуального контекста (обнаруженных объектов) из изображения, который затем можно передать LLM в рамках рабочего процесса RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personДополнительные материалы и ресурсы#
- Документация LangChain: Подробное руководство по созданию конвейеров поиска, включая поддержку мультимодальных данных.
- Мультимодальное руководство LlamaIndex: Подробная документация по индексации и поиску сложных типов данных для LLM.
- Google Cloud Vertex AI Search: Векторный поиск корпоративного уровня для создания масштабируемых приложений RAG.
- Решения Ultralytics: Узнай, как компьютерное зрение интегрируется с более широкими системами AI в различных отраслях.









