Расширение возможностей AI-приложений с помощью RAG и компьютерного зрения
Узнай, как объединение генерации с дополнением поиска (RAG) и компьютерного зрения помогает системам AI интерпретировать документы, изображения и сложный контент реального мира.

Использование AI-инструментов, таких как ChatGPT или Gemini, быстро становится привычным способом поиска информации. Будь то написание сообщения, краткое изложение документа или ответ на вопрос — эти инструменты часто предлагают более быстрое и простое решение.
Но если ты несколько раз пользовался большими языковыми моделями (LLMs), то, вероятно, заметил их ограничения. При запросах с высокой степенью специфичности или ограниченных по времени они могут выдавать неправильные ответы, часто с полной уверенностью.
Это происходит потому, что отдельные LLMs полностью полагаются на данные, на которых они были обучены. У них нет доступа к последним обновлениям или специализированным знаниям за пределами этого набора данных. В результате их ответы могут быть устаревшими или неточными.
Чтобы решить эту проблему, исследователи разработали метод, называемый генерацией с дополнением извлечёнными данными (RAG). RAG расширяет возможности языковых моделей, позволяя им получать свежую и релевантную информацию из надёжных источников при ответе на запросы.
В этой статье мы рассмотрим, как работает RAG и как он улучшает AI-инструменты за счёт извлечения релевантной и актуальной информации. Мы также рассмотрим, как он работает вместе с компьютерным зрением — областью искусственного интеллекта, ориентированной на интерпретацию визуальных данных, — помогая системам понимать не только текст, но и изображения, структуру страниц и визуально сложные документы.
Что такое генерация с дополнением извлечёнными данными (RAG)#
Задавая вопрос AI-чат-боту, мы обычно ожидаем не просто ответ, который хорошо звучит. В идеале хороший ответ должен быть понятным, точным и действительно полезным. Для этого AI-модели нужны не только языковые навыки, но и доступ к правильной информации, особенно по конкретным или ограниченным по времени темам.
RAG — это метод, который помогает устранить этот пробел. Он объединяет способность языковой модели понимать и генерировать текст с возможностью извлекать релевантную информацию из внешних источников. Вместо того чтобы полностью полагаться на обучающие данные, модель активно получает вспомогательный контент из надёжных баз знаний во время формирования ответа.

Рис. 1. Основные варианты использования RAG. Изображение автора.
Представь, что ты задаёшь кому-то вопрос, а этот человек перед ответом обращается к надёжному справочнику. Ответ всё ещё сформулирован его собственными словами, но основан на наиболее релевантной и актуальной информации.
Такой подход помогает LLMs давать более полные, точные и адаптированные к запросу пользователя ответы, делая их гораздо надёжнее в реальных приложениях, где точность действительно важна.
Как работает RAG#
RAG улучшает ответы большой языковой модели за счёт двух ключевых этапов: извлечения и генерации. Сначала он извлекает релевантную информацию из внешней базы знаний. Затем использует эту информацию для создания правильно сформированного ответа с учётом контекста.
Рассмотрим простой пример, чтобы понять, как работает этот процесс. Представь, что ты используешь AI-помощника для управления личными финансами и хочешь проверить, удалось ли тебе уложиться в запланированные расходы за месяц.
Процесс начинается с вопроса помощнику, например: «Уложился ли я в бюджет в этом месяце?» Вместо того чтобы полагаться только на то, чему система научилась во время обучения, она использует модуль извлечения для поиска по самым свежим финансовым записям — например, банковским выпискам или сводкам транзакций. Система сосредотачивается на понимании смысла твоего вопроса и собирает наиболее релевантную информацию.
После извлечения этой информации языковая модель приступает к работе. Она обрабатывает твой вопрос и данные из записей, чтобы сформировать понятный и полезный ответ. Вместо перечисления необработанных деталей ответ обобщает твои расходы и даёт прямое содержательное представление — например, подтверждает, достиг ли ты своей цели, и указывает основные категории расходов.
Такой подход помогает LLM давать ответы, которые не только точны, но и основаны на твоей реальной актуальной информации, делая взаимодействие гораздо полезнее, чем при работе модели только со статичными обучающими данными.

Рис. 2. Как работает RAG.
Необходимость мультимодальных систем RAG#
Информация не всегда представлена в виде обычного текста. От медицинских снимков и диаграмм до слайдов презентаций и отсканированных документов — визуальные материалы часто содержат важные детали. Традиционным LLMs, которые в основном созданы для чтения и понимания текста, бывает сложно работать с таким контентом.
Однако RAG можно использовать вместе с компьютерным зрением, чтобы устранить этот пробел. Вместе они образуют так называемую мультимодальную систему RAG — решение, способное работать и с текстом, и с визуальными материалами, помогая AI-чат-ботам давать более точные и полные ответы.
В основе этого подхода лежат визуально-языковые модели (VLMs), предназначенные для обработки и анализа обоих типов входных данных. В такой конфигурации RAG извлекает наиболее релевантную информацию из больших источников данных, а VLM с поддержкой компьютерного зрения интерпретирует изображения, структуру страниц и диаграммы.
Это особенно полезно для реальных документов, таких как отсканированные формы, медицинские отчёты или слайды презентаций, где важные детали могут содержаться и в тексте, и в визуальных материалах. Например, при анализе документа, включающего изображения, таблицы и абзацы, мультимодальная система может извлечь визуальные элементы, создать их краткое описание и объединить его с окружающим текстом, чтобы предоставить более полный и полезный ответ.

Рис. 3. Мультимодальный RAG использует изображения и текст для более качественных ответов.
Применение RAG для визуальных данных#
Теперь, когда мы обсудили, что такое RAG и как он работает с компьютерным зрением, рассмотрим несколько реальных примеров и исследовательских проектов, демонстрирующих применение этого подхода.
Понимание визуальных документов с помощью VisRAG#
Представь, что ты пытаешься извлечь полезные сведения из финансового отчёта или отсканированного юридического документа. Такие файлы часто содержат не только текст, но и таблицы, графики и элементы структуры, помогающие объяснить информацию. Обычная языковая модель может не заметить или неправильно интерпретировать эти визуальные элементы, что приведёт к неполным или неточным ответам.
VisRAG был создан исследователями для решения этой задачи. Это конвейер RAG на основе VLM, который рассматривает каждую страницу как изображение, а не обрабатывает только текст. Благодаря этому система понимает и содержимое, и его визуальную структуру. В результате она может находить наиболее релевантные фрагменты и давать более понятные, точные ответы, основанные на полном контексте документа.

Рис. 4. VisRAG может читать документы как изображения, чтобы анализировать текстовое содержимое и структуру.
Ответы на визуальные вопросы с помощью RAG#
Ответы на визуальные вопросы (VQA) — это задача, в которой AI-система отвечает на вопросы об изображениях. Многие существующие системы VQA сосредоточены на ответах по одному документу без необходимости искать дополнительную информацию — это называется закрытым режимом.
VDocRAG — это фреймворк RAG, использующий более реалистичный подход. Он объединяет VQA с возможностью сначала извлекать релевантные документы. Это полезно в реальных ситуациях, когда вопрос пользователя может относиться к одному из множества документов и системе нужно найти правильный документ перед формированием ответа. Для этого VDocRAG использует VLMs, анализирующие документы как изображения и сохраняющие как их текст, так и визуальную структуру.
Это делает VDocRAG особенно эффективным в таких приложениях, как корпоративный поиск, автоматизация работы с документами и поддержка клиентов. Он помогает командам быстро извлекать ответы из сложных документов с визуальным форматированием, например руководств или нормативных документов, где понимание структуры не менее важно, чем чтение текста.

Рис. 5. Разница между VDocRAG и решениями на основе LLM.
Улучшение создания описаний изображений с помощью RAG#
Создание описаний изображений — это генерация письменного описания происходящего на изображении. Оно используется в самых разных приложениях: от повышения доступности онлайн-контента до организации поиска изображений, а также поддержки систем модерации и рекомендаций контента.
Однако AI-моделям не всегда легко создавать точные описания. Особенно сложно это делать, когда на изображении показано что-то отличное от того, на чём обучалась модель. Многие системы создания описаний сильно зависят от обучающих данных, поэтому при встрече с незнакомыми сценами их описания могут быть расплывчатыми или неточными.
Чтобы решить эту проблему, исследователи разработали Re-ViLM — метод, который переносит генерацию с дополнением извлечёнными данными (RAG) в область создания описаний изображений. Вместо генерации описания с нуля Re-ViLM извлекает из базы данных похожие пары «изображение — текст» и использует их для управления результатом.
Этот подход на основе извлечения помогает модели основывать описания на релевантных примерах, повышая их точность и беглость. Первые результаты показывают, что Re-ViLM создаёт более естественные описания с учётом контекста, используя реальные примеры и помогая сократить количество расплывчатых или неточных описаний.

Рис. 6. Re-ViLM улучшает описания изображений, извлекая визуально-текстовые примеры.
Преимущества и недостатки использования RAG для понимания визуальных данных#
Кратко рассмотрим преимущества применения методов генерации с дополнением извлечёнными данными для извлечения и использования визуальной информации:
- Расширенные возможности суммаризации: Краткие изложения могут учитывать сведения из визуальных материалов, например тенденции на графиках или элементы инфографики, а не только текст.
- Более надёжный поиск и извлечение: этапы извлечения могут находить релевантные визуальные страницы, даже если ключевые слова отсутствуют в тексте, используя понимание изображений.
- Поддержка отсканированных документов, рукописей и документов на основе изображений: конвейеры RAG с поддержкой VLMs могут обрабатывать содержимое, которое было бы нечитаемым для моделей, работающих только с текстом.
Несмотря на эти преимущества, при использовании RAG для работы с визуальными данными всё же нужно учитывать несколько ограничений. Вот некоторые из основных:
- Высокие требования к вычислительным ресурсам: анализ изображений и текста одновременно требует больше памяти и вычислительной мощности, что может замедлить работу или повысить затраты.
- Проблемы конфиденциальности данных и безопасности: визуальные документы, особенно в таких сферах, как здравоохранение или финансы, могут содержать конфиденциальную информацию, усложняющую процессы извлечения и обработки.
- Более длительное время инференса: поскольку обработка визуальных данных повышает сложность, генерация ответов может занимать больше времени по сравнению с системами, работающими только с текстом.
Основные выводы#
Генерация с дополнением извлечёнными данными улучшает ответы больших языковых моделей на вопросы, позволяя им получать релевантную и актуальную информацию из внешних источников. В сочетании с компьютерным зрением такие системы могут обрабатывать не только текст, но и визуальный контент, например графики, таблицы, изображения и отсканированные документы, создавая более точные и всесторонние ответы.
Такой подход делает LLMs более подходящими для реальных задач, связанных со сложными документами. Объединяя извлечение информации и визуальное понимание, эти модели эффективнее интерпретируют различные форматы и предоставляют более полезные сведения в практических повседневных сценариях.
Присоединяйся к нашему растущему сообществу! Изучи наш репозиторий GitHub, чтобы глубже погрузиться в AI. Готов начать собственные проекты в области компьютерного зрения? Ознакомься с нашими вариантами лицензирования. Узнай больше об AI в здравоохранении и компьютерном зрении в розничной торговле на наших страницах решений!









