RAG와 컴퓨터 비전으로 AI 애플리케이션 향상하기
검색 증강 생성(RAG)과 컴퓨터 비전을 결합하여 AI 시스템이 문서, 시각 자료 및 복잡한 실제 콘텐츠를 해석하도록 지원하는 방법을 알아보세요.

ChatGPT나 Gemini와 같은 AI 도구를 사용하는 것은 정보를 찾는 일반적인 방법으로 빠르게 자리 잡고 있습니다. 메시지를 작성하거나, 문서를 요약하거나, 질문에 답할 때 이러한 도구는 더 빠르고 간편한 해결책을 제공하는 경우가 많습니다.
하지만 대규모 언어 모델 (LLMs)을 몇 번 사용해 보셨다면 그 한계를 이미 느끼셨을 것입니다. 매우 구체적이거나 시간에 민감한 질문을 입력하면 이러한 모델은 종종 확신에 찬 어조로 잘못된 답변을 제공할 수 있습니다.
이는 독립형 LLM이 학습된 데이터에만 의존하기 때문에 발생합니다. 해당 데이터셋을 벗어난 최신 업데이트나 전문 지식에 액세스할 수 없습니다. 그 결과 답변이 오래되었거나 부정확할 수 있습니다.
이 문제를 해결하기 위해 연구자들은 검색 증강 생성 (RAG)이라는 방법을 개발했습니다. RAG는 질문에 답할 때 신뢰할 수 있는 출처에서 최신의 관련 정보를 가져올 수 있도록 하여 언어 모델을 향상합니다.
이 글에서는 RAG의 작동 방식과 관련성 높고 최신인 정보를 검색하여 AI 도구를 향상하는 방법을 살펴봅니다. 또한 텍스트뿐 아니라 이미지, 레이아웃, 시각적으로 복잡한 문서까지 시스템이 이해할 수 있도록 돕는 인공지능 분야인 컴퓨터 비전과 RAG가 어떻게 함께 작동하는지도 알아봅니다.
검색 증강 생성 (RAG) 이해하기#
AI 챗봇에 질문할 때 일반적으로 기대하는 것은 그럴듯하게 들리는 답변만이 아닙니다. 이상적으로 좋은 답변은 명확하고 정확하며 실질적으로 도움이 되어야 합니다. 이를 위해 AI 모델에는 언어 능력 이상의 것이 필요하며, 특히 구체적이거나 시간에 민감한 주제에 대해서는 올바른 정보에 액세스할 수 있어야 합니다.
RAG는 이러한 격차를 해소하는 데 도움이 되는 기법입니다. 언어 모델의 텍스트 이해 및 생성 능력과 외부 소스에서 관련 정보를 검색하는 기능을 결합합니다. 모델은 학습 데이터에만 의존하는 대신 응답을 작성하는 동안 신뢰할 수 있는 지식 베이스에서 뒷받침할 콘텐츠를 능동적으로 가져옵니다.

그림 1. 주요 RAG 사용 사례. 이미지 작성자 제공.
누군가에게 질문하고 그 사람이 답하기 전에 신뢰할 수 있는 참고 자료를 확인하는 상황과 비슷하다고 생각할 수 있습니다. 답변은 여전히 자신의 말로 전달되지만, 가장 관련성 높고 최신인 정보에 기반합니다.
이 접근 방식은 LLM이 사용자의 질문에 더욱 완전하고 정확하며 맞춤화된 답변을 제공하도록 하여, 정확성이 중요한 실제 애플리케이션에서 훨씬 더 높은 신뢰성을 제공합니다.
RAG의 작동 방식 살펴보기#
RAG는 검색과 생성이라는 두 가지 핵심 단계를 도입하여 대규모 언어 모델의 응답 방식을 향상합니다. 먼저 외부 지식 베이스에서 관련 정보를 검색합니다. 그런 다음 해당 정보를 사용하여 형식이 잘 갖춰지고 맥락을 반영한 응답을 생성합니다.
이 과정이 어떻게 작동하는지 간단한 예를 살펴보겠습니다. 개인 재정을 관리하는 AI 어시스턴트를 사용하면서 해당 월의 지출 목표를 지켰는지 확인하려는 상황을 생각해 보세요.
이 과정은 어시스턴트에게 "이번 달에 예산을 지켰나요?"와 같은 질문을 하는 순간 시작됩니다. 시스템은 학습 중에 배운 내용에만 의존하는 대신 검색기를 사용하여 가장 최근의 금융 기록(은행 명세서나 거래 요약과 같은 자료)을 검색합니다. 질문의 의도를 파악하는 데 집중하고 가장 관련성 높은 정보를 수집합니다.
정보가 검색되면 언어 모델이 그다음 작업을 수행합니다. 기록에서 가져온 데이터와 질문을 함께 처리하여 명확하고 유용한 답변을 생성합니다. 응답은 원시 세부 정보를 나열하는 대신 지출을 요약하고, 목표를 달성했는지 확인하거나 주요 지출 영역을 알려 주는 등 직접적이고 의미 있는 인사이트를 제공합니다.
이 접근 방식은 LLM이 정확할 뿐 아니라 실제 최신 정보에 기반한 응답을 제공하도록 하여, 정적인 학습 데이터만 사용하는 모델보다 훨씬 유용한 경험을 제공합니다.

그림 2. RAG의 작동 방식 이해하기.
멀티모달 RAG 시스템의 필요성#
정보가 항상 일반 텍스트로만 공유되는 것은 아닙니다. 의료 스캔 이미지와 다이어그램부터 프레젠테이션 슬라이드와 스캔 문서에 이르기까지 시각 자료에는 중요한 세부 정보가 담겨 있는 경우가 많습니다. 주로 텍스트를 읽고 이해하도록 구축된 기존 LLM은 이러한 유형의 콘텐츠를 처리하는 데 어려움을 겪을 수 있습니다.
하지만 RAG를 컴퓨터 비전과 함께 사용하면 이러한 격차를 해소할 수 있습니다. 두 기술을 결합하면 멀티모달 RAG 시스템이라고 하는 구성이 형성됩니다. 이 시스템은 텍스트와 시각 자료를 모두 처리하여 AI 챗봇이 더욱 정확하고 완전한 답변을 제공하도록 돕습니다.
이 접근 방식의 핵심에는 두 유형의 입력을 모두 처리하고 추론하도록 설계된 비전-언어 모델 (VLMs)이 있습니다. 이 구성에서 RAG는 대규모 데이터 소스에서 가장 관련성 높은 정보를 검색하고, 컴퓨터 비전으로 활성화된 VLM은 이미지, 레이아웃, 다이어그램을 해석합니다.
이는 스캔 양식, 의료 보고서, 프레젠테이션 슬라이드와 같은 실제 문서에 특히 유용합니다. 이러한 문서에서는 중요한 세부 정보가 텍스트와 시각 자료 모두에 있을 수 있습니다. 예를 들어 이미지와 표, 단락이 함께 포함된 문서를 분석할 때 멀티모달 시스템은 시각적 요소를 추출하고 해당 요소가 보여 주는 내용을 요약한 다음, 주변 텍스트와 결합하여 더욱 완전하고 유용한 응답을 제공할 수 있습니다.

그림 3. 멀티모달 RAG는 이미지와 텍스트를 사용하여 더 나은 답변을 제공합니다.
시각 데이터에 RAG 적용하기#
이제 RAG의 개념과 컴퓨터 비전과 함께 작동하는 방식을 살펴보았으므로, 이 접근 방식이 어떻게 사용되고 있는지 보여 주는 실제 사례와 연구 프로젝트를 알아보겠습니다.
VisRAG로 시각적 문서 이해하기#
재무 보고서나 스캔된 법률 문서에서 인사이트를 추출하려는 상황을 생각해 보세요. 이러한 유형의 파일에는 텍스트뿐 아니라 정보를 설명하는 데 도움이 되는 표, 차트, 레이아웃도 포함되는 경우가 많습니다. 단순한 언어 모델은 이러한 시각적 요소를 간과하거나 잘못 해석하여 불완전하거나 부정확한 응답을 생성할 수 있습니다.
연구자들은 이 문제를 해결하기 위해 VisRAG를 개발했습니다. VisRAG는 텍스트만 처리하는 대신 각 페이지를 이미지로 취급하는 VLM 기반 RAG 파이프라인입니다. 이를 통해 시스템은 콘텐츠와 시각적 구조를 모두 이해할 수 있습니다. 그 결과 문서에서 가장 관련성 높은 부분을 찾아 더욱 명확하고 정확하며 문서 전체의 맥락에 기반한 답변을 제공할 수 있습니다.

그림 4. VisRAG는 문서를 이미지로 읽어 텍스트 콘텐츠와 레이아웃을 파악할 수 있습니다.
RAG를 활용한 시각적 질의응답#
시각적 질의응답 (VQA)은 AI 시스템이 이미지에 관한 질문에 답하는 작업입니다. 기존의 많은 VQA 시스템은 추가 정보를 검색하지 않고 단일 문서에 관한 질문에 답하는 데 중점을 둡니다. 이를 폐쇄형 설정이라고 합니다.
VDocRAG는 더욱 현실적인 접근 방식을 취하는 RAG 프레임워크입니다. VQA와 관련 문서를 먼저 검색하는 기능을 통합합니다. 사용자의 질문이 여러 문서 중 하나에 해당할 수 있고 시스템이 답변하기 전에 올바른 문서를 찾아야 하는 실제 상황에서 유용합니다. 이를 위해 VDocRAG는 VLM을 사용하여 문서를 이미지로 분석하고 텍스트와 시각적 구조를 모두 보존합니다.
따라서 VDocRAG는 엔터프라이즈 검색, 문서 자동화, 고객 지원과 같은 애플리케이션에서 특히 큰 효과를 발휘합니다. 매뉴얼이나 정책 문서처럼 시각적으로 형식화된 복잡한 문서에서 팀이 답변을 신속하게 추출하도록 도울 수 있으며, 이러한 문서에서는 단어를 읽는 것만큼 레이아웃을 이해하는 것도 중요합니다.

그림 5. VDocRAG와 LLM 기반 솔루션의 차이.
RAG로 이미지 캡셔닝 향상하기#
이미지 캡셔닝은 이미지에서 어떤 일이 일어나고 있는지 글로 설명하는 내용을 생성하는 작업입니다. 온라인 콘텐츠의 접근성을 높이는 것부터 이미지 검색 지원, 콘텐츠 모더레이션 및 추천 시스템 지원에 이르기까지 다양한 애플리케이션에서 사용됩니다.
하지만 AI 모델이 정확한 캡션을 생성하는 일이 항상 쉬운 것은 아닙니다. 이미지에 모델이 학습한 내용과 다른 장면이 나타나는 경우 특히 어렵습니다. 많은 캡셔닝 시스템은 학습 데이터에 크게 의존하므로 익숙하지 않은 장면을 만나면 캡션이 모호하거나 부정확하게 생성될 수 있습니다.
이를 해결하기 위해 연구자들은 이미지 캡셔닝에 검색 증강 생성 (RAG)을 도입한 방법인 Re-ViLM을 개발했습니다. Re-ViLM은 처음부터 캡션을 생성하는 대신 데이터베이스에서 유사한 이미지-텍스트 쌍을 검색하고 이를 사용하여 캡션 출력을 유도합니다.
이 검색 기반 접근 방식은 모델이 관련 예시에 기반하여 설명을 생성하도록 하여 정확성과 유창성을 모두 향상합니다. 초기 결과에 따르면 Re-ViLM은 실제 예시를 사용하여 더욱 자연스럽고 맥락을 반영한 캡션을 생성하며, 모호하거나 부정확한 설명을 줄이는 데 도움이 됩니다.

그림 6. Re-ViLM은 시각-텍스트 예시를 검색하여 이미지 캡션을 향상합니다.
시각 데이터를 이해하기 위해 RAG를 사용할 때의 장단점#
검색 증강 생성 기법을 적용하여 시각 정보를 검색하고 사용하는 경우의 이점을 간단히 살펴보겠습니다.
- 향상된 요약 기능: 텍스트뿐 아니라 시각 자료(차트의 추세나 인포그래픽 요소 등)에서 얻은 인사이트도 요약에 포함할 수 있습니다.
- 더 강력한 검색 및 검색 기능: 이미지 기반 이해를 사용하면 텍스트에 키워드가 없어도 검색 단계에서 관련 시각적 페이지를 식별할 수 있습니다.
- 스캔 문서, 손글씨 문서 또는 이미지 기반 문서 지원: VLM으로 활성화된 RAG 파이프라인은 텍스트 전용 모델이 읽을 수 없는 콘텐츠도 처리할 수 있습니다.
이러한 이점에도 불구하고 RAG를 사용하여 시각 데이터를 처리할 때 고려해야 할 몇 가지 한계가 있습니다. 주요 한계는 다음과 같습니다.
- 높은 컴퓨팅 요구 사항: 이미지와 텍스트를 모두 분석하려면 더 많은 메모리와 처리 능력이 필요하므로 성능이 저하되거나 비용이 증가할 수 있습니다.
- 데이터 개인정보 보호 및 보안 우려: 특히 의료나 금융과 같은 분야의 시각적 문서에는 민감한 정보가 포함될 수 있어 검색 및 처리 워크플로가 복잡해질 수 있습니다.
- 더 긴 추론 시간: 시각적 처리가 복잡성을 더하기 때문에 응답을 생성하는 데 텍스트 전용 시스템보다 더 오랜 시간이 걸릴 수 있습니다.
핵심 요점#
검색 증강 생성은 대규모 언어 모델이 외부 소스에서 관련성 높고 최신인 정보를 가져올 수 있도록 하여 질문에 답하는 방식을 개선하고 있습니다. 컴퓨터 비전과 결합하면 이러한 시스템은 텍스트뿐 아니라 차트, 표, 이미지, 스캔 문서와 같은 시각적 콘텐츠도 처리할 수 있어 더욱 정확하고 균형 잡힌 응답을 제공합니다.
이 접근 방식은 복잡한 문서가 포함된 실제 작업에 LLM을 더욱 적합하게 만듭니다. 검색과 시각적 이해를 결합하면 이러한 모델은 다양한 형식을 더욱 효과적으로 해석하고 실용적인 일상 상황에서 더욱 유용한 인사이트를 제공할 수 있습니다.
성장하는 커뮤니티에 참여하세요! GitHub 리포지토리를 살펴보며 AI를 더 깊이 알아보세요. 직접 컴퓨터 비전 프로젝트를 시작할 준비가 되셨나요? 라이선스 옵션을 확인해 보세요. 솔루션 페이지에서 의료 분야의 AI와 소매업의 컴퓨터 비전에 대해 자세히 알아보세요!









