Multimodal RAG
멀티모달 RAG를 사용하여 텍스트, 이미지, 동영상을 처리하는 방법을 살펴보세요. Ultralytics YOLO26이 AI 검색 파이프라인을 향상하여 더 정확하고 컨텍스트를 인식하는 응답을 제공하는 방식을 알아보세요.
멀티모달 검색 증강 생성(Multimodal RAG)은 텍스트, 이미지, 동영상, 오디오와 같은 다양한 데이터 유형을 처리하고 추론하도록 기존 RAG 시스템을 확장한 고급 인공지능(AI) 프레임워크입니다. 일반적인 검색 증강 생성(RAG)은 관련 텍스트 문서를 검색하여 대규모 언어 모델(LLM)의 정확도를 향상시키지만, 멀티모달 RAG는 혼합 미디어 지식 베이스에서 컨텍스트를 검색하여 모델이 "보고" "듣도록" 합니다. 이 접근 방식은 구체적인 시각 또는 청각 증거를 바탕으로 모델의 생성을 수행하므로 LLM의 환각을 크게 줄이고, 비공개 데이터 세트에 대한 시각적 질의응답과 같은 복잡한 작업을 수행할 수 있습니다. 멀티모달 학습을 활용하면 이러한 시스템은 사용자의 쿼리(예: 텍스트)와 검색된 자산(예: 다이어그램 또는 감시 영상 프레임)의 정보를 종합하여 포괄적이고 컨텍스트를 인식하는 응답을 생성할 수 있습니다.
멀티모달 RAG의 작동 방식#
멀티모달 RAG 시스템의 아키텍처는 일반적으로 표준 "검색 후 생성" 파이프라인을 따르지만, 텍스트가 아닌 데이터에 맞게 조정됩니다. 이 프로세스는 벡터 데이터베이스와 공유 의미 공간에 크게 의존합니다.
-
인덱싱: PDF, 동영상, 슬라이드 덱 등 다양한 소스의 데이터를 처리합니다. 특징 추출 모델은 서로 다른 모달리티를 임베딩이라고 하는 고차원 수치 벡터로 변환합니다. 예를 들어 OpenAI의 CLIP과 같은 모델은 이미지 임베딩과 텍스트 임베딩을 정렬하여 개 사진과 "개"라는 단어가 수학적으로 가까워지도록 합니다.
-
검색: 사용자가 질문(예: "이 회로 기판의 결함을 보여 주세요")을 입력하면 시스템은 벡터 데이터베이스에서 의미 검색을 수행하여 쿼리의 의도와 일치하는 가장 관련성 높은 이미지 또는 동영상 클립을 찾습니다.
-
생성: 검색된 시각적 컨텍스트를 비전-언어 모델(VLM)에 입력합니다. VLM은 사용자의 텍스트 프롬프트와 검색된 이미지 특징을 모두 처리하여 최종 답변을 생성하고, 데이터와 효과적으로 "대화"합니다.
실제 적용 사례#
멀티모달 RAG는 AI 에이전트가 시각 데이터를 통해 실제 세계와 상호작용할 수 있도록 하여 다양한 산업을 변화시키고 있습니다.
- 산업 유지보수 및 제조: 제조 분야의 AI를 활용하면 기술자가 고장 난 기계 부품의 사진을 시스템에 입력하여 질의할 수 있습니다. 멀티모달 RAG 시스템은 유사한 과거 유지보수 로그, 기술 도면, 동영상 튜토리얼을 검색하여 수리 프로세스를 안내합니다. 이를 통해 가동 중단 시간을 줄이고 전문가 지식을 보다 폭넓게 활용할 수 있습니다.
- 소매 및 이커머스 탐색: 소매 분야의 AI를 활용하는 애플리케이션을 통해 고객은 마음에 드는 의상의 이미지를 업로드할 수 있습니다. 시스템은 현재 재고에서 시각적으로 유사한 상품을 검색하고 스타일링 조언 또는 제품 비교를 생성하여 고도로 개인화된 쇼핑 경험을 제공합니다.
관련 용어 구분#
멀티모달 RAG의 구체적인 틈새 영역을 이해하려면 관련 개념과 구별해 보는 것이 도움이 됩니다.
- 멀티모달 RAG와 멀티모달 모델의 비교: 멀티모달 모델(GPT-4o 또는 Gemini 등)이 응답을 생성합니다. 멀티모달 RAG는 해당 모델이 학습하지 않은 외부 비공개 데이터(이미지, 문서)를 모델에 공급하는 아키텍처입니다. 모델이 엔진이라면 RAG는 연료 공급 라인입니다.
- 멀티모달 RAG와 파인튜닝의 비교: 파인튜닝은 새로운 작업이나 스타일을 학습하도록 모델 가중치를 영구적으로 업데이트합니다. RAG는 추론 시점에 일시적인 지식을 제공합니다. RAG는 자주 재학습하기 어려운 동적 데이터(예: 일일 재고)에 선호됩니다.
Ultralytics를 활용한 구현#
개발자는 Ultralytics YOLO를 사용하여 멀티모달 RAG 파이프라인의 검색 구성 요소를 구축할 수 있습니다. YOLO는 이미지 내 객체를 탐지하고 분류하여 텍스트 기반 검색을 위해 인덱싱할 수 있는 구조화된 메타데이터를 제공하거나, VLM에 사용할 관련 이미지 영역을 크롭할 수 있습니다. Ultralytics Platform은 특정 도메인에 중요한 사용자 지정 객체를 인식하도록 이러한 특수 비전 모델을 학습하는 과정을 간소화합니다.
다음 예제에서는 YOLO26을 사용하여 이미지에서 시각적 컨텍스트(탐지된 객체)를 추출합니다. 추출된 정보는 RAG 워크플로의 일부로 LLM에 전달할 수 있습니다.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person추가 읽기 및 리소스#
- LangChain 문서: 멀티모달 지원을 포함하여 검색 파이프라인을 구축하는 방법을 설명하는 종합 가이드입니다.
- LlamaIndex 멀티모달 가이드: LLM을 위해 복잡한 데이터 유형을 인덱싱하고 검색하는 방법을 자세히 설명하는 문서입니다.
- Google Cloud Vertex AI Search: 확장 가능한 RAG 애플리케이션을 구축하기 위한 엔터프라이즈급 벡터 검색 기능입니다.
- Ultralytics Solutions: 컴퓨터 비전이 다양한 산업 전반의 광범위한 AI 시스템과 통합되는 방식을 살펴보세요.









