Multimodal RAG
텍스트, 이미지, 비디오를 처리하기 위한 멀티모달 RAG를 살펴보십시오. 더 정확하고 상황을 인식하는 응답을 위해 Ultralytics YOLO26이 AI 검색 파이프라인을 어떻게 향상시키는지 알아보십시오.
Multimodal Retrieval Augmented Generation (Multimodal RAG)은 텍스트, 이미지, 비디오, 오디오와 같은 다양한 데이터 타입을 처리하고 추론할 수 있도록 전통적인 RAG 시스템을 확장한 고급 artificial intelligence (AI) 프레임워크입니다. 표준 Retrieval Augmented Generation (RAG)은 관련 텍스트 문서를 검색하여 Large Language Model (LLM)의 정확도를 향상시키지만, Multimodal RAG는 혼합 미디어 지식베이스에서 컨텍스트를 검색하여 모델이 "보고" "듣고" 판단할 수 있도록 합니다. 이 접근 방식은 구체적인 시각적 또는 청각적 증거를 기반으로 모델의 생성을 뒷받침하여, hallucinations in LLMs을 크게 줄이고 비공개 데이터셋에 대한 시각적 질의 응답과 같은 복잡한 작업을 가능하게 합니다. multi-modal learning을 활용하여, 이 시스템은 사용자의 쿼리(예: 텍스트)와 검색된 자산(예: 다이어그램 또는 감시 프레임)의 정보를 종합하여 포괄적이고 컨텍스트를 인식하는 응답을 생성할 수 있습니다.
Multimodal RAG의 작동 원리#
Multimodal RAG 시스템의 아키텍처는 일반적으로 표준 "검색 후 생성(Retrieve-then-Generate)" 파이프라인을 반영하지만 비텍스트 데이터에 맞게 이를 조정합니다. 이 프로세스는 vector databases와 공유 의미 공간에 크게 의존합니다.
-
인덱싱: PDF, 비디오, 슬라이드 덱 등 다양한 소스의 데이터가 처리됩니다. Feature extraction 모델은 이러한 다양한 모달리티를 embeddings로 알려진 고차원 수치 벡터로 변환합니다. 예를 들어, OpenAI's CLIP 같은 모델은 개 사진과 "dog"라는 단어가 수학적으로 가까워지도록 이미지와 텍스트 임베딩을 정렬합니다.
-
검색: 사용자가 질문을 던질 때(예: "이 회로 기판의 결함을 보여주세요"), 시스템은 벡터 전체에서 semantic search를 수행하여 쿼리의 의도에 가장 잘 맞는 관련 이미지나 비디오 클립을 찾습니다.
-
생성: 검색된 시각적 컨텍스트는 Vision-Language Model (VLM)로 공급됩니다. VLM은 사용자의 텍스트 프롬프트와 검색된 이미지 피처를 모두 처리하여 최종 답변을 생성하며, 데이터와 효과적으로 "대화"합니다.
실제 애플리케이션 사례#
Multimodal RAG는 AI agents가 시각적 데이터를 통해 물리적 세계와 상호 작용할 수 있도록 함으로써 산업을 변화시키고 있습니다.
- 산업용 유지보수 및 제조: AI in manufacturing 분야에서 기술자는 고장 난 기계 부품의 사진을 사용하여 시스템에 질문할 수 있습니다. Multimodal RAG 시스템은 유사한 과거 유지보수 로그, 기술 도면, 비디오 튜토리얼을 검색하여 수리 과정을 안내합니다. 이를 통해 가동 중단 시간이 줄어들고 전문가 지식을 보편화할 수 있습니다.
- 소매 및 이커머스 검색: AI in retail을 사용하는 애플리케이션을 통해 고객은 자신이 마음에 드는 의류의 이미지를 업로드할 수 있습니다. 시스템은 현재 인벤토리에서 시각적으로 유사한 아이템을 검색하고 스타일링 조언이나 제품 비교를 생성하여, 매우 개인화된 쇼핑 경험을 제공합니다.
관련 용어 차별화#
Multimodal RAG의 구체적인 영역을 이해하려면 관련 개념과 구별하는 것이 도움이 됩니다:
- Multimodal RAG 대 Multi-Modal Model: 멀티모달 모델(예: GPT-4o 또는 Gemini)은 응답을 생성합니다. Multimodal RAG는 해당 모델이 훈련되지 않은 외부 비공개 데이터(이미지, 문서)를 모델에 공급하는 아키텍처입니다. 모델이 엔진이라면 RAG는 연료 라인입니다.
- Multimodal RAG 대 Fine-Tuning: 파인튜닝은 새로운 작업이나 스타일을 학습하기 위해 model weights를 영구적으로 업데이트합니다. RAG는 추론 시점에 임시 지식을 제공합니다. 빈번한 재학습이 비실용적인 동적 데이터(예: 일일 인벤토리)에는 RAG가 선호됩니다.
Ultralytics를 활용한 구현#
개발자는 Ultralytics YOLO를 사용하여 Multimodal RAG 파이프라인의 검색 컴포넌트를 빌드할 수 있습니다. 이미 내의 객체를 감지하고 분류함으로써 YOLO는 텍스트 기반 검색을 위해 인덱싱하거나 VLM을 위해 관련 이미지 영역을 자르는 데 사용할 수 있는 구조화된 메타데이터를 제공합니다. Ultralytics Platform은 특정 도메인에 중요한 커스텀 객체를 인식하도록 이러한 특수 비전 모델을 학습시키는 과정을 단순화합니다.
다음 예시는 YOLO26을 사용하여 이미지에서 시각적 컨텍스트(감지된 객체)를 추출하는 방법을 보여주며, 이는 RAG 워크플로의 일부로 LLM에 전달될 수 있습니다.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person추가 읽기 및 리소스#
- LangChain Documentation: 멀티모달 지원을 포함하여 검색 파이프라인을 구축하기 위한 종합 가이드입니다.
- LlamaIndex Multimodal Guide: LLM을 위한 복잡한 데이터 타입 인덱싱 및 검색에 대한 상세 문서입니다.
- Google Cloud Vertex AI Search: 확장 가능한 RAG 애플리케이션 구축을 위한 엔터프라이즈급 벡터 검색 기능입니다.
- Ultralytics Solutions: 다양한 산업에 걸쳐 컴퓨터 비전이 더 넓은 AI 시스템과 어떻게 통합되는지 살펴보세요.






