YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Multi-Modal Model

멀티모달 모델이 텍스트, 이미지, 오디오를 어떻게 통합하는지 살펴보십시오. Ultralytics YOLO26과 같은 아키텍처에 대해 알아보고 Ultralytics 플랫폼에서 비전 AI를 배포해 보십시오.

멀티모달 모델은 텍스트용 Natural Language Processing (NLP)이나 이미지용 Computer Vision (CV) 같은 단일 도메인에 특화된 기존의 단일 모달(unimodal) 시스템과 달리, 시각적, 청각적, 언어적 단서를 함께 합성하여 인간의 지각을 모방하는 것을 목표로 하는 artificial intelligence (AI) 시스템의 고급 유형으로, 여러 서로 다른 데이터 타입(또는 "모달리티")의 정보를 동시에 처리, 해석 및 통합할 수 있습니다. 이러한 융합을 통해 모델은 세상에 대한 포괄적인 이해를 발전시킬 수 있으며, 이를 통해 시각적 장면에 대한 음성 설명 사이에 복잡한 상관관계를 도출할 수 있습니다. 이러한 기능들은 Artificial General Intelligence (AGI) 달성을 향한 기초적인 단계로 간주됩니다.

핵심 메커니즘 및 아키텍처#

멀티모달 모델의 효능은 다양한 데이터 타입을 공유된 의미 공간에 매핑하는 능력에 달려 있습니다. 이 프로세스는 일반적으로 입력 데이터의 본질적인 의미를 포착하는 수치적 표현인 embeddings의 생성으로 시작됩니다. 자막이 포함된 비디오와 같이 짝을 이룬 예제의 대규모 데이터셋에 대한 학습을 통해, 모델은 "고양이" 이미지의 벡터 표현을 "고양이"라는 단어의 텍스트 임베딩과 정렬하는 법을 배웁니다.

다음은 이러한 통합을 가능하게 하는 몇 가지 핵심 아키텍처 개념입니다:

  • Transformer Architecture: 많은 멀티모달 시스템은 attention mechanisms을 활용하여 서로 다른 입력 부분의 중요도를 동적으로 가중하는 트랜스포머를 사용합니다. 이를 통해 모델은 텍스트 프롬프트의 관련 단어에 해당하는 특정 이미지 영역에 집중할 수 있으며, 이는 선구적인 연구 논문 "Attention Is All You Need"에 자세히 설명되어 있는 개념입니다.
  • 데이터 융합(Data Fusion): 이는 서로 다른 소스의 정보를 결합하는 전략을 말합니다. Sensor fusion은 원본 데이터를 병합하여 조기에 이루어질 수도 있고, 개별 하위 모델의 결합을 통해 나중에 이루어질 수도 있습니다. PyTorch와 같은 최신 프레임워크는 이러한 복잡한 파이프라인을 구축하는 데 필요한 유연성을 제공합니다.
  • 대조 학습(Contrastive Learning): OpenAI's CLIP과 같은 모델이 사용하는 기법은 벡터 공간에서 일치하는 텍스트-이미지 쌍 사이의 거리를 최소화하는 동시에 일치하지 않는 쌍 사이의 거리를 최대화하도록 시스템을 학습시킵니다.

실제 애플리케이션 사례#

멀티모달 모델은 단일 모달리티 시스템으로는 달성하기 어려웠던 기능들을 가능하게 했습니다.

  • Visual Question Answering (VQA): 이러한 시스템을 사용하면 사용자가 이미지에 대한 자연어 질문을 할 수 있습니다. 예를 들어, 시각 장애가 있는 사용자가 팬트리 사진을 업로드하고 "맨 위 칸에 스프 통조림이 있나요?"라고 물을 수 있습니다. 모델은 object detection을 사용하여 항목을 식별하고 NLP를 사용하여 쿼리를 이해하여 유용한 응답을 제공합니다.
  • Autonomous Vehicles: 자율주행차는 실시간 멀티모달 에이전트로 작동합니다. 카메라의 시각적 피드, LiDAR의 심도 정보, 레이더의 속도 데이터를 결합합니다. 이 중복성은 한 센서가 날씨로 인해 방해를 받더라도 다른 센서가 road safety를 유지할 수 있도록 보장합니다.
  • 오픈 어휘 감지(Open-Vocabulary Detection): Ultralytics YOLO-World와 같은 모델을 사용하면 사용자가 고정된 클래스 목록 대신 임의의 텍스트 프롬프트를 사용하여 객체를 감지할 수 있습니다. 이는 언어적 명령과 시각적 인식 사이의 격차를 해소합니다.

예시: 오픈 어휘 탐지#

다음 예제는 ultralytics 라이브러리를 사용하여 모델이 텍스트 프롬프트를 해석하여 이미지 속 객체를 식별하는 오픈 어휘 감지를 수행하는 방법을 보여줍니다:

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])

# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Visualize the detection results
results[0].show()

관련 용어와의 차이점#

AI 용어 사전에서 "멀티모달 모델"을 관련 개념과 구별하는 것은 유용합니다:

  • Multi-Modal Learning: 이는 이러한 시스템을 학습시키는 데 사용되는 프로세스machine learning (ML) 기법을 말합니다. 멀티모달 모델은 그 학습 프로세스의 결과물인 아티팩트 또는 소프트웨어 제품입니다.
  • Large Language Models (LLMs): 기존 LLM은 텍스트만 처리합니다. 많은 모델이 시각-언어 모델(VLM)로 진화하고 있지만, 표준 LLM은 단일 모달입니다.
  • Foundation Models: 이는 많은 다운스트림 작업에 적응할 수 있는 대규모 모델을 설명하는 더 넓은 범주입니다. 멀티모달 모델은 종종 파운데이션 모델이지만, 모든 파운데이션 모델이 여러 모달리티를 처리하는 것은 아닙니다.

멀티모달 AI의 미래#

이 분야는 오디오, 비디오, 텍스트의 연속적인 스트림을 실시간으로 처리할 수 있는 시스템을 향해 빠르게 발전하고 있습니다. Google DeepMind와 같은 조직의 연구는 기계 지각의 한계를 계속해서 넓혀가고 있습니다. Ultralytics에서는 YOLO26과 같은 고성능 비전 백본으로 이 생태계를 지원합니다. 2026년에 출시된 YOLO26은 instance segmentation과 같은 작업을 위해 뛰어난 속도와 정확도를 제공하며, 더 큰 멀티모달 파이프라인에서 효율적인 시각적 컴포넌트 역할을 합니다. 개발자는 통합된 Ultralytics Platform을 사용하여 이러한 복잡한 워크플로의 데이터, 학습 및 배포를 관리할 수 있습니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.