YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Multi-Modal Model

멀티모달 모델이 텍스트, 이미지, 오디오를 통합하는 방식을 살펴보세요. Ultralytics YOLO26과 같은 아키텍처를 알아보고 Ultralytics Platform에서 비전 AI를 배포하는 방법을 살펴보세요.

멀티모달 모델은 여러 가지 서로 다른 데이터 유형, 즉 "모달리티"의 정보를 동시에 처리하고 해석하며 통합할 수 있는 고급 인공지능 (AI) 시스템입니다. 기존의 단일 모달리티 시스템이 텍스트를 위한 자연어 처리 (NLP)나 이미지를 위한 컴퓨터 비전 (CV)처럼 하나의 영역에 특화되는 반면, 멀티모달 모델은 시각적, 청각적, 언어적 단서를 함께 종합하여 인간의 지각을 모방하는 것을 목표로 합니다. 이러한 융합을 통해 모델은 세상에 대한 포괄적인 이해를 형성하고, 시각적 장면과 음성 설명 사이의 복잡한 상관관계를 도출할 수 있습니다. 이러한 기능은 일반 인공지능 (AGI) 구현을 향한 기반 단계로 간주됩니다.

핵심 메커니즘 및 아키텍처#

멀티모달 모델의 효율성은 다양한 데이터 유형을 공유 의미 공간에 매핑하는 능력에 달려 있습니다. 이 과정은 일반적으로 입력 데이터의 핵심 의미를 포착하는 수치 표현인 임베딩을 생성하는 것에서 시작합니다. 모델은 자막이 포함된 동영상과 같은 대규모 쌍 데이터셋으로 학습하면서 "고양이" 이미지의 벡터 표현과 "고양이"라는 단어의 텍스트 임베딩을 정렬하는 방법을 학습합니다.

몇 가지 주요 아키텍처 개념이 이러한 통합을 가능하게 합니다:

  • Transformer 아키텍처: 많은 멀티모달 시스템은 어텐션 메커니즘을 사용하여 서로 다른 입력 부분의 중요도에 동적으로 가중치를 부여하는 Transformer를 활용합니다. 이를 통해 모델은 텍스트 프롬프트의 관련 단어에 해당하는 특정 이미지 영역에 집중할 수 있으며, 이 개념은 기념비적인 연구 논문 "Attention Is All You Need"에 자세히 설명되어 있습니다.
  • 데이터 융합: 서로 다른 소스의 정보를 결합하는 전략을 의미합니다. 센서 융합은 원시 데이터를 병합하는 방식으로 초기에 수행하거나, 별도의 하위 모델이 내린 결정을 결합하는 방식으로 나중에 수행할 수 있습니다. PyTorch와 같은 최신 프레임워크는 이러한 복잡한 파이프라인을 구축하는 데 필요한 유연성을 제공합니다.
  • 대조 학습: OpenAI의 CLIP과 같은 모델에서 사용하는 기법으로, 벡터 공간에서 일치하는 텍스트-이미지 쌍 사이의 거리는 최소화하고 일치하지 않는 쌍 사이의 거리는 최대화하도록 시스템을 학습시킵니다.

실제 적용 사례#

멀티모달 모델은 단일 모달리티 시스템으로는 이전에 구현할 수 없었던 기능을 가능하게 했습니다.

  • 시각적 질의응답 (VQA): 이러한 시스템을 사용하면 사용자가 이미지에 관해 자연어로 질문할 수 있습니다. 예를 들어 시각 장애가 있는 사용자가 식료품 저장실 사진을 업로드하고 "맨 위 선반에 수프 캔이 있나요?"라고 물을 수 있습니다. 모델은 객체 감지를 사용하여 물품을 식별하고 NLP를 사용하여 질의를 이해한 다음 유용한 응답을 제공합니다.
  • 자율주행 차량: 자율주행 자동차는 실시간 멀티모달 에이전트로 작동합니다. 카메라의 시각적 피드, LiDAR의 깊이 정보, 레이더의 속도 데이터를 결합합니다. 이러한 중복성 덕분에 한 센서가 날씨로 인해 가려지더라도 다른 센서가 도로 안전을 유지할 수 있습니다.
  • 개방형 어휘 감지: Ultralytics YOLO-World와 같은 모델을 사용하면 고정된 클래스 목록이 아니라 임의의 텍스트 프롬프트를 사용하여 객체를 감지할 수 있습니다. 이를 통해 언어 명령과 시각적 인식 사이의 간극을 좁힐 수 있습니다.

예시: 개방형 어휘 감지#

다음 예시는 ultralytics 라이브러리를 사용하여 개방형 어휘 감지를 수행하는 방법을 보여줍니다. 이때 모델은 텍스트 프롬프트를 해석하여 이미지 속 객체를 식별합니다:

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])

# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Visualize the detection results
results[0].show()

관련 용어와의 차이점#

AI 용어집에서 "멀티모달 모델"을 관련 개념과 구분하는 것이 도움이 됩니다:

  • 멀티모달 학습: 이러한 시스템을 학습시키는 데 사용되는 과정머신 러닝 (ML) 기법을 의미합니다. 멀티모달 모델은 해당 학습 과정에서 만들어진 결과물 또는 소프트웨어 제품입니다.
  • 대규모 언어 모델 (LLMs): 기존 LLM은 텍스트만 처리합니다. 많은 LLM이 비전-언어 모델 (VLM)로 발전하고 있지만, 표준 LLM은 단일 모달리티입니다.
  • 파운데이션 모델: 다양한 다운스트림 작업에 적용할 수 있는 대규모 모델을 설명하는 더 광범위한 범주입니다. 멀티모달 모델은 파운데이션 모델인 경우가 많지만, 모든 파운데이션 모델이 여러 모달리티를 처리하는 것은 아닙니다.

멀티모달 AI의 미래#

이 분야는 오디오, 비디오, 텍스트의 연속 스트림을 실시간으로 처리할 수 있는 시스템을 향해 빠르게 발전하고 있습니다. Google DeepMind와 같은 조직의 연구는 머신 인식의 한계를 계속해서 확장하고 있습니다. Ultralytics는 YOLO26과 같은 고성능 비전 백본을 통해 이 생태계를 지원합니다. 2026년에 출시된 YOLO26은 인스턴스 세그멘테이션과 같은 작업에서 뛰어난 속도와 정확도를 제공하며, 더 큰 멀티모달 파이프라인에서 효율적인 시각 구성 요소로 활용됩니다. 개발자는 통합된 Ultralytics Platform을 사용하여 이러한 복잡한 워크플로의 데이터, 학습 및 배포를 관리할 수 있습니다.

Explore solutions

로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요