Ultralytics YOLO27:
Ultralytics 용어집으로 돌아가기

Multimodal AI

멀티모달 AI와 텍스트 및 비전을 통합하여 컨텍스트를 인식하는 이해를 구현하는 방법을 살펴보세요. 지금 Ultralytics YOLO26 및 오픈 보캐뷸러리 모델을 사용하는 방법을 알아보세요.

멀티모달 AI는 여러 가지 서로 다른 유형의 데이터, 즉 "모달리티"에서 정보를 동시에 처리하고 해석하며 종합하도록 설계된 정교한 인공지능 (AI) 시스템을 의미합니다. 텍스트를 처리하는 자연어 처리 (NLP)나 이미지를 처리하는 컴퓨터 비전 (CV)처럼 단일 입력 소스에 특화된 기존의 단일 모달리티 시스템과 달리, 멀티모달 AI는 다양한 데이터 스트림을 통합하여 인간의 지각을 모방합니다. 이러한 통합에는 시각 데이터(이미지, 비디오)와 언어 데이터(텍스트, 음성 오디오), 감각 정보(LiDAR, 레이더, 열 데이터)를 결합하는 작업이 포함될 수 있습니다. 이러한 결합된 입력을 활용함으로써 모델은 복잡한 실제 시나리오를 더욱 깊이 있고 맥락을 고려하여 이해할 수 있으며, 인공 일반 지능 (AGI)의 폭넓은 역량에 한층 가까워집니다.

멀티모달 시스템의 작동 방식#

멀티모달 AI의 핵심 강점은 서로 다른 데이터 유형을 비교하고 결합할 수 있는 공유 수학적 공간에 매핑하는 능력에 있습니다. 이 과정은 일반적으로 인코딩, 정렬, 융합이라는 세 가지 주요 단계로 구성됩니다.

  1. 특징 추출: 특화된 신경망은 각 모달리티를 독립적으로 처리하여 주요 패턴을 식별합니다. 예를 들어 합성곱 신경망 (CNN)은 사진에서 시각적 특징을 추출하고, Transformer는 함께 제공된 캡션을 처리할 수 있습니다.

  2. 정렬 및 임베딩: 추출된 특징은 고차원 수치 벡터로 변환됩니다. 모델은 이러한 벡터를 정렬하는 방법을 학습하여 의미적으로 유사한 개념(예: 고양이 이미지와 "cat"이라는 텍스트 단어)이 벡터 공간에서 서로 가까운 위치에 오도록 합니다. 이는 대조 학습과 같은 기법을 통해 달성되는 경우가 많으며, OpenAI의 CLIP과 같은 모델에서 널리 활용되었습니다.

  3. 데이터 융합: 시스템은 고급 융합 기법을 사용하여 정렬된 데이터를 결합합니다. 최신 아키텍처는 어텐션 메커니즘을 사용하여 맥락에 따라 한 모달리티가 다른 모달리티보다 중요한 정도를 동적으로 조정합니다. 이를 통해 이미지가 모호할 때는 모델이 텍스트에 집중하고, 그 반대의 경우도 가능해집니다.

실제 적용 사례#

멀티모달 AI는 단일 모달리티 시스템으로는 이전에 불가능했던 기능을 구현하여 다양한 산업 분야의 혁신을 이끌고 있습니다.

  • 시각 질의응답 (VQA): 이 애플리케이션에서는 사용자가 AI에 이미지를 제시하고 이미지에 관한 자연어 질문을 할 수 있습니다. 예를 들어 시각 장애가 있는 사용자가 식료품 저장실 사진을 업로드하고 "파스타가 남아 있나요?"라고 물을 수 있습니다. 모델은 시각적 콘텐츠와 텍스트 질의를 처리하여 구체적인 답변을 제공합니다.
  • 자율주행 차량: 자율주행 자동차는 카메라, LiDAR 포인트 클라우드, 레이더의 데이터를 결합하는 멀티모달 입력에 크게 의존하여 안전하게 주행합니다. 이러한 중복성 덕분에 한 센서에 장애가 발생하더라도(예: 햇빛 눈부심으로 카메라가 작동하지 않는 경우) 다른 센서가 자동차공학회 (SAE)에서 정의한 안전 기준을 유지할 수 있습니다.
  • 의료 진단: 고급 의료 AI 시스템은 비정형 환자 병력 및 유전 데이터와 함께 의료 영상 분석(예: MRI 또는 X선)을 분석합니다. 이러한 종합적인 관점은 의사가 더욱 정확한 진단을 내리는 데 도움을 주며, Nature Digital Medicine에서 자주 논의되는 주제이기도 합니다.
  • 생성형 AI: Stable Diffusion과 같이 텍스트 프롬프트로 이미지를 생성하는 도구는 언어적 설명과 시각적 질감 간의 관계를 이해하는 모델의 능력에 전적으로 의존합니다.

Ultralytics를 활용한 오픈 보캐뷸러리 탐지#

표준 객체 탐지기는 미리 정의된 카테고리 목록에 의존하지만, YOLO-World와 같은 멀티모달 접근 방식은 사용자가 오픈 보캐뷸러리 텍스트 프롬프트를 사용하여 객체를 탐지할 수 있도록 합니다. 이를 통해 Ultralytics 생태계에서 언어 명령과 시각적 인식 사이의 간극을 해소합니다.

다음 예제에서는 ultralytics 라이브러리를 사용하여 오픈 보캐뷸러리 탐지를 수행하는 방법을 보여줍니다. 여기서 모델은 사용자 지정 텍스트 입력을 기반으로 객체를 탐지합니다.

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

관련 용어 구분#

최신 머신 러닝의 흐름을 이해하려면 "멀티모달 AI"를 관련 개념과 구분하는 것이 도움이 됩니다.

  • 멀티모달 학습: 혼합된 데이터 유형으로 알고리즘을 학습시키는 학문 분야이자 방법론을 의미합니다. "멀티모달 AI"는 일반적으로 실제 애플리케이션 또는 그 결과로 생성된 시스템 자체를 의미합니다.
  • 대규모 언어 모델 (LLMs): 기존 LLMs는 단일 모달리티이며 텍스트 데이터만을 사용해 학습됩니다. 그러나 업계는 이미지와 텍스트를 기본적으로 처리할 수 있는 "대규모 멀티모달 모델"(LMMs)로 전환하고 있으며, 이러한 추세는 PyTorchTensorFlow와 같은 프레임워크의 지원을 받고 있습니다.
  • 특화된 비전 모델: 최첨단 Ultralytics YOLO26과 같은 모델은 시각적 작업에 고도로 특화된 전문가입니다. 범용 멀티모달 모델이 장면을 전반적으로 설명할 수 있는 반면, 특화된 모델은 고속의 정밀한 객체 탐지와 엣지 하드웨어에서의 실시간 처리에 탁월합니다.

향후 전망#

멀티모달 AI의 발전 방향은 더욱 뛰어난 추론 능력을 갖춘 시스템을 가리키고 있습니다. 언어를 시각적·물리적 현실에 성공적으로 접목함으로써 이러한 모델은 통계적 상관관계를 넘어 진정한 이해에 가까워지고 있습니다. Google DeepMindStanford Center for Research on Foundation Models와 같은 기관의 연구는 기계가 복잡한 환경을 인식하는 방식의 한계를 계속해서 확장하고 있습니다.

Ultralytics는 이러한 발전을 Ultralytics Platform에 통합하여 사용자가 데이터를 관리하고, 모델을 학습시키며, 사용 가능한 모든 모달리티를 폭넓게 활용하는 솔루션을 배포할 수 있도록 지원합니다. 이를 통해 YOLO26의 속도와 멀티모달 입력의 유연성을 결합할 수 있습니다.

Explore solutions

항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요