YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Vision Language Model (VLM)

Ultralytics와 함께 비전 언어 모델(VLM)을 탐색합니다. Ultralytics YOLO26을 사용하여 VQA 및 오픈 어휘 감지를 위해 컴퓨터 비전과 LLM을 연결하는 방법을 배웁니다.

시각 언어 모델(VLM)은 시각적 정보(이미지 또는 비디오)와 텍스트 정보를 동시에 처리하고 해석할 수 있는 인공지능의 한 형태입니다. 픽셀 데이터에만 초점을 맞추는 전통적인 computer vision 모델이나 텍스트만 이해하는 Large Language Models (LLMs)와 달리, VLM은 이 두 가지 모달리티 간의 간격을 메워줍니다. 이미지와 텍스트 쌍을 포함하는 대규모 데이터셋으로 학습함으로써, 이 모델들은 시각적 특징을 언어적 개념과 연관시키는 법을 배우며, 이를 통해 이미지를 설명하고, 시각적 장면에 대한 질문에 답하며, "보는" 것을 바탕으로 명령을 실행할 수도 있습니다.

비전 언어 모델의 작동 원리#

핵심적으로 VLM은 일반적으로 비전 인코더와 텍스트 인코더라는 두 가지 주요 구성 요소로 이루어져 있습니다. 비전 인코더는 이미지를 처리하여 feature maps과 시각적 표현을 추출하고, 텍스트 인코더는 언어적 입력을 처리합니다. 이어서 이들 고유의 데이터 스트림은 cross-attention과 같은 메커니즘을 사용하여 융합됨으로써 공유 임베딩 공간에서 시각적 정보와 텍스트 정보를 정렬합니다.

2024년과 2025년의 최근 발전은 단일 Transformer 백본이 두 모달리티를 모두 처리하는 보다 통합된 아키텍처로 이동했습니다. 예를 들어, Google PaliGemma 2와 같은 모델들은 이러한 스트림을 얼마나 효과적으로 통합하는지가 복잡한 추론 작업에서 성능을 향상시킬 수 있는지를 보여줍니다. 이러한 정렬을 통해 모델은 "apple"이라는 단어가 식료품점 이미지에서는 과일을 의미하지만 로고에서는 기술 기업을 의미한다는 것을 인식하는 것과 같은 맥락을 이해할 수 있습니다.

실제 애플리케이션 사례#

시각과 언어를 통해 세상을 이해하는 능력은 다양한 산업 전반에 걸쳐 폭넓은 애플리케이션을 가능하게 합니다:

  • 시각적 질의응답(VQA): VLM은 방사선 전문의를 돕기 위해 healthcare diagnostics에서 광범위하게 사용됩니다. 의사가 시스템에 "이 엑스레이에 골절이 있습니까?"라고 물어보면, 모델이 의료용 이미지를 분석하여 예비 평가를 제공함으로써 진단 오류를 줄여줍니다.
  • 스마트 이커머스 검색: retail environments에서 VLM을 사용하면 사용자가 이미지와 결합된 자연어 설명을 사용하여 제품을 검색할 수 있습니다. 쇼퍼가 유명인의 의상 사진을 업로드하고 "이 패턴이지만 파란색인 드레스를 찾아줘"라고 요청하면, 시스템은 semantic search를 사용하여 정확한 일치 항목을 검색합니다.
  • 자동 캡션 및 접근성: VLM은 웹상의 이미지에 대한 설명용 alt text를 자동으로 생성하여, 스크린 독자에 의존하는 시각 장애인 사용자가 디지털 콘텐츠에 더 쉽게 접근할 수 있도록 합니다.

VLM과 관련 개념의 차이점#

VLM의 구체적인 역할을 이해하기 위해 다른 AI 범주와 구분하는 것이 도움이 됩니다:

  • VLM vs. LLM: Large Language Model (GPT-4 텍스트 전용 버전 등)은 텍스트 데이터만 처리합니다. 창의적인 스토리나 코드를 생성할 수는 있지만 이미지를 "볼" 수는 없습니다. VLM은 LLM에 효과적으로 눈을 부여합니다.
  • VLM vs. 객체 검출: 초기 YOLO 버전과 같은 전통적인 object detection 모델은 객체가 어디에 있고 어떤 클래스에 속하는지 식별합니다(예: "Car: 99%"). VLM은 "소화전 옆에 주차된 빨간색 스포츠카"와 같은 관계와 속성을 이해함으로써 한 걸음 더 나아갑니다.
  • VLM vs. 멀티모달 AI: Multimodal AI는 더 광범위한 상위 개념입니다. 모든 VLM은 멀티모달(시각과 언어 결합)이지만, 모든 멀티모달 모델이 VLM인 것은 아닙니다. 일부는 언어 구성 요소 없이 오디오와 텍스트(음성-텍스트 변환 등) 또는 비디오와 센서 데이터를 결합할 수 있습니다.

YOLO를 사용한 오픈 어휘(Open-Vocabulary) 탐지#

최신 VLM은 미리 정의된 클래스 대신 자유 형식의 텍스트 프롬프트를 사용하여 객체를 검출할 수 있는 "개방형 어휘(open-vocabulary)" 검출을 가능하게 합니다. 이는 Ultralytics YOLO-World와 같은 모델의 핵심 기능으로, 재학습 없이 동적인 클래스 정의를 허용합니다.

다음 예제는 ultralytics 패키지를 사용하여 텍스트로 설명된 특정 객체를 검출하는 방법을 보여줍니다.

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

도전 과제 및 향후 방향#

강력하기는 하지만, 시각 언어 모델은 상당한 과제에 직면해 있습니다. 주요 문제 중 하나는 hallucination로, 모델이 실제로 존재하지 않는 이미지 속 객체나 텍스트를 자신 있게 설명하는 현상입니다. 연구자들은 접지력과 정확도를 향상시키기 위해 Reinforcement Learning from Human Feedback (RLHF)와 같은 기술을 적극적으로 연구하고 있습니다.

또 다른 과제는 계산 비용입니다. 이러한 대규모 모델을 학습하려면 상당한 GPU resources가 필요합니다. 그러나 Ultralytics YOLO26과 같은 효율적인 아키텍처의 등장은 엣지 디바이스에 고급 비전 기능을 제공하는 데 도움을 주고 있습니다. 앞으로 우리는 VLM이 robotic agents에서 중추적인 역할을 담당하여 로봇이 복잡한 언어 지침에 따라 객체를 탐색하고 조작할 수 있게 될 것으로 기대합니다.

이론적 기초에 관심이 있는 분들을 위해, OpenAI의 원본 CLIP paper by OpenAI는 대조 학습 기반의 언어-이미지 사전 학습에 대한 훌륭한 통찰력을 제공합니다. 또한 이러한 아키텍처의 급격한 진화를 추적하기 위해서는 CVPR conference papers를 지속적으로 확인하는 것이 필수적입니다. 자신만의 비전 모델 학습을 실험하려면 간소화된 데이터셋 관리 및 모델 배포를 위해 Ultralytics Platform을 활용할 수 있습니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.