YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Visual Question Answering (VQA)

CV와 NLP의 교차점에 있는 시각적 질의응답(VQA)을 탐색합니다. Ultralytics YOLO26이 실시간 애플리케이션 및 멀티모달 AI를 위해 VQA를 어떻게 구동하는지 배웁니다.

시각적 질의 응답(Visual Question Answering, VQA)은 컴퓨터 비전(Computer Vision, CV)자연어 처리(Natural Language Processing, NLP)의 교차점에 위치한 고도화된 인공지능 작업입니다. 사진에 단일 레이블을 할당하는 전통적인 이미지 분류와 달리, VQA 시스템은 이미지의 시각적 내용에 대한 개방형 자연어 질문에 답변하도록 설계되었습니다. 예를 들어, 부엌 사진이 주어졌을 때 사용자는 "가스가 켜져 있나요?" 또는 "볼에 사과가 몇 개 있나요?"라고 물을 수 있습니다. 정확하게 답변하기 위해 모델은 텍스트의 의미론을 이해하고, 장면 내에서 관련 객체를 식별하며, 그 속성과 공간적 관계를 추론해야 합니다.

이러한 기능 덕분에 VQA는 이질적인 데이터 유형의 동시 처리가 필요하므로 현대 멀티모달 AI의 핵심 구성 요소가 됩니다. 아키텍처는 일반적으로 합성곱 신경망(Convolutional Neural Network, CNN)이나 비전 트랜스포머(Vision Transformer, ViT) 같은 비전 인코더를 사용하여 이미지에서 특징을 추출하고, 텍스트 인코더를 통해 언어적 쿼리를 처리합니다. 고도화된 시스템은 어텐션 메커니즘(attention mechanism)을 활용하여 텍스트 개념을 이미지의 특정 영역과 정렬함으로써, AI가 답변을 생성하기 전에 사진의 관련 부분을 "볼" 수 있도록 합니다.

실제 활용 사례 및 중요성#

시각 데이터를 동적으로 질의하는 능력은 다양한 산업 전반에 걸쳐 혁신적인 애플리케이션을 이끌어내어 자동화 및 접근성을 향상시켰습니다.

  • 보조 기술: VQA는 시각장애인을 지원하는 애플리케이션에 매우 중요합니다. Be My Eyes 같은 도구는 VQA를 활용하여 사용자가 주변 환경의 사진을 찍고 "이 병은 샴푸인가요, 컨디셔너인가요?" 또는 "길을 건너도 안전한가요?" 같은 질문을 할 수 있도록 합니다. 이는 시각 정보를 청각적 답변으로 변환하여 더 큰 독립성을 촉진합니다.
  • 의료 진단: 의료 분야의 AI 분야에서 VQA 시스템은 의료 이미지를 분석하여 방사선 전문의를 지원합니다. 의료진은 X선에 대해 "왼쪽 상단 사분면에 골절의 흔적이 있습니까?"와 같은 질문으로 시스템에 쿼리를 보낼 수 있습니다. 미국 국립보건원(NIH)의 연구원들은 임상 의사결정을 간소화하고 진단 오류를 줄이기 위해 VQA를 연구해 왔습니다.
  • 지능형 감시: 현대 보안 시스템은 보안을 위한 AI를 활용하여 몇 시간 분량의 비디오 영상을 분석합니다. 수동 검토 대신 운영자는 "자정 이후에 빨간색 트럭이 하역장에 들어왔습니까?"라고 물을 수 있습니다. VQA는 일반적인 모션 알림 대신 특정 기준에 따른 신속한 이상 감지(anomaly detection)를 가능하게 합니다.

VQA에서 객체 탐지의 역할#

일부 VQA 모델은 엔드투엔드로 학습되지만, 많은 모델은 먼저 장면 요소를 식별하기 위해 강력한 객체 감지(object detection) 백본에 의존합니다. 객체를 정확하게 찾는 것은 추론 엔진에 필요한 컨텍스트를 제공합니다. Ultralytics YOLO26 모델은 높은 정확도와 실시간 성능 덕분에 이러한 파이프라인의 훌륭한 기반 역할을 합니다.

예를 들어, 개발자는 YOLO26을 사용하여 객체 클래스와 바운딩 박스를 추출한 다음, 이를 거대 언어 모델(LLM) 또는 특화된 추론 모듈에 입력하여 사용자 쿼리에 답변할 수 있습니다. 이러한 감지 백본을 학습하기 위한 데이터셋 관리는 어노테이션과 클라우드 학습을 단순화하는 Ultralytics Platform을 사용하여 간소화되는 경우가 많습니다.

다음 Python 예제는 Ultralytics YOLO26을 사용하여 이미지에서 시각적 컨텍스트(객체 및 위치)를 추출하는 방법을 보여줍니다. 이는 VQA 워크플로의 첫 번째 단계입니다.

from ultralytics import YOLO

# Load the YOLO26 model (latest generation)
model = YOLO("yolo26n.pt")

# Run inference to detect objects, providing context for VQA
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display detected classes (e.g., 'bus', 'person') to verify scene understanding
for result in results:
    result.show()  # Visualize the detections

관련 개념과 VQA의 차이점#

VQA의 고유한 범위를 이해하기 위해 유사한 비전-언어 작업과 VQA를 구별하는 것이 도움이 됩니다.

  • VQA 대 이미지 캡셔닝: 이미지 캡셔닝(Image captioning)은 전체 이미지에 대한 일반적이고 정적인 설명(예: "공원에서 노는 강아지")을 생성합니다. VQA는 대화형이며 구체적이며, 광범위한 요약보다는 사용자의 질문에 타겟팅된 응답을 제공합니다.
  • VQA 대 시각적 그라운딩: 시각적 그라운딩(Visual grounding)은 텍스트 구에 언급된 특정 객체 주위에 바운딩 박스(bounding box)를 그려 해당 객체를 찾는 데 중점을 둡니다. VQA는 발견된 객체의 속성, 작업 또는 수량을 분석하여 한 단계 더 나아갑니다.
  • VQA 대 OCR: 광학 문자 판독(OCR)은 엄밀히 말해 이미지에서 텍스트를 추출하기 위한 것이지만, VQA는 "거리 표지판에 뭐라고 써 있나요?"와 같은 질문에 답하기 위해 OCR을 통합할 수 있습니다. 그러나 VQA의 주요 기능에는순 단순히 텍스트를 읽는 것을 넘어선 광범위한 장면 이해가 포함됩니다.

연구원들은 모델이 수백만 개의 이미지-질문 쌍에 걸쳐 일반화하는 데 도움이 되는 VQA Dataset과 같은 대규모 벤치마크를 사용하여 이 분야를 계속 발전시키고 있습니다. 하드웨어가 개선됨에 따라 더 빠른 추론 지연 시간(inference latency)이 가능해져, VQA는 실시간 모바일 및 엣지 애플리케이션에서 점점 더 실용화되고 있습니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.