YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Image Captioning

이미지 캡셔닝이 비전-언어 모델을 사용하여 이미지 설명을 생성하는 방법을 배우고, 실제 활용 사례를 살펴보며, Ultralytics YOLO26을 통해 캡션을 그라운딩하는 방법을 확인해 보세요.

이미지 캡셔닝은 이미지의 자연어 설명을 자동으로 생성하는 AI 태스크입니다. 예를 들어 거리 사진이 주어지면 시스템은 “교차로에서 보행자들을 지나쳐 도시 버스가 운행 중입니다.”와 같은 설명을 생성할 수 있습니다. 이 태스크는 시각적 인식과 언어 생성을 결합하므로, 모델은 중요한 콘텐츠를 식별하고 객체 간의 관계를 이해하며 해당 정보를 명확하게 표현해야 합니다.

캡셔닝은 일반적으로 시각 데이터와 텍스트 데이터를 모두 처리하는 vision-language model에 의해 수행됩니다. 수동으로 작성된 사진 설명과 달리, AI가 생성한 캡셔닝은 이미지-텍스트 쌍에서 학습된 패턴을 기반으로 하는 예측입니다.

이미지 캡셔닝의 작동 방식#

이미지 캡셔닝 시스템은 일반적으로 연결된 두 단계로 구성됩니다.

  1. **비전 인코더(vision encoder)**는 픽셀을 객체, 텍스처, 위치 및 광범위한 장면 정보를 설명하는 피처 표현으로 변환합니다.
  2. **언어 디코더(language decoder)**는 이러한 시각적 피처를 일련의 단어로 변환합니다.

많은 시스템이 transformer 디코더를 사용합니다. 이 디코더는 시작 토큰으로 시작하여 다음 토큰을 예측하고, 이를 시퀀스에 추가한 뒤, 종료 토큰이 생성되거나 길이 제한에 도달할 때까지 이 과정을 반복합니다. Google Machine Learning Glossary에서는 이 토큰 단위 프로세스를 자기 회귀 생성(autoregressive generation)으로 설명합니다.

attention mechanism은 디코더가 각 단어를 선택하는 동안 관련 이미지 영역에 집중할 수 있도록 돕습니다. “버스”를 생성할 때는 차량을 강조할 수 있고, “거리”를 생성할 때는 주변 도로에 주의를 기울일 수 있습니다. TensorFlow image captioning tutorial은 이미지 피처, 토큰화, 크로스 어텐션, 텍스트 디코더가 어떻게 조화를 이루는지 보여줍니다.

훈련에는 일반적으로 사람이 작성한 하나 이상의 캡션이 포함된 이미지가 필요합니다. 동일한 이미지를 “아이와 놀고 있는 강아지” 및 “반려동물을 위해 공을 던지는 젊은이”와 같이 다양한 방식으로 올바르게 설명할 수 있으므로 여러 개의 캡션이 유용합니다.

관련 비전 태스크와의 차이점#

이미지 캡셔닝은 여러 AI 태스크와 겹치지만 고유한 출력을 생성합니다.

  • **이미지 분류(Image classification)**는 “해변”과 같이 전체 이미지에 하나 이상의 레이블을 할당합니다. 캡셔닝은 객체, 작업, 속성 및 컨텍스트를 설명할 수 있는 문장을 생성합니다.
  • **Object detection**은 경계 상자(bounding box)로 미리 정의된 객체를 식별하고 지역화합니다. 캡셔닝은 이러한 객체를 언급할 뿐만 아니라 “자동차 옆에서 자전거를 타는 두 명의 사이클리스트”와 같은 관계도 설명합니다.
  • **Optical character recognition**은 표지판, 문서 또는 포장에서 보이는 텍스트를 추출합니다. 캡셔닝은 모든 텍스트를 전사하기보다는 장면을 요약합니다.
  • **Visual question answering**은 이미지에 대한 구체적인 질문에 답합니다. 캡셔닝은 질문을 요구하지 않고 일반적인 설명을 만듭니다.
  • **대체 텍스트(Alt text)**는 특정 컨텍스트에서 이미지의 목적을 전달합니다. 자동화된 캡션은 초안을 제공할 수 있지만, 장식적, 기능적 및 복잡한 이미지는 W3C Images Tutorial에 따라 다른 처리가 필요하므로 자동으로 적절한 대체 텍스트가 되지는 않습니다.

실제 애플리케이션 사례#

  • Accessible Web Content: 퍼블리싱 플랫폼은 새로 업로드된 사진에 대한 초안 설명을 생성할 수 있습니다. 뉴스 이미지의 경우, 편집자가 정확성과 관련성을 검토하기 전에 캡션을 통해 주요 인물, 배경 및 작업을 식별할 수 있습니다. 복잡한 다이어그램의 경우 일반적인 시각적 요약보다는 구조화된 긴 설명이 여전히 필요합니다.

  • Searchable Media Libraries: 소매업체나 미디어 회사는 대규모 이미지 컬렉션에 캡션을 달고 생성된 텍스트를 색인화할 수 있습니다. 사용자는 파일에 수동으로 태그가 지정되지 않은 경우에도 “텐트 옆의 빨간색 배낭”과 같은 구문을 검색할 수 있습니다. 캡션은 시각적 임베딩과 메타데이터를 보완하여 대규모 카탈로그 전반의 검색 용이성을 향상합니다.

Ultralytics YOLO를 활용한 실용적인 그라운딩(Grounding)#

캡션 생성기는 특히 복잡하거나 친숙하지 않은 장면에서 지원되지 않는 세부 정보를 만들어낼 수 있습니다. 한 가지 실용적인 설계 방법은 Ultralytics YOLO26의 구조화된 관찰을 통해 생성을 그라운딩하는 것입니다. 다음의 문서화된 YOLO prediction workflow는 다운스트림 언어 구성 요소가 시각적 컨텍스트로 사용할 수 있는 감지된 객체 이름을 추출합니다.

from ultralytics import YOLO

# Detect objects that can ground a downstream caption generator
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact textual context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

이 워크플로는 최종 캡션을 생성하지 않습니다. 대신 언어 모델을 제약할 수 있는 검증 가능한 객체 레이블을 제공합니다. 커스텀 도메인의 경우, Ultralytics Platform은 캡셔닝 파이프라인의 인식 구성 요소를 위한 클라우드 데이터셋 주석, 훈련, 배포 및 모니터링을 지원합니다.

제한 사항 및 평가#

캡션은 중요한 객체를 누락하거나, 관계를 혼동하거나, 데이터셋 편향을 재현하거나, 보이지 않는 세부 정보를 환각(hallucination)할 수 있습니다. Azure image description API에서 볼 수 있듯이 신뢰도 점수는 후보 설명을 순위화하는 데 도움이 될 수 있지만, 유창한 문장이 반드시 사실인 것은 아닙니다.

따라서 평가는 객체 커버리지, 사실적 그라운딩, 가독성, 편향, 그리고 의도된 청중에 대한 유용성을 조사해야 합니다. 여러 캡션이 모두 정확할 수 있으므로 팀은 generative AI evaluation 및 광범위한 NIST AI Risk Management Framework와 같은 관행에 따라 자동화된 측정값과 인간의 검토를 결합해야 합니다. 인간의 승인은 접근성, 의료, 안전이 중요한 콘텐츠 또는 대중 공개용 콘텐츠에 특히 중요합니다.

Explore solutions

Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.