YOLO Vision 2026:
비전 AI

비전 언어 모델과 그 활용 사례 이해하기

비전 언어 모델이 무엇인지, 어떻게 작동하는지, AI에서 어떻게 활용되는지 알아보세요. 이러한 모델이 시각적 기능과 언어 기능을 어떻게 결합하는지 살펴보세요.

ABAbirami Vina6 min read
이미지와 텍스트 이해를 결합하는 비전 언어 모델

이전 글에서는 GPT-4o가 단어를 사용해 이미지를 이해하고 설명하는 방법을 살펴보았습니다. Google Gemini와 Claude 3 같은 다른 최신 모델에서도 이러한 기능을 확인할 수 있습니다. 오늘은 이 개념을 더 자세히 살펴보고 Vision Language Models가 어떻게 작동하며 시각 데이터와 텍스트 데이터를 어떻게 결합하는지 설명하겠습니다.

이러한 모델은 사진에 대한 상세한 캡션 생성, 이미지 관련 질문에 대한 답변, 텍스트 설명을 기반으로 한 새로운 시각적 콘텐츠 생성 등 다양한 인상적인 작업에 사용할 수 있습니다. Vision Language Models는 시각 정보와 언어 정보를 원활하게 통합하여 기술과 상호작용하고 주변 세계를 이해하는 방식을 바꾸고 있습니다.

비전 언어 모델의 작동 방식#

Vision Language Models(VLMs)을 어디에 사용할 수 있는지 살펴보기 전에, 이것이 무엇이며 어떻게 작동하는지 알아보겠습니다. VLMs는 이미지와 텍스트를 모두 처리하기 위해 비전 모델과 언어 모델의 기능을 결합한 고급 AI 모델입니다. 이러한 모델은 텍스트 설명과 함께 이미지를 입력받고 두 요소를 연결하는 방법을 학습합니다. 모델의 비전 부분은 이미지에서 세부 정보를 추출하고, 언어 부분은 텍스트를 이해합니다. 이러한 협업을 통해 VLMs는 이미지와 텍스트를 모두 이해하고 분석할 수 있습니다.

Vision Language Models의 주요 기능은 다음과 같습니다:

  • 이미지 캡셔닝: 이미지의 내용을 기반으로 설명 텍스트를 생성합니다.
  • 시각적 질의응답(VQA): 이미지의 내용과 관련된 질문에 답변합니다.
  • 텍스트-이미지 생성: 텍스트 설명을 기반으로 이미지를 생성합니다.
  • 이미지-텍스트 검색: 주어진 텍스트 쿼리에 적합한 이미지를 찾고 그 반대의 작업도 수행합니다.
  • 멀티모달 콘텐츠 생성: 이미지와 텍스트를 결합하여 새로운 콘텐츠를 생성합니다.
  • 장면 이해 및객체 감지: 이미지 내 객체와 세부 정보를 식별하고 분류합니다.

비전 언어 모델의 기능 예시

그림 1. 비전 언어 모델의 기능 예시입니다.

다음으로 CLIP, SimVLM, VisualGPT와 같은 잘 알려진 모델에서 사용하는 일반적인 VLM 아키텍처와 학습 기법을 살펴보겠습니다.

대조 학습#

대조 학습은 데이터 포인트 간의 차이를 비교하여 모델이 학습하도록 돕는 기법입니다. 인스턴스 간의 유사성 또는 차이점을 계산하고, 이러한 차이를 측정하는 대조 손실을 최소화하는 것을 목표로 합니다. 특히 소수의 레이블 지정 예제가 모델이 새로운 미지의 데이터에 레이블을 지정하도록 안내하는 반지도 학습에서 유용합니다. 예를 들어 고양이가 어떻게 생겼는지 이해하기 위해 모델은 고양이 이미지 및 개 이미지와 비교합니다. 대조 학습 기법은 얼굴 구조, 신체 크기, 털과 같은 특징을 식별하여 고양이와 개를 구분할 수 있습니다.

대조 학습의 작동 방식 다이어그램

그림 2. 대조 학습의 작동 방식입니다.

CLIP은 대조 학습을 사용하여 텍스트 설명과 이미지를 연결하는 Vision-Language Model입니다. 세 가지 간단한 단계로 작동합니다. 첫째, 텍스트와 이미지를 모두 이해하는 모델 구성 요소를 학습합니다. 둘째, 데이터셋의 범주를 텍스트 설명으로 변환합니다. 셋째, 주어진 이미지와 가장 잘 일치하는 설명을 식별합니다. 이 방법 덕분에 CLIP 모델은 특별히 학습하지 않은 작업에서도 정확한 예측을 수행할 수 있습니다.

PrefixLM#

PrefixLM은 모델 학습에 사용되는 자연어 처리(NLP) 기법입니다. 문장의 일부인 접두사로 시작하여 다음 단어를 예측하는 방법을 학습합니다. Vision-Language Models에서 PrefixLM은 이미지와 주어진 텍스트 일부를 기반으로 모델이 다음 단어를 예측하도록 돕습니다. 이 기법은 Vision Transformer(ViT)를 사용합니다. Vision Transformer는 이미지를 작은 패치로 나누며, 각 패치는 이미지의 일부를 나타내고 이를 순차적으로 처리합니다.

PrefixLM 기법을 사용한 VLM 학습 예시

그림 3. PrefixLM 기법을 사용하는 VLM 학습 예시입니다.

SimVLM은 PrefixLM 학습 기법을 사용하는 VLM입니다. 이전 모델보다 단순한 Transformer 아키텍처를 사용하면서도 다양한 테스트에서 더 나은 결과를 달성합니다. 이 모델의 아키텍처는 Transformer 인코더를 사용하여 이미지와 텍스트 접두사를 연결하는 방법을 학습한 다음, Transformer 디코더를 사용하여 텍스트를 생성합니다.

크로스 어텐션을 사용한 멀티모달 융합#

크로스 어텐션을 사용한 멀티모달 융합은 사전 학습된 Vision Language Model의 시각 데이터 이해 및 처리 능력을 향상하는 기법입니다. 모델에 크로스 어텐션 레이어를 추가하여 시각 정보와 텍스트 정보에 동시에 주의를 기울일 수 있도록 하는 방식으로 작동합니다.

작동 방식은 다음과 같습니다:

  • 이미지의 주요 객체를 식별하고 강조 표시합니다.
  • 강조 표시된 객체를 비주얼 인코더로 처리하여 시각 정보를 모델이 이해할 수 있는 형식으로 변환합니다.
  • 시각 정보를 디코더로 전달하면, 디코더는 사전 학습된 언어 모델의 지식을 사용하여 이미지를 해석합니다.

VisualGPT는 이 기법을 사용하는 모델의 좋은 예입니다. 이 모델에는 자기 부활 활성화 유닛(SRAU)이라는 특수 기능이 포함되어 있어, 그래디언트 소실이라는 일반적인 문제를 방지합니다. 그래디언트 소실은 학습 중 모델이 중요한 정보를 잃게 할 수 있지만, SRAU는 모델의 성능을 안정적으로 유지합니다.

VisualGPT 모델 아키텍처 다이어그램

그림 4. VisualGPT 모델 아키텍처입니다.

비전 언어 모델의 응용 분야#

Vision Language Models는 다양한 산업에 영향을 미치고 있습니다. 이커머스 플랫폼을 개선하는 것부터 인터넷 접근성을 높이는 것까지 VLMs의 잠재적 활용 분야는 매우 다양합니다. 이러한 응용 분야를 몇 가지 살펴보겠습니다.

제품 설명 생성#

온라인 쇼핑을 할 때 각 제품의 상세한 설명을 볼 수 있지만, 이러한 설명을 작성하는 데는 많은 시간이 걸릴 수 있습니다. VLMs는 설명 생성을 자동화하여 이 과정을 간소화합니다. 온라인 소매업체는 Vision Language Models를 사용하여 제품 이미지에서 상세하고 정확한 설명을 직접 생성할 수 있습니다.

고품질 제품 설명은 검색 엔진이 설명에 언급된 특정 속성을 기반으로 제품을 식별하는 데 도움이 됩니다. 예를 들어 "긴소매"와 "면 소재 목 부분"이 포함된 설명은 고객이 "긴소매 면 셔츠"를 더 쉽게 찾도록 돕습니다. 또한 고객이 원하는 제품을 빠르게 찾도록 하여 결과적으로 판매와 고객 만족도를 높입니다.

AI가 생성한 제품 설명 예시

그림 5. AI가 생성한 제품 설명 예시입니다.

생성형 AI 모델인 BLIP-2와 같은 모델은 이미지에서 직접 제품 속성을 예측할 수 있는 정교한 VLMs의 예입니다. BLIP-2는 여러 구성 요소를 사용하여 이커머스 제품을 정확하게 이해하고 설명합니다. 먼저 이미지 인코더로 제품의 시각적 측면을 처리하고 이해합니다. 그런 다음 쿼리 Transformer가 특정 질문이나 작업의 맥락에서 이 시각 정보를 해석합니다. 마지막으로 대규모 언어 모델이 상세하고 정확한 제품 설명을 생성합니다.

인터넷 접근성 향상#

Vision Language Models는 특히 시각 장애가 있는 사용자를 위해 이미지 캡셔닝을 통해 인터넷을 더욱 접근하기 쉽게 만들 수 있습니다. 기존에는 사용자가 웹사이트와 소셜 미디어의 시각적 콘텐츠에 대한 설명을 직접 입력해야 합니다. 예를 들어 Instagram에 게시물을 올릴 때 스크린 리더용 대체 텍스트를 추가할 수 있습니다. 그러나 VLMs는 이 과정을 자동화할 수 있습니다.

VLM이 소파에 앉아 있는 고양이 이미지를 보면 "소파에 앉아 있는 고양이"라는 캡션을 생성하여 시각 장애가 있는 사용자가 장면을 명확하게 이해하도록 할 수 있습니다. VLMs는 이미지-캡션 쌍의 몇 가지 예에서 학습하는 few-shot prompting과 복잡한 장면을 논리적으로 세분화하도록 돕는 chain-of-thought prompting 같은 기법을 사용합니다. 이러한 기법은 생성된 캡션을 더욱 일관되고 상세하게 만듭니다.

AI를 사용한 이미지 캡션 생성

그림 6. AI를 사용한 이미지 캡션 생성입니다.

이와 관련하여 Google의 Chrome용 "Google에서 이미지 설명 가져오기" 기능은 alt text가 없는 이미지에 대한 설명을 자동으로 생성합니다. 이러한 AI 생성 설명은 사람이 작성한 설명만큼 상세하지 않을 수 있지만 여전히 유용한 정보를 제공합니다.

Vision Language Models의 장점과 한계#

Vision Language Models(VLMs)은 시각 데이터와 텍스트 데이터를 결합하여 다양한 장점을 제공합니다. 주요 장점은 다음과 같습니다:

  • 향상된 인간-기계 상호작용: 시스템이 시각 입력과 텍스트 입력을 모두 이해하고 이에 응답하도록 하여 가상 비서, 챗봇, 로보틱스를 개선합니다.
  • 고급 진단 및 분석: 이미지를 분석하고 설명을 생성하여 의료 분야를 지원하고, 의료 전문가에게 2차 소견과 이상 감지 기능을 제공합니다.
  • 대화형 스토리텔링 및 엔터테인먼트: 시각 입력과 텍스트 입력을 결합하여 매력적인 내러티브를 생성하고 게임과 가상 현실에서 사용자 경험을 향상합니다.

인상적인 기능에도 불구하고 Vision Language Models에는 몇 가지 한계도 있습니다. VLMs와 관련하여 다음 사항을 고려해야 합니다:

  • 높은 컴퓨팅 요구 사항: VLMs를 학습하고 배포하려면 상당한 컴퓨팅 리소스가 필요하므로 비용이 많이 들고 접근성이 낮아집니다.
  • 데이터 의존성과 편향: VLMs는 다양성이 부족하거나 편향된 데이터셋으로 학습할 경우 편향된 결과를 생성할 수 있으며, 이는 고정관념과 잘못된 정보를 perpetuate할 수 있습니다.
  • 제한적인 맥락 이해: VLMs는 전체적인 상황이나 맥락을 이해하는 데 어려움을 겪을 수 있으며, 지나치게 단순화되거나 잘못된 출력을 생성할 수 있습니다.

핵심 요점#

Vision Language Models는 이커머스와 의료를 비롯한 다양한 분야에서 놀라운 잠재력을 보여줍니다. 시각 데이터와 텍스트 데이터를 결합하여 혁신을 이끌고 산업을 변화시킬 수 있습니다. 그러나 이러한 기술이 공정하게 사용되도록 하려면 책임감 있고 윤리적인 개발이 필수적입니다. VLMs는 계속 발전하면서 이미지 기반 검색과 보조 기술 같은 작업을 개선할 것입니다.

AI에 대해 계속 학습하려면 저희 커뮤니티에 참여해 보세요! GitHub 저장소를 살펴보고 제조의료와 같은 산업에서 AI를 사용해 혁신적인 솔루션을 만드는 방법을 확인해 보세요. 🚀

Explore solutions

로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요