YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Vision Transformer (ViT)

Vision Transformer(ViT)의 강력함을 탐색합니다. 셀프 어텐션과 패치 토큰화가 Ultralytics와 함께 CNN을 넘어 컴퓨터 비전을 어떻게 혁신하는지 배웁니다.

Vision Transformer (ViT)는 원래 Natural Language Processing (NLP)용으로 설계된 셀프 어텐션 메커니즘을 시각적 작업에 맞게 조정하는 딥러닝 아키텍처입니다. 로컬 픽셀 그리드의 계층 구조를 통해 이미지를 처리하는 전통적인 Convolutional Neural Network (CNN)과 달리, ViT는 이미지를 개별 패치 시퀀스로 취급합니다. 이 접근 방식은 컨볼루션 레이어에 의존하지 않고도 computer vision (CV)에서 순수 Transformer 아키텍처가 최고 수준의 성능을 달성할 수 있음을 입증한 획기적인 연구 논문 "An Image is Worth 16x16 Words"을 통해 대중화되었습니다. 글로벌 어텐션을 활용함으로써 ViT는 첫 번째 레이어부터 전체 이미지에 걸친 장거리 종속성을 포착할 수 있습니다.

Vision Transformer 작동 원리#

ViT의 근본적인 혁신은 입력 데이터를 구조화하는 방식에 있습니다. 이미지를 표준 Transformer와 호환되도록 만들기 위해, 이 모델은 언어 모델이 단어 문장을 처리하는 방식을 모방하여 시각 정보를 벡터 시퀀스로 분해합니다.

  1. 패치 토큰화: 입력 이미지는 일반적으로 16x16 픽셀 크기의 고정 크기 사각형 그리드로 분할됩니다. 각 사각형은 벡터로 평탄화되어 사실상 시각적 token이 됩니다.

  2. 선형 투영: 이 평탄화된 패치들은 학습 가능한 선형 레이어를 거쳐 조밀한 embeddings를 생성합니다. 이 단계는 원시 픽셀 값을 모델이 처리할 수 있는 고차원 공간으로 매핑합니다.

  3. 위치 인코딩: 아키텍처가 시퀀스를 병렬로 처리하고 순서나 공간에 대한 내재적 이해가 부족하기 때문에, 학습 가능한 positional encodings가 패치 임베딩에 추가됩니다. 이를 통해 모델은 각 패치가 원래 이미지에서 어디에 속하는지에 대한 공간 정보를 유지할 수 있습니다.

  4. 셀프 어텐션 메커니즘: 시퀀스는 Transformer 인코더로 들어가며, 여기서 self-attention은 모든 패치가 다른 모든 패치와 동시에 상호 작용할 수 있도록 합니다. 이를 통해 네트워크는 글로벌 컨텍스트를 학습하고 왼쪽 상단의 픽셀이 오른쪽 하단의 픽셀과 어떻게 관련되는지 이해할 수 있습니다.

  5. 분류 헤드: image classification과 같은 작업의 경우, 특별한 "클래스 토큰"이 종종 시퀀스 앞에 추가됩니다. 이 토큰의 최종 출력 상태는 이미지의 집계된 표현 역할을 하며, 이는 multilayer perceptron (MLP)와 같은 분류기에 입력됩니다.

Vision Transformer vs. CNN#

두 아키텍처 모두 시각적 데이터를 이해하는 것을 목표로 하지만 운영 철학에서 상당한 차이가 있습니다. CNN은 변환 불변성으로 알려진 강력한 "귀납적 편향"을 가지고 있어, 로컬 기능(모서리 및 텍스처 등)이 위치와 무관하게 중요하다고 본질적으로 가정합니다. 이로 인해 CNN은 데이터 효율성이 매우 높고 소규모 datasets에서 효과적입니다.

반면, Vision Transformers는 이미지 관련 편향이 적습니다. JFT-300M 또는 전체 ImageNet 데이터셋과 같은 방대한 양의 training data를 사용하여 처음부터 공간 관계를 학습해야 합니다. 이로 인해 학습이 더 많은 컴퓨팅 집약적이 되지만, ViT는 놀라울 정도로 잘 확장될 수 있습니다. 충분한 데이터와 compute power가 주어지면 로컬 컨볼루션이 놓칠 수 있는 복잡한 글로벌 구조를 포착하여 CNN을 능가할 수 있습니다.

실제 애플리케이션 사례#

글로벌 컨텍스트를 이해하는 능력은 ViT를 복잡하고 높은 정밀도가 요구되는 환경에서 특히 유용하게 만듭니다.

  • 의료 이미지 분석: healthcare AI에서 ViT는 MRI나 조직병학 슬라이드와 같은 고해상도 스캔을 분석하는 데 사용됩니다. 예를 들어 tumor detection에서 ViT는 조직의 미묘한 텍스처 이상을 슬라이드 전반의 광범위한 구조적 변화와 연관시켜 로컬 처리가 간과할 수 있는 악성 패턴을 식별할 수 있습니다.
  • 위성 이미지 및 원격 탐측: ViT는 객체 간의 관계가 넓은 거리에 걸쳐 있는 satellite image analysis에서 뛰어납니다. 예를 들어, 삼림 벌채 현장을 멀리 떨어진 벌목 도로와 연결하려면 풍경의 "큰 그림"을 이해해야 하며, 이는 ViT의 글로벌 어텐션이 표준 CNN의 제한된 수용 영역을 능가하는 작업입니다.

Ultralytics와 함께하는 Transformer 활용#

ultralytics 라이브러리는 Transformer 기반 아키텍처를 지원하며, 가장 주목할 만한 것은 RT-DETR (Real-Time Detection Transformer)입니다. 플래그십 YOLO26이 에지 장치에서의 속도와 정확도의 균형으로 인해 종종 선호되지만, RT-DETR은 글로벌 컨텍스트를 우선시하는 시나리오에 강력한 대안을 제공합니다.

다음 Python 예제는 사전 학습된 Transformer 기반 모델을 로드하고 추론을 실행하는 방법을 보여줍니다.

from ultralytics import RTDETR

# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")

# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

미래 전망#

ViT의 높은 계산 비용을 해결하기 위해 연구가 빠르게 발전하고 있습니다. FlashAttention과 같은 기술은 이러한 모델을 더 빠르고 메모리 효율적으로 만들고 있습니다. 또한 CNN의 효율성과 Transformer의 어텐션을 결합한 하이브리드 아키텍처가 보편화되고 있습니다. 이러한 고급 워크플로를 관리하려는 팀을 위해 Ultralytics Platform은 데이터를 주석 처리하고, 클라우드를 통해 복잡한 모델을 학습하며, 다양한 엔드포인트에 배포할 수 있는 통합 환경을 제공합니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.