Object Detection Architectures
백본부터 헤드까지 객체 탐지 아키텍처를 살펴보세요. Ultralytics YOLO26이 실시간 컴퓨터 비전에서 뛰어난 속도와 정확도를 제공하는 방식을 알아보세요.
객체 탐지 아키텍처는 시각 데이터 내 항목을 식별하고 위치를 찾는 데 사용되는 신경망의 구조적 설계도입니다. 더 넓은 분야인 컴퓨터 비전 (CV)에서 이러한 아키텍처는 원시 픽셀 데이터를 의미 있는 인사이트로 처리하여 기계가 "보는" 방식을 정의합니다. 이미지를 단순히 분류하는 기초적인 분류 모델과 달리, 객체 탐지 아키텍처는 발견한 각각의 개별 객체에 대해 클래스 레이블 및 신뢰도 점수와 함께 바운딩 박스를 출력하도록 설계됩니다. 이러한 구조적 설계는 모델의 속도, 정확도 및 계산 효율성을 결정하므로, 실시간 추론이나 고정밀 분석을 위한 모델을 선택할 때 중요한 요소가 됩니다.
아키텍처의 핵심 구성 요소#
구체적인 설계는 다양하지만, 대부분의 최신 아키텍처는 백본, 넥, 헤드라는 세 가지 기본 구성 요소를 공유합니다. 백본은 주요 특징 추출기 역할을 합니다. 일반적으로 ImageNet과 같은 대규모 데이터셋으로 사전 학습된 합성곱 신경망 (CNN)으로, 기본적인 형태, 가장자리 및 텍스처를 식별합니다. 백본에 널리 사용되는 선택지로는 ResNet과 CSPDarknet이 있습니다.
넥은 백본을 최종 출력 레이어에 연결합니다. 넥의 역할은 백본의 여러 단계에서 추출된 특징을 혼합하고 결합하여 모델이 다양한 크기의 객체를 탐지할 수 있도록 하는 것입니다. 이를 다중 스케일 특징 융합이라고 합니다. 아키텍처는 이 과정에서 특징 피라미드 네트워크 (FPN) 또는 경로 집계 네트워크 (PANet)를 자주 활용하여 예측 레이어로 전달되는 의미 정보를 강화합니다. 마지막으로 탐지 헤드는 이러한 융합된 특징을 처리하여 각 객체의 구체적인 클래스와 좌표 위치를 예측합니다.
발전 과정: 2단계 대 1단계#
역사적으로 아키텍처는 두 가지 주요 범주로 나뉘었습니다. R-CNN 계열과 같은 2단계 탐지기는 먼저 객체가 존재할 수 있는 관심 영역 (RoIs)을 제안한 다음, 두 번째 단계에서 해당 영역을 분류합니다. 일반적으로 정확도는 높지만, 엣지 디바이스에서는 계산량이 지나치게 많을 수 있습니다.
반면 1단계 탐지기는 탐지를 단순한 회귀 문제로 다루며, 한 번의 패스에서 이미지 픽셀을 바운딩 박스 좌표와 클래스 확률에 직접 매핑합니다. YOLO(한 번만 보고 즉시 탐지) 계열이 개척한 이 접근 방식은 실시간 성능을 가능하게 하여 업계를 혁신했습니다. 최신 발전은 YOLO26과 같은 모델로 이어졌으며, 이러한 모델은 뛰어난 속도를 제공할 뿐만 아니라 엔드투엔드 NMS-free 아키텍처도 채택했습니다. 비최대 억제 (NMS) 후처리가 필요하지 않으므로 이러한 최신 아키텍처는 지연 시간의 변동성을 줄이며, 이는 안전이 중요한 시스템에 매우 중요합니다.
실제 적용 사례#
아키텍처 선택은 다양한 산업 분야에서 AI 솔루션의 성공에 직접적인 영향을 미칩니다.
- 리테일 자동화: 스마트 슈퍼마켓에서는 효율적인 1단계 아키텍처를 통해 컨베이어 벨트나 쇼핑 카트에 있는 제품을 즉시 인식하는 자동 결제 시스템을 구현할 수 있어 대기 시간과 인적 오류를 줄일 수 있습니다.
- 의료 진단: 고정밀 아키텍처는 의료 영상 분석에서 X-ray나 MRI 스캔의 종양과 같은 이상을 탐지하는 데 사용됩니다. 이 경우에는 원시 처리 속도보다 세밀한 정보를 보존하는 아키텍처의 능력이 더 중요합니다.
관련 용어 구분#
탐지 아키텍처를 유사한 컴퓨터 비전 작업과 구분하는 것이 중요합니다.
- 이미지 분류와 비교: 이미지 분류 아키텍처(예: VGG 또는 EfficientNet)는 전체 이미지에 하나의 레이블(예: "고양이")만 할당합니다. 이 방식은 고양이가 어디에 있는지 또는 고양이가 여러 마리인지 알려주지 않으며, 이는 탐지 아키텍처의 주요 기능입니다.
- 인스턴스 세그멘테이션과 비교: 탐지는 객체 주위에 박스를 표시하는 반면, 인스턴스 세그멘테이션은 각 객체의 픽셀 단위로 정확한 윤곽선(마스크)을 식별합니다. 세그멘테이션 아키텍처는 탐지 아키텍처의 확장 형태인 경우가 많으며, 예를 들어 탐지 헤드에 마스크 브랜치를 추가합니다.
Ultralytics를 활용한 구현#
최신 프레임워크는 이러한 아키텍처의 복잡성을 추상화하여 개발자가 최소한의 코드로 최첨단 설계를 활용할 수 있도록 합니다. ultralytics 패키지를 사용하면 사전 학습된 YOLO26 모델을 로드하고 즉시 추론을 실행할 수 있습니다. 데이터셋을 관리하고 클라우드에서 사용자 지정 아키텍처를 학습하려는 팀을 위해 Ultralytics Platform은 전체 MLOps 파이프라인을 간소화합니다.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on an image source
# This uses the model's architecture to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()








