객체 탐지와 Ultralytics YOLO 모델의 발전 과정
객체 탐지의 발전 과정을 되돌아봅니다. 최근 몇 년 동안 YOLO (한 번에 한 번 보기) 모델이 어떻게 발전해 왔는지 중점적으로 살펴봅니다.

컴퓨터 비전은 인간이 현실 세계를 인식하는 방식과 유사하게 기계가 이미지와 동영상을 보고 이해하도록 가르치는 인공지능(AI)의 한 분야입니다. 객체 인식이나 행동 식별은 인간에게 자연스러운 일이지만, 기계에서는 이러한 작업을 수행하려면 구체적이고 전문화된 컴퓨터 비전 기술이 필요합니다. 예를 들어 컴퓨터 비전의 주요 작업 중 하나인 객체 검출은 이미지나 동영상에서 객체를 식별하고 위치를 찾는 작업입니다.
1960년대부터 연구자들은 컴퓨터가 객체를 검출하는 방식을 개선하기 위해 노력해 왔습니다. 템플릿 매칭과 같은 초기 방법은 미리 정의된 템플릿을 이미지 전체에 슬라이딩하여 일치하는 항목을 찾는 방식이었습니다. 이러한 접근 방식은 혁신적이었지만 객체의 크기와 방향, 조명 변화에 제대로 대응하지 못했습니다. 오늘날에는 Ultralytics YOLO11과 같은 고급 모델을 통해 가려진 객체로 알려진 작고 부분적으로 숨겨진 객체도 높은 정확도로 검출할 수 있습니다.
컴퓨터 비전이 계속 발전함에 따라 이러한 기술이 어떻게 발전해 왔는지 되돌아보는 것이 중요합니다. 이 글에서는 객체 검출의 발전 과정을 살펴보고 YOLO(You Only Look Once) 모델의 변화를 조명합니다. 지금부터 시작하겠습니다!
컴퓨터 비전의 기원#
객체 검출에 대해 자세히 살펴보기 전에 컴퓨터 비전이 어떻게 시작되었는지 알아보겠습니다. 컴퓨터 비전의 기원은 과학자들이 뇌가 시각 정보를 처리하는 방식을 연구하기 시작한 1950년대 후반과 1960년대 초반으로 거슬러 올라갑니다. 고양이를 대상으로 한 실험에서 연구자 David Hubel과 Torsten Wiesel은 뇌가 가장자리와 선 같은 단순한 패턴에 반응한다는 사실을 발견했습니다. 이는 특징 추출의 개념, 즉 시각 시스템이 더 복잡한 패턴으로 넘어가기 전에 이미지에서 가장자리와 같은 기본 특징을 감지하고 인식한다는 아이디어의 기반이 되었습니다.

그림 1. 고양이의 뇌가 빛 막대에 반응하는 방식을 학습한 연구는 컴퓨터 비전의 특징 추출 발전에 기여했습니다.
비슷한 시기에 물리적인 이미지를 디지털 형식으로 변환할 수 있는 새로운 기술이 등장하면서, 기계가 시각 정보를 처리하는 방식에 대한 관심이 높아졌습니다. 1966년에는 매사추세츠 공과대학교(MIT)의 Summer Vision Project가 이러한 연구를 한 단계 더 발전시켰습니다. 이 프로젝트는 완전히 성공하지는 못했지만, 이미지에서 전경과 배경을 분리할 수 있는 시스템을 만드는 것을 목표로 했습니다. 많은 비전 AI 커뮤니티 구성원에게 이 프로젝트는 과학 분야로서의 컴퓨터 비전이 공식적으로 시작된 계기로 여겨집니다.
객체 검출의 역사 이해하기#
1990년대 후반과 2000년대 초반에 컴퓨터 비전이 발전하면서 객체 검출 방법은 템플릿 매칭과 같은 기본 기법에서 더 발전된 접근 방식으로 전환되었습니다. 널리 사용된 방법 중 하나는 Haar Cascade로, 얼굴 검출과 같은 작업에 폭넓게 활용되었습니다. 이 방법은 슬라이딩 윈도우로 이미지를 스캔하면서 이미지의 각 영역에서 가장자리나 질감과 같은 특정 특징을 확인한 다음, 이러한 특징을 결합하여 얼굴과 같은 객체를 검출했습니다. Haar Cascade는 이전 방법보다 훨씬 빨랐습니다.

그림 2. 얼굴 검출에 Haar Cascade 사용.
이와 함께 방향성 그래디언트 히스토그램(HOG)과 서포트 벡터 머신(SVMs)과 같은 방법도 도입되었습니다. HOG는 슬라이딩 윈도우 기법을 사용하여 이미지의 작은 영역에서 빛과 그림자의 변화를 분석하고, 형태를 기반으로 객체를 식별하는 데 도움을 주었습니다. 이후 SVMs는 이러한 특징을 분류하여 객체의 정체를 판별했습니다. 이러한 방법은 정확도를 향상시켰지만 실제 환경에서는 여전히 어려움을 겪었고 오늘날의 기법과 비교하면 속도도 느렸습니다.
실시간 객체 검출의 필요성#
2010년대에는 딥러닝과 합성곱 신경망(CNNs)의 발전이 객체 검출에 큰 변화를 가져왔습니다. CNNs를 통해 컴퓨터는 대량의 데이터에서 중요한 특징을 자동으로 학습할 수 있게 되었고, 이에 따라 검출 정확도가 크게 향상되었습니다.
R-CNN(영역 기반 합성곱 신경망)과 같은 초기 모델은 정밀도를 크게 향상시켜 이전 방법보다 객체를 더 정확하게 식별할 수 있었습니다.
그러나 이러한 모델은 이미지를 여러 단계로 처리했기 때문에 속도가 느렸고, 자율주행 자동차나 영상 감시와 같은 분야의 실시간 애플리케이션에는 적합하지 않았습니다.
처리 속도를 높이는 데 초점을 맞춰 더 효율적인 모델이 개발되었습니다. Fast R-CNN과 Faster R-CNN과 같은 모델은 관심 영역을 선택하는 방식을 개선하고 검출에 필요한 단계 수를 줄이는 데 기여했습니다. 이로 인해 객체 검출은 더 빨라졌지만 즉각적인 결과가 필요한 많은 실제 애플리케이션에서 사용하기에는 여전히 충분히 빠르지 않았습니다. 실시간 검출에 대한 수요가 증가하면서 속도와 정확도를 모두 균형 있게 달성할 수 있는 더욱 빠르고 효율적인 솔루션의 개발이 촉진되었습니다.

그림 3. R-CNN, Fast R-CNN 및 Faster R-CNN의 속도 비교.
YOLO(You Only Look Once) 모델: 중요한 이정표#
YOLO는 이미지와 동영상에서 여러 객체를 실시간으로 검출할 수 있게 하여 컴퓨터 비전의 개념을 새롭게 정의한 객체 검출 모델이며, 이전 검출 방법과는 상당히 차별화됩니다. YOLO의 아키텍처는 검출된 각 객체를 개별적으로 분석하는 대신 객체 검출을 하나의 작업으로 처리하고, CNNs를 사용하여 한 번에 객체의 위치와 클래스를 모두 예측합니다.
이 모델은 이미지를 그리드로 나누고 각 부분이 해당 영역의 객체를 검출하도록 작동합니다. 각 영역에 대해 여러 예측을 수행한 다음, 신뢰도가 낮은 결과를 필터링하여 제거 정확한 결과만 유지합니다.

그림 4. YOLO의 작동 방식 개요.
YOLO가 컴퓨터 비전 애플리케이션에 도입되면서 객체 검출은 이전 모델보다 훨씬 빠르고 효율적으로 수행할 수 있게 되었습니다. YOLO는 속도와 정확도를 모두 갖추었기 때문에 제조, 의료, 로보틱스와 같은 산업에서 실시간 솔루션을 위한 인기 있는 선택으로 빠르게 자리 잡았습니다.
또 다른 중요한 점은 YOLO가 오픈 소스였기 때문에 개발자와 연구자들이 지속적으로 개선할 수 있었고, 그 결과 더욱 발전된 버전이 등장했다는 것입니다.
YOLO에서 Ultralytics YOLO11까지의 여정#
YOLO 모델은 각 버전의 발전을 바탕으로 시간이 지나면서 꾸준히 개선되었습니다. 이러한 개선은 성능 향상과 더불어 다양한 수준의 기술 경험을 가진 사용자가 모델을 더 쉽게 사용할 수 있도록 했습니다.
예를 들어 Ultralytics YOLOv5가 출시되면서 모델 배포가 PyTorch를 통해 더 간단해졌고, 더 다양한 사용자가 고급 AI를 활용할 수 있게 되었습니다. 정확도와 사용 편의성을 결합하여, 코딩 전문가가 아니어도 더 많은 사람이 객체 검출을 구현할 수 있도록 했습니다.

그림 5. YOLO 모델의 발전.
Ultralytics YOLOv8은 인스턴스 세그멘테이션과 같은 작업에 대한 지원을 추가하고 모델의 유연성을 높여 이러한 발전을 이어갔습니다. 기본적인 애플리케이션부터 더 복잡한 애플리케이션까지 YOLO를 쉽게 사용할 수 있게 되어 다양한 시나리오에서 유용하게 활용되었습니다.
최신 모델인 Ultralytics YOLO11에서는 추가적인 최적화가 이루어졌습니다. 파라미터 수를 줄이면서 정확도를 향상시켜 이제 실시간 작업에 더욱 효율적으로 사용할 수 있습니다. 숙련된 개발자든 AI를 처음 접하는 사용자든 YOLO11을 통해 객체 검출에 대한 고급 접근 방식을 쉽게 활용할 수 있습니다.
Ultralytics YOLO11 알아보기: 새로운 기능과 개선 사항#
YOLO11은 Ultralytics의 연례 하이브리드 이벤트인 YOLO Vision 2024 (YV24)에서 출시되었으며, 객체 검출, 인스턴스 세그멘테이션, 이미지 분류, 포즈 추정 등 YOLOv8과 동일한 컴퓨터 비전 작업을 지원합니다. 따라서 사용자는 워크플로를 조정하지 않고도 이 새로운 모델로 쉽게 전환할 수 있습니다. 또한 YOLO11의 업그레이드된 아키텍처는 예측을 더욱 정밀하게 만듭니다. 실제로 YOLO11m은 YOLOv8m보다 파라미터 수가 22% 적으면서도 COCO 데이터셋에서 더 높은 평균 정밀도(mAP)를 달성합니다.
YOLO11은 스마트폰과 기타 엣지 디바이스부터 더 강력한 클라우드 시스템까지 다양한 플랫폼에서 효율적으로 실행되도록 설계되었습니다. 이러한 유연성은 실시간 애플리케이션에서 다양한 하드웨어 구성에 걸쳐 원활한 성능을 보장합니다. 또한 YOLO11은 더 빠르고 효율적이어서 컴퓨팅 비용을 줄이고 추론 시간을 단축합니다. Ultralytics Python 패키지를 사용하든 코드 없이 사용할 수 있는 Ultralytics HUB를 사용하든 기존 워크플로에 YOLO11을 쉽게 통합할 수 있습니다.
YOLO 모델과 객체 검출의 미래#
고급 객체 검출이 실시간 애플리케이션과 엣지 AI에 미치는 영향은 이미 다양한 산업에서 나타나고 있습니다. 석유 및 가스, 의료, 소매와 같은 분야에서 AI에 대한 의존도가 높아지면서 빠르고 정밀한 객체 검출에 대한 수요도 계속 증가하고 있습니다. Ultralytics YOLO11은 컴퓨팅 성능이 제한된 디바이스에서도 고성능 검출을 지원하여 이러한 수요에 대응하고자 합니다.
엣지 AI가 성장함에 따라 속도와 정확도가 중요한 환경에서 실시간 의사 결정을 수행하려면 Ultralytics YOLO11과 같은 객체 검출 모델이 더욱 필수적이 될 가능성이 높습니다. 설계와 적응성의 지속적인 개선을 통해 객체 검출의 미래에는 다양한 애플리케이션 전반에 걸쳐 더 많은 혁신이 이루어질 것으로 보입니다.
핵심 요점#
객체 검출은 단순한 방법에서 오늘날 사용되는 고급 딥러닝 기법으로 발전하며 긴 여정을 거쳐 왔습니다. YOLO 모델은 이러한 발전의 중심에서 다양한 산업에 더 빠르고 정확한 실시간 검출을 제공해 왔습니다. Ultralytics YOLO11은 이러한 유산을 바탕으로 효율성을 높이고 컴퓨팅 비용을 줄이며 정확도를 향상시켜 다양한 실시간 애플리케이션을 위한 신뢰할 수 있는 선택지가 되었습니다. AI와 컴퓨터 비전이 계속 발전함에 따라 객체 검출의 미래는 밝으며, 속도와 정밀도, 적응성이 더욱 향상될 여지가 있습니다.
AI가 궁금하신가요? 계속 학습할 수 있도록 저희 커뮤니티와 소통해 보세요! GitHub 리포지토리에서 저희가 제조 및 헬스케어와 같은 산업에서 혁신적인 솔루션을 만들기 위해 AI를 어떻게 활용하고 있는지 확인해 보세요. 🚀









