Pose Estimation
포즈 추정이 키포인트를 사용하여 움직임을 어떻게 추적하는지 배우십시오. 실제 사례를 살펴보고 빠르고 정확한 결과를 위해 Ultralytics YOLO26을 시작해 보십시오.
포즈 추정(Pose estimation)은 단순히 객체의 존재를 감지하는 것을 넘어 객체의 기하학적 구조와 물리적 방향을 이해하는 특화된 컴퓨터 비전 기술입니다. 표준 object detection이 대상 주위에 단순한 사각형 박스를 그리는 반면, 포즈 추정은 인체의 관절(팔꿈치, 무릎, 어깨)이나 차량의 구조적 모서리와 같이 keypoints로 알려진 특정 의미론적 점들을 식별합니다. 이러한 랜드마크를 매핑함으로써 machine learning 모델은 대상의 골격 표현을 재구성하여 시스템이 2D 또는 3D 공간에서 바디 랭귀지, 움직임 역학, 정밀한 위치를 해석할 수 있도록 합니다.
핵심 메커니즘: 하향식(Top-Down) vs. 상향식(Bottom-Up)#
현대 포즈 추정은 시각적 데이터를 처리하기 위해 Convolutional Neural Networks (CNNs)을 자주 활용하며 정교한 deep learning 아키텍처에 크게 의존합니다. 알고리즘은 일반적으로 키포인트를 식별하기 위해 다음 두 가지 주요 전략 중 하나를 따릅니다.
- 하향식(Top-Down) 접근 방식: 이 방법은 먼저 객체 감지 모델을 사용하여 bounding boxes 내의 개별 인스턴스를 찾습니다. 사람이나 객체가 더 큰 이미지에서 잘려 나가면, 포즈 추정기는 해당 특정 영역 내의 키포인트를 예측합니다. 이 접근 방식은 종종 매우 정확하지만 프레임 내의 대상 수가 증가함에 따라 더 높은 inference latency로 이어질 수 있습니다.
- 상향식(Bottom-Up) 접근 방식: 반대로 이 전략은 전체 이미지의 모든 잠재적 키포인트를 동시에 감지한 다음(예: 군중 속에서 모든 '왼쪽 무릎' 찾기) 연관 알고리즘을 사용하여 개별 골격으로 그룹화합니다. 이 방법은 얼마나 많은 사람이 존재하든 상관없이 계산 비용이 비교적 일정하게 유지되기 때문에 혼잡한 장소에서의 real-time inference에 일반적으로 선호됩니다.
YOLO26과 같은 최첨단 모델은 이러한 요구 사항의 균형을 맞추는 고급 엔드투엔드 아키텍처를 활용하여 edge AI 장치 및 모바일 플랫폼에 배포하기에 적합한 고속 포즈 추정을 제공합니다.
관련 컴퓨터 비전 용어 구별하기#
computer vision 워크플로에서 포즈 추정의 고유한 가치를 이해하려면 다른 시각적 인식 작업과 구별하는 것이 도움이 됩니다.
- Object Detection: 객체가 무엇이고 어디에 있는지 식별하는 데 중점을 두며 직사각형 박스를 출력합니다. 대상을 내부 관절을 이해하지 못한 채 단단한 객체로 취급합니다.
- Instance Segmentation: 객체의 정확한 모양을 외곽선으로 그리는 픽셀 단위의 완벽한 마스크를 생성합니다. 세분화는 경계를 제공하지만, kinematic analysis에 필요한 관절이나 골격 연결을 명시적으로 식별하지는 않습니다.
- Pose Estimation: 특히 내부 구조를 대상으로 하며 미리 결정된 랜드마크(예: 엉덩이에서 무릎까지) 간의 연결을 매핑하여 자세와 동작을 분석합니다.
실제 애플리케이션 사례#
인간과 객체의 움직임을 디지털화하는 기능은 다양한 산업 전반에 걸쳐 혁신적인 응용 프로그램을 이끌어 냈으며, 주석이 달린 키포인트의 대규모 데이터셋을 관리하기 위해 Ultralytics Platform과 같은 도구를 사용하여 학습되는 경우가 많습니다.
의료 및 재활#
의학 분야에서 AI in healthcare은 환자의 재활을 원격으로 모니터링하기 위해 포즈 추정을 활용합니다. 자동화된 시스템은 관절 각도와 가동 범위를 추적하여 환자가 집에서 physical therapy exercises을 올바르게 수행하는지 확인할 수 있습니다. 이는 재부상 위험을 줄이고 임상 의사가 고가의 실험실 장비 없이도 회복 진행 상황을 정량화할 수 있도록 합니다.
스포츠 분석#
코치와 선수들은 sports analytics을 활용하여 퍼포먼스를 최적화합니다. 포즈 추정 모델은 전통적인 motion capture에 사용되는 거추장스러운 마커 슈트 없이도 골퍼의 스윙 평면, 주자의 보폭 또는 투수의 생체 역학을 분석할 수 있습니다. 이는 기술을 향상시키고 과사용 부상을 방지하기 위한 즉각적인 데이터 기반 피드백을 제공합니다.
소매 및 행동 분석#
상업 환경에서 AI in retail 시스템은 포즈 감지를 사용하여 높은 선반의 제품에 손을 뻗거나 특정 통로에 머무는 것과 같은 고객 행동을 파악합니다. 이 데이터는 물리적 행동과 구매 결정을 상호 연관시켜 매장 레이아웃을 최적화하고 inventory management을 개선하는 데 도움이 됩니다.
코드 예제: Ultralytics YOLO26을 사용한 포즈 추정#
현대 Python 프레임워크를 사용하면 포즈 추정을 간단하게 구현할 수 있습니다. 다음 예제는 ultralytics 패키지를 사용하여 사전 학습된 YOLO26 모델(YOLO11의 후속작)을 로드하고 이미지에서 사람의 키포인트를 감지하는 방법을 보여줍니다.
from ultralytics import YOLO
# Load the YOLO26 pose model (nano version for speed)
model = YOLO("yolo26n-pose.pt")
# Perform inference on an image source
# The model identifies bounding boxes and specific keypoints (joints)
results = model("https://ultralytics.com/images/bus.jpg")
# Print the xy coordinates of detected keypoints
print(results[0].keypoints.xy)
# Visualize the skeletal results directly
results[0].show()





