Video Understanding
Video Understanding이 시간적 동역학을 분석하여 동작을 해석하는 방법을 살펴봅니다. 고급 AI를 위해 Ultralytics YOLO26으로 실시간 추적을 구현하는 방법을 알아봅니다.
비디오 이해는 시간의 흐름에 따른 시각 데이터를 기계가 인식하고 분석하며 해석할 수 있도록 하는 데 중점을 둔 정교한 컴퓨터 비전(CV)의 한 분야입니다. 정적인 스냅샷을 서로 독립적으로 처리하는 일반적인 이미지 인식과 달리, 비디오 이해는 프레임 시퀀스를 분석하여 시간적 역학, 맥락 및 인과 관계를 파악합니다. AI 시스템은 시간이라는 "네 번째 차원"을 처리함으로써 단순히 객체를 식별하는 것을 넘어 장면 내에서 발생하는 행동, 이벤트 및 전개되는 서사를 이해할 수 있습니다. 이러한 기능은 역동적인 실제 환경에서 안전하고 효과적으로 상호작용할 수 있는 지능형 시스템을 구축하는 데 필수적입니다.
비디오 분석의 핵심 구성 요소#
비디오 콘텐츠를 성공적으로 해석하려면 모델이 두 가지 주요 정보, 즉 공간적 특징(프레임에 무엇이 있는지)과 시간적 특징(사물이 어떻게 변하는지)을 종합해야 합니다. 이를 위해 여러 신경망 전략을 결합하는 복잡한 아키텍처가 필요한 경우가 많습니다.
- 합성곱 신경망(CNNs): 이러한 네트워크는 일반적으로 공간적 백본 역할을 하며, 개별 프레임에서 형태, 텍스처 및 객체와 같은 시각적 특징을 추출합니다.
- 순환 신경망(RNNs): 장단기 메모리(LSTM) 유닛과 같은 아키텍처는 CNN이 추출한 특징 시퀀스를 처리하는 데 사용되며, 이를 통해 모델이 과거 프레임을 "기억"하고 미래 상태를 예측할 수 있습니다.
- 옵티컬 플로: 많은 시스템은 옵티컬 플로 알고리즘을 활용하여 프레임 간 픽셀의 모션 벡터를 명시적으로 계산하며, 객체의 외형과 독립적으로 속도와 방향에 관한 핵심 데이터를 제공합니다.
- 비전 Transformer(ViTs): 최신 접근 방식은 서로 다른 프레임 또는 영역의 중요도를 가중하는 어텐션 메커니즘에 점점 더 의존하여, 모델이 긴 비디오 스트림에서 핵심 이벤트에 집중할 수 있도록 합니다.
실제 적용 사례#
시간적 맥락을 이해하는 능력은 다양한 산업 분야에서 고도화된 자동화의 길을 열었습니다.
- 자율주행 차량: 자율주행 자동차는 비디오 이해를 사용하여 보행자와 다른 차량의 궤적을 예측합니다. 시스템은 움직임 패턴을 분석하여 잠재적인 충돌을 예측하고 복잡한 조작을 수행할 수 있습니다.
- 행동 인식: 스포츠 분석 및 의료 모니터링에서 시스템은 선수가 골을 넣는 상황이나 환자가 넘어지는 상황과 같은 특정 인간 활동을 식별하여 자동화된 인사이트 또는 알림을 제공합니다.
- 스마트 리테일: 매장에서는 이러한 시스템을 이상 탐지에 활용하여 절도 행위를 식별하거나 고객 유동 패턴을 분석해 매장 레이아웃을 더욱 효과적으로 최적화합니다.
- 콘텐츠 조정: 대형 미디어 플랫폼은 비디오 이해를 사용하여 부적절한 콘텐츠를 자동으로 표시하거나 업로드된 콘텐츠를 주제별로 분류함으로써 수동 검토의 필요성을 크게 줄입니다.
관련 개념 구분하기#
비디오 이해는 광범위한 기능을 포함하지만, AI 분야의 여러 관련 용어와는 구별됩니다.
- 비디오 이해와 객체 추적 비교: 추적은 특정 자동차와 같은 인스턴스의 고유한 정체성을 프레임을 가로질러 이동하는 동안 유지하는 데 중점을 둡니다. 비디오 이해는 해당 자동차의 행동을 해석하여 자동차가 "주차 중"인지 또는 "과속 중"인지 인식합니다.
- 비디오 이해와 포즈 추정 비교: 포즈 추정은 단일 프레임 또는 시퀀스에서 신체 관절의 기하학적 구성을 감지합니다. 비디오 이해는 이 데이터를 사용하여 "손을 흔들며 인사하는" 동작과 같이 움직임의 의미를 추론합니다.
- 비디오 이해와 멀티모달 AI 비교: 비디오 이해가 시각적 시퀀스에 중점을 두는 반면, 멀티모달 AI는 더욱 종합적인 분석을 위해 비디오를 오디오, 텍스트 또는 센서 데이터와 결합합니다.
Ultralytics YOLO26을 사용한 비디오 분석 구현#
비디오 이해의 기본 단계는 시간적 연속성을 확립하기 위해 객체를 안정적으로 감지하고 추적하는 것입니다. Ultralytics YOLO26 모델은 실시간 추적에서 최신 수준의 성능을 제공하며, 이는 상위 수준의 행동 분석을 위한 전처리 단계로 활용됩니다.
다음 예제에서는 Python API를 사용하여 비디오 소스에서 객체 추적을 수행하는 방법을 보여줍니다.
from ultralytics import YOLO
# Load the official YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Track objects in a video file with persistence to maintain IDs
# 'show=True' visualizes the tracking in real-time
results = model.track(source="path/to/video.mp4", persist=True, show=True)과제와 향후 동향#
상당한 진전에도 불구하고 비디오 이해는 고해상도 비디오 스트림에 포함된 방대한 데이터로 인해 여전히 많은 계산 비용이 듭니다. 3D 합성곱 또는 시간적 Transformer에 대한 FLOPS 계산은 엣지 AI 디바이스에서 감당하기 어려울 수 있습니다. 이를 해결하기 위해 연구자들은 Temporal Shift Module (TSM)과 같은 효율적인 아키텍처를 개발하고, NVIDIA TensorRT와 같은 최적화 도구를 활용하여 실시간 추론을 구현하고 있습니다.
향후 개발은 더욱 정교한 멀티모달 학습으로 나아가고 있으며, 여기서 모델은 오디오 단서(예: 사이렌 소리)와 텍스트 맥락을 통합하여 더욱 깊이 있는 이해를 달성합니다. Ultralytics Platform과 같은 플랫폼도 복잡한 비디오 데이터셋의 어노테이션 및 관리를 간소화하는 방향으로 발전하고 있어, 특정 시간적 작업을 위한 커스텀 모델을 더욱 쉽게 학습할 수 있도록 지원합니다.









