4D Gaussian Splatting
4D Gaussian Splatting이 동적 장면의 실시간 포토리얼리스틱 렌더링을 구현하는 방법을 알아보세요. Ultralytics YOLO26을 사용해 움직이는 객체를 분리하는 방법을 학습할 수 있습니다.
4D 가우시안 스플래팅은 컴퓨터 비전 및 딥러닝 분야의 최첨단 렌더링 기법으로, 시간적(시간) 차원을 추가하여 명시적 3D 장면 표현의 원리를 확장합니다. 기존의 3D 모델링이 정적인 환경을 캡처하는 반면, 4D 가우시안 스플래팅은 동적이고 움직이는 장면을 사실적인 품질로 실시간 렌더링할 수 있도록 합니다. 시간의 흐름에 따라 객체와 환경이 변형되고 이동하는 방식을 모델링함으로써, 이 기술은 정적 이미지와 실감 나는 비디오 합성 사이의 간극을 해소하며 높은 프레임 속도에서 전례 없는 시각적 충실도를 제공합니다.
관련 렌더링 기법과의 차이점#
이 개념을 이해하려면 밀접하게 관련된 새로운 시점 합성 방법과 비교해 보는 것이 도움이 됩니다. 표준 3D 가우시안 스플래팅은 수백만 개의 정적인 타원체 형태 분포를 사용하여 장면을 표현합니다. 4D 변형은 시간에 종속된 특성을 도입하여 이러한 타원체가 여러 프레임에 걸쳐 이동하고 회전하며 크기를 조정할 수 있도록 합니다.
또한 모든 픽셀의 빛과 색상을 암시적으로 계산하기 위해 심층 신경망에 의존하는 신경 방사 필드(NeRF)와 달리, 4D 가우시안 스플래팅은 공간과 시간에서 점의 위치를 명시적으로 계산합니다. 이러한 명시적 래스터화는 일반적으로 컴퓨터 그래픽 렌더링과 관련된 계산 오버헤드를 크게 줄여 동적 장면을 훨씬 빠르게 렌더링할 수 있도록 합니다.
4D 가우시안 스플래팅의 작동 방식#
이 아키텍처는 연속적인 수학 함수를 사용하여 특정 타임스탬프에서 각 가우시안의 상태를 추적합니다. 최적화 과정에서는 머신러닝 알고리즘이 시간적 변형 필드와 함께 공간 좌표(X, Y, Z) 및 색상 값을 업데이트합니다. 연구자들은 이러한 시간 모델을 학습하는 데 필요한 복잡한 역전파를 처리하기 위해 공식 PyTorch 문서 또는 TensorFlow 가이드에 문서화된 기본 라이브러리를 자주 활용합니다.
시스템은 렌더링된 출력과 정답 비디오 시퀀스 간의 차이를 최소화합니다. arXiv와 같은 학술 아카이브 및 ACM 디지털 라이브러리에 발표된 최근 연구 성과에 따르면, 정적 배경과 동적 전경 요소를 분리하면 학습 안정성이 크게 향상됩니다.
실제 AI 및 ML 활용 사례#
- 몰입형 가상 현실(VR): 4D 가우시안 스플래팅은 VR 및 증강 현실을 위한 동적인 인간 퍼포먼스를 캡처하는 데 널리 사용됩니다. 제작자는 번거로운 모션 캡처 슈트에 의존하는 대신 여러 각도에서 배우를 촬영하고, 해당 퍼포먼스를 완전히 탐색할 수 있는 자유 시점 비디오로 생성할 수 있습니다.
- 자율주행 차량 및 로보틱스: 자율주행 차량은 주변 환경을 견고하게 이해해야 합니다. 움직이는 보행자와 차량을 포함한 동적 도로 장면을 재구성하면, 엔지니어는 실제 환경에 배포하기 전에 자율주행 내비게이션 모델을 안전하게 테스트할 수 있는 매우 사실적인 시뮬레이션을 만들 수 있습니다.
4D 재구성을 위한 데이터 준비#
고품질 4D 장면을 생성하는 데 있어 중요한 단계는 정적 배경에서 움직이는 객체를 분리하는 것입니다. 개발자는 스플래팅 프로세스를 시작하기 전에 동적 마스크를 생성하기 위해 객체 추적 및 인스턴스 세그멘테이션을 자주 사용합니다.
Ultralytics YOLO26 모델을 사용하면 비디오에서 움직이는 객체를 쉽게 추적하고 분리할 수 있습니다. 다음 코드는 전처리 워크플로에서 이를 실행하는 방법을 보여줍니다:
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 object detection model
model = YOLO("yolo26n.pt")
# Run real-time tracking on a dynamic scene video to isolate moving subjects
results = model.track(source="dynamic_scene.mp4", show=True, save=True)최신 생성형 AI 워크플로를 활용하면 팀은 녹화한 비디오와 어노테이션을 Ultralytics Platform에 직접 업로드하여 데이터셋을 효율적으로 관리할 수 있습니다. 그런 다음 모델 학습 팁을 적용하면 최종 바운딩 박스가 동적 요소를 정확히 마스킹하여 깨끗한 4D 장면 생성을 위한 기반을 마련할 수 있습니다. Google DeepMind 및 OpenAI와 같은 조직의 최신 연구에 따르면, 객체 인식 공간 마스킹을 통합하는 방식은 시간적 시점 합성에서 표준적인 모범 사례가 되고 있습니다.






