4D Gaussian Splatting
4D Gaussian Splatting добавляет время к 3D-сценам из гауссиан, позволяя фотореалистично отображать движущийся контент в реальном времени. Рассматриваются принцип работы, области применения и подготовка данных.
4D Gaussian Splatting — это передовой метод рендеринга в областях компьютерного зрения и глубокого обучения, который расширяет принципы явного представления 3D-сцен за счёт добавления временного измерения. Если традиционное 3D-моделирование описывает статичные среды, то 4D Gaussian Splatting обеспечивает фотореалистичный рендеринг динамичных движущихся сцен в реальном времени. Моделируя деформации и перемещения объектов и среды во времени, эта технология устраняет разрыв между статичными изображениями и реалистичным синтезом видео и обеспечивает беспрецедентную визуальную точность при высокой частоте кадров.
Отличия от родственных методов рендеринга#
Чтобы понять эту концепцию, полезно сравнить её с близкими методами синтеза новых ракурсов. Стандартный 3D Gaussian Splatting представляет сцену с помощью миллионов статичных распределений эллипсоидной формы. В 4D-варианте добавлены атрибуты, зависящие от времени, благодаря чему эллипсоиды могут перемещаться, вращаться и масштабироваться в разных кадрах.
Кроме того, в отличие от полей нейронного излучения (NeRF), которые используют глубокие нейронные сети для неявного вычисления света и цвета каждого пикселя, при 4D Gaussian Splatting положение точек в пространстве и времени вычисляется явно. Такая явная растеризация значительно сокращает вычислительные затраты, обычно связанные с рендерингом компьютерной графики, и позволяет намного быстрее визуализировать динамические сцены.
Принцип работы 4D Gaussian Splatting#
Архитектура опирается на непрерывные математические функции, позволяющие отслеживать состояние каждой гауссовой точки в любой момент времени. В процессе оптимизации алгоритмы машинного обучения обновляют пространственные координаты (X, Y, Z) и значения цвета, а также поле временной деформации. Исследователи обычно создают такие модели во фреймворках вроде PyTorch или TensorFlow, которые выполняют обратное распространение ошибки, необходимое для обучения временных параметров.
Система минимизирует разницу между полученным изображением и исходной видеопоследовательностью. Недавние прорывы, опубликованные в научных архивах, таких как arXiv, и цифровой библиотеке ACM, показали, что отделение статичного фона от динамичных объектов переднего плана значительно повышает стабильность обучения.
Применение ИИ и машинного обучения в реальном мире#
- Иммерсивная виртуальная реальность (VR): 4D Gaussian Splatting широко применяется для захвата динамичных выступлений людей в виртуальной и дополненной реальности. Вместо громоздких костюмов для захвата движения создатели могут снимать актёра с нескольких ракурсов и создавать полностью просматриваемое со свободной точки видео выступления.
- Автономные транспортные средства и робототехника: беспилотным автомобилям необходимо надёжно понимать окружающую обстановку. Реконструируя динамичные уличные сцены, включая движущихся пешеходов и транспорт, инженеры могут создавать реалистичные симуляции для безопасного тестирования моделей автономной навигации перед развёртыванием в реальных условиях.
Подготовка данных для 4D-реконструкции#
Ключевой этап создания качественных 4D-сцен — отделение движущихся объектов от статичного фона. Перед началом сплаттинга разработчики часто используют отслеживание объектов и сегментацию экземпляров, чтобы создать динамические маски.
С помощью модели сегментации Ultralytics YOLO26 можно отслеживать движущиеся объекты в видео и создавать для них маски на каждом кадре. Ниже показан этот этап предварительной обработки:
from ultralytics import YOLO
# Загрузить модель сегментации экземпляров YOLO26
model = YOLO("yolo26n-seg.pt")
# Отслеживать движущиеся объекты в видео с динамичной сценой и создавать маску для каждого объекта на каждом кадре
results = model.track(source="dynamic_scene.mp4", show=True, save=True)Команды могут загрузить записанные видео и аннотации на платформу Ultralytics, чтобы управлять наборами данных и обучать собственные модели. Применение рекомендаций по обучению моделей помогает добиться более четкого отделения динамических элементов масками от статичного фона перед созданием 4D-сцены.










