4D Gaussian Splatting
Gaussian Splatting 4D añade el tiempo a las escenas gaussianas 3D y renderiza contenido en movimiento de forma fotorrealista y en tiempo real. Repasa cómo funciona, sus usos y la preparación de datos.
La representación gaussiana por salpicadura 4D es una técnica de renderizado puntera en visión artificial y aprendizaje profundo que amplía los principios de representación explícita de escenas 3D al añadir una dimensión temporal. Mientras que el modelado 3D tradicional captura entornos estáticos, la representación gaussiana por salpicadura 4D permite renderizar escenas dinámicas y en movimiento con fotorrealismo y en tiempo real. Al modelar cómo se deforman y desplazan los objetos y los entornos con el paso del tiempo, esta tecnología salva la distancia entre las imágenes estáticas y la síntesis de vídeo realista, y ofrece una fidelidad visual sin precedentes con altas frecuencias de imagen.
Diferencias con técnicas de renderizado relacionadas#
Para comprender este concepto, resulta útil compararlo con métodos estrechamente relacionados de síntesis de vistas nuevas. La representación gaussiana por salpicadura 3D estándar representa una escena mediante millones de distribuciones estáticas con forma elipsoidal. La variante 4D incorpora atributos dependientes del tiempo, lo que permite que estos elipsoides se muevan, giren y cambien de escala entre fotogramas.
Además, a diferencia de los campos de radiancia neuronal (NeRF), que se basan en redes neuronales profundas para calcular implícitamente la luz y el color de cada píxel, la Gaussian Splatting 4D calcula explícitamente la posición de los puntos en el espacio y el tiempo. Esta rasterización explícita reduce drásticamente la sobrecarga computacional que suele asociarse al renderizado de gráficos por ordenador, lo que permite renderizar escenas dinámicas mucho más rápido.
Cómo funciona la representación gaussiana por salpicadura 4D#
La arquitectura se basa en funciones matemáticas continuas para seguir el estado de cada gaussiana en cualquier instante. Durante el proceso de optimización, los algoritmos de aprendizaje automático actualizan las coordenadas espaciales (X, Y, Z) y los valores de color, junto con un campo de deformación temporal. Los investigadores suelen crear estos modelos con marcos como PyTorch o TensorFlow, que gestionan la retropropagación necesaria para entrenar los parámetros temporales.
El sistema minimiza la diferencia entre la salida renderizada y la secuencia de vídeo de referencia. Los avances recientes publicados en repositorios académicos como arXiv y la Biblioteca Digital de ACM han demostrado que separar el fondo estático de los elementos dinámicos del primer plano mejora considerablemente la estabilidad del entrenamiento.
Aplicaciones reales de IA y aprendizaje automático#
- Realidad virtual inmersiva (VR): La representación gaussiana por salpicadura 4D se utiliza ampliamente para capturar actuaciones humanas dinámicas destinadas a la realidad virtual y aumentada. En lugar de recurrir a incómodos trajes de captura de movimiento, los creadores pueden grabar a un actor desde varios ángulos y generar un vídeo de la actuación totalmente navegable y con punto de vista libre.
- Vehículos autónomos y robótica: Los coches autónomos necesitan comprender su entorno de forma fiable. Al reconstruir escenas urbanas dinámicas —incluidos peatones y tráfico en movimiento—, los ingenieros pueden crear simulaciones muy realistas para probar de forma segura modelos de navegación autónoma antes de implementarlos en el mundo real.
Preparación de datos para la reconstrucción 4D#
Un paso fundamental para generar escenas 4D de gran calidad es aislar los objetos en movimiento del fondo estático. Los desarrolladores suelen utilizar la asociación de objetos y la segmentación de instancias para crear máscaras dinámicas antes de iniciar el proceso de salpicadura.
Puedes seguir objetos en movimiento en un vídeo y generar máscaras para cada fotograma con un modelo de segmentación de Ultralytics YOLO26. El siguiente código muestra este paso de preprocesamiento:
from ultralytics import YOLO
# Carga un modelo de segmentación de instancias YOLO26
model = YOLO("yolo26n-seg.pt")
# Sigue a los sujetos en movimiento en un vídeo de una escena dinámica y genera una máscara para cada objeto en cada fotograma
results = model.track(source="dynamic_scene.mp4", show=True, save=True)Los equipos pueden subir sus vídeos grabados y anotaciones a la Ultralytics Platform para gestionar conjuntos de datos y entrenar modelos personalizados. A continuación, aplicar consejos para entrenar modelos permite mejorar la separación de los elementos dinámicos respecto del fondo estático en las máscaras resultantes, antes de generar la escena 4D.










