Gaussian Splatting
Explora Gaussian Splatting para reconstruir escenas 3D fotorrealistas. Aprende cómo permite el renderizado en tiempo real y se integra con Ultralytics YOLO26 para aplicaciones de visión.
Gaussian Splatting es una técnica moderna de rasterización utilizada en gráficos por ordenador y visión por ordenador para reconstruir escenas 3D fotorrealistas a partir de un conjunto de imágenes 2D. A diferencia del modelado 3D tradicional, que depende de mallas poligonales, o de avances recientes de la IA como los campos de radiancia neuronales (NeRF), que utilizan redes neuronales para aproximar una escena, Gaussian Splatting representa una escena como un conjunto de millones de distribuciones gaussianas 3D (elipsoides). Este método permite renderizar en tiempo real con altas frecuencias de fotogramas (a menudo superiores a 100 FPS) manteniendo una fidelidad visual excepcional, lo que resuelve un importante cuello de botella de rendimiento presente en métodos anteriores de síntesis de vistas.
Cómo funciona Gaussian Splatting#
La idea fundamental consiste en representar el espacio 3D de forma explícita en lugar de implícita. En un flujo de trabajo típico, el proceso comienza con una nube de puntos dispersa generada a partir de un conjunto de fotografías mediante una técnica denominada estructura a partir del movimiento (SfM). Cada punto de esta nube se inicializa entonces como una gaussiana 3D.
Durante el proceso de entrenamiento, el sistema optimiza varios parámetros para cada gaussiana:
- Posición: Las coordenadas 3D (X, Y, Z) de la escena.
- Covarianza: Determina la forma y la rotación del elipsoide (por ejemplo, cuánto se estira o se inclina el «splat»).
- Opacidad: El grado de transparencia o solidez con el que aparece la gaussiana (valor alfa).
- Color: Se representa mediante armónicos esféricos, lo que permite que el color cambie según el ángulo de visión y captura reflejos y efectos de iluminación realistas.
El término «splatting» hace referencia al proceso de rasterización, en el que estas gaussianas 3D se proyectan —o se «esparcen»— sobre el plano 2D de la cámara para formar una imagen. Esta proyección es totalmente diferenciable, lo que significa que se pueden utilizar algoritmos estándar de descenso de gradiente para minimizar la diferencia entre la imagen renderizada y la fotografía original de referencia.
Gaussian Splatting frente a NeRF#
Aunque ambas técnicas pretenden generar vistas nuevas de una escena, difieren fundamentalmente en su arquitectura y rendimiento. NeRF (campos de radiancia neuronales) codifica una escena en los pesos de una red neuronal. Renderizar un NeRF requiere consultar esta red millones de veces en cada fotograma (recorrido de rayos), lo que resulta costoso y lento desde el punto de vista computacional.
En cambio, Gaussian Splatting utiliza una representación explícita (la lista de gaussianas). Esto le permite utilizar una rasterización eficiente basada en teselas, similar a la forma en que los videojuegos renderizan los gráficos. Por consiguiente, Gaussian Splatting es significativamente más rápido de entrenar y renderizar que los NeRF, lo que lo hace más viable para aplicaciones de consumo y la inferencia en tiempo real.
Aplicaciones en el mundo real#
La velocidad y la calidad de Gaussian Splatting han abierto nuevas posibilidades en diversos sectores:
- Turismo virtual e inmobiliario: Los creadores pueden capturar un museo, un lugar histórico o una casa en venta utilizando un dron o un smartphone. Gaussian Splatting permite a los usuarios remotos explorar estos espacios en realidad virtual (VR) con 6 grados de libertad (6DoF), apreciando detalles sutiles como los reflejos en suelos de madera que la fotogrametría tradicional podría pasar por alto.
- Simulación automovilística: Las empresas que desarrollan vehículos autónomos necesitan grandes cantidades de datos para probar sus algoritmos de percepción. Gaussian Splatting puede reconstruir manzanas urbanas del mundo real a partir de datos de sensores, creando un entorno de simulación fotorrealista. En estos entornos, los modelos de visión como Ultralytics YOLO26 se pueden probar para garantizar que identifican correctamente los peligros en escenarios 3D complejos.
Preprocesamiento para Splatting con visión por ordenador#
Para que Gaussian Splatting funcione eficazmente, las imágenes de entrenamiento normalmente deben ser estáticas. Los objetos en movimiento (como peatones o coches) de las fotografías de origen pueden provocar artefactos denominados «flotadores». Las canalizaciones avanzadas utilizan la segmentación de instancias para enmascarar automáticamente estos elementos dinámicos antes de entrenar el modelo de splatting.
La Ultralytics Platform permite a los equipos gestionar conjuntos de datos y entrenar modelos que pueden ayudar en esta fase de preprocesamiento. Así se podría utilizar un modelo de segmentación para crear máscaras para un conjunto de datos destinado a la reconstrucción 3D:
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image from the scan dataset
# Class 0 is 'person' in COCO - we mask them out to keep the scene static
results = model.predict("scan_frame_001.jpg", classes=[0])
# Save the generated mask to exclude the person from the 3D reconstruction
for result in results:
result.save_masks("scan_frame_001_mask.png")Importancia en la IA y tendencias futuras#
Gaussian Splatting representa un cambio en la visión por ordenador hacia métodos híbridos que combinan la capacidad de aprendizaje del aprendizaje profundo con la eficiencia de los gráficos por ordenador clásicos. Esta técnica evoluciona rápidamente, y los investigadores exploran formas de comprimir el tamaño de los archivos (que puede ser considerable) e integrarla con la IA generativa para crear activos 3D a partir de indicaciones de texto. A medida que los aceleradores de hardware, como las GPU, sigan mejorando, es probable que Gaussian Splatting se convierta en el estándar para capturar y renderizar el mundo real en formato digital.









