4D Gaussian Splatting
Le 4D Gaussian Splatting ajoute le temps aux scènes gaussiennes 3D et restitue en temps réel des contenus en mouvement avec un réalisme photographique. Présente son fonctionnement, ses usages et la préparation des données.
Le Gaussian Splatting 4D est une technique de rendu de pointe en vision par ordinateur et en apprentissage profond qui étend les principes de représentation explicite des scènes 3D en ajoutant une dimension temporelle. Alors que la modélisation 3D traditionnelle capture des environnements statiques, le Gaussian Splatting 4D permet le rendu photoréaliste en temps réel de scènes dynamiques en mouvement. En modélisant la déformation et le déplacement des objets et des environnements au fil du temps, cette technologie fait le lien entre l’imagerie statique et la synthèse vidéo réaliste, offrant une fidélité visuelle sans précédent à des fréquences d’images élevées.
Distinguer cette technique des méthodes de rendu apparentées#
Pour comprendre ce concept, il est utile de le comparer aux méthodes apparentées de synthèse de nouvelles vues. Le Gaussian Splatting 3D standard représente une scène à l’aide de millions de distributions statiques en forme d’ellipsoïde. La variante 4D ajoute des attributs dépendant du temps, qui permettent à ces ellipsoïdes de se déplacer, de tourner et de changer d’échelle sur plusieurs images.
De plus, contrairement aux champs de radiance neuronaux (NeRF), qui s’appuient sur des réseaux neuronaux profonds pour calculer implicitement la lumière et la couleur de chaque pixel, le Gaussian Splatting 4D calcule explicitement la position des points dans l’espace et le temps. Cette rastérisation explicite réduit fortement la surcharge de calcul normalement associée au rendu graphique par ordinateur, ce qui permet de rendre les scènes dynamiques beaucoup plus rapidement.
Fonctionnement du Gaussian Splatting 4D#
L’architecture s’appuie sur des fonctions mathématiques continues pour suivre l’état de chaque gaussienne à un instant donné. Pendant l’optimisation, les algorithmes d’apprentissage automatique mettent à jour les coordonnées spatiales (X, Y, Z) et les valeurs de couleur, ainsi qu’un champ de déformation temporelle. Les chercheurs construisent généralement ces modèles avec des frameworks comme PyTorch ou TensorFlow, qui prennent en charge la rétropropagation nécessaire à l’entraînement des paramètres temporels.
Le système minimise l’écart entre le résultat rendu et la séquence vidéo de référence. Des avancées récentes publiées dans des archives scientifiques comme arXiv et la bibliothèque numérique de l’ACM montrent que la séparation de l’arrière-plan statique des éléments dynamiques au premier plan améliore considérablement la stabilité de l’entraînement.
Applications concrètes de l’IA et du ML#
- Réalité virtuelle immersive (VR) : Le Gaussian Splatting 4D est largement utilisé pour capturer des performances humaines dynamiques destinées à la réalité virtuelle et à la réalité augmentée. Au lieu d’utiliser de lourdes combinaisons de capture de mouvement, les créateurs peuvent filmer un acteur sous plusieurs angles et générer une vidéo de sa performance navigable depuis n’importe quel point de vue.
- Véhicules autonomes et robotique : Les voitures autonomes doivent comprendre leur environnement de façon robuste. En reconstruisant des scènes de rue dynamiques — notamment les piétons en mouvement et la circulation —, les ingénieurs peuvent créer des simulations très réalistes pour tester en toute sécurité les modèles de navigation autonome avant leur déploiement dans le monde réel.
Préparer les données pour la reconstruction 4D#
Une étape essentielle de la génération de scènes 4D de haute qualité consiste à isoler les objets en mouvement de l’arrière-plan statique. Avant le début du processus de splatting, les développeurs utilisent souvent le suivi d’objets et la segmentation d’instances pour créer des masques dynamiques.
Tu peux suivre des objets en mouvement dans une vidéo et générer des masques pour chacun d’eux, image par image, avec un modèle de segmentation Ultralytics YOLO26. Le code suivant montre cette étape de prétraitement :
from ultralytics import YOLO
# Charger un modèle de segmentation d’instances YOLO26
model = YOLO("yolo26n-seg.pt")
# Suivre les sujets en mouvement dans une vidéo de scène dynamique et produire un masque pour chaque objet dans chaque image
results = model.track(source="dynamic_scene.mp4", show=True, save=True)Les équipes peuvent téléverser leurs vidéos enregistrées et leurs annotations sur l’Ultralytics Platform pour gérer les jeux de données et entraîner des modèles personnalisés. L’application de conseils d’entraînement des modèles améliore ensuite la séparation des éléments dynamiques et de l’arrière-plan statique par les masques obtenus, avant la génération de la scène 4D.










