4D Gaussian Splatting
4D Gaussian Splatting ergänzt 3D-Gaußszenen um die Zeit und rendert bewegte Inhalte in Echtzeit fotorealistisch. Der Beitrag behandelt die Funktionsweise, Anwendungen und Datenaufbereitung.
4D Gaussian Splatting ist eine hochmoderne Renderingtechnik in der Computervision und im Deep Learning, die die Prinzipien expliziter 3D-Szenenrepräsentation um eine zeitliche Dimension erweitert. Während herkömmliche 3D-Modellierung statische Umgebungen erfasst, ermöglicht 4D Gaussian Splatting das fotorealistische Echtzeit-Rendering dynamischer, bewegter Szenen. Indem die Verformung und Bewegung von Objekten und Umgebungen im Zeitverlauf modelliert wird, schließt diese Technik die Lücke zwischen statischen Bildern und lebensechter Videosynthese und bietet bei hohen Bildraten eine beispiellose visuelle Detailtreue.
Von verwandten Renderingtechniken abgrenzen#
Zum Verständnis dieses Konzepts ist ein Vergleich mit eng verwandten Methoden der Synthese neuer Ansichten hilfreich. Das herkömmliche 3D Gaussian Splatting stellt eine Szene mithilfe von Millionen statischer, ellipsoidförmiger Verteilungen dar. Die 4D-Variante ergänzt zeitabhängige Attribute, sodass sich diese Ellipsoide über mehrere Frames hinweg bewegen, drehen und skalieren lassen.
Anders als Neural Radiance Fields (NeRF), die sich auf neuronale Netze stützen, um Licht und Farbe für jedes Pixel implizit zu berechnen, bestimmt 4D Gaussian Splatting die Position von Punkten in Raum und Zeit explizit. Diese explizite Rasterisierung verringert den Rechenaufwand, der üblicherweise mit dem Rendern von Computergrafiken verbunden ist, drastisch und ermöglicht so ein deutlich schnelleres Rendern dynamischer Szenen.
So funktioniert 4D Gaussian Splatting#
Die Architektur beruht auf stetigen mathematischen Funktionen, mit denen sich der Zustand jeder Gauß-Verteilung zu jedem beliebigen Zeitpunkt bestimmen lässt. Während des Optimierungsprozesses aktualisieren Algorithmen des maschinellen Lernens die räumlichen Koordinaten (X, Y, Z) und Farbwerte gemeinsam mit einem zeitlichen Verformungsfeld. Forschende erstellen diese Modelle üblicherweise mit Frameworks wie PyTorch oder TensorFlow, die die für das Training der zeitlichen Parameter erforderliche Rückpropagierung übernehmen.
Das System minimiert den Unterschied zwischen der gerenderten Ausgabe und der Video-Referenzsequenz. Jüngste Durchbrüche, die in wissenschaftlichen Archiven wie arXiv und der digitalen Bibliothek der ACM veröffentlicht wurden, zeigen, dass eine Trennung des statischen Hintergrunds von dynamischen Vordergrundelementen die Trainingsstabilität erheblich verbessert.
Anwendungen in KI und ML in der Praxis#
- Immersive virtuelle Realität (VR): 4D Gaussian Splatting wird häufig eingesetzt, um dynamische menschliche Bewegungen für VR und erweiterte Realität zu erfassen. Anstatt umständliche Bewegungserfassungsanzüge zu verwenden, können Kreative eine Person aus mehreren Blickwinkeln aufnehmen und daraus ein vollständig navigierbares Video der Darbietung mit freier Blickpunktwahl erzeugen.
- Autonome Fahrzeuge und Robotik: Selbstfahrende Autos benötigen ein zuverlässiges Verständnis ihrer Umgebung. Durch die Rekonstruktion dynamischer Straßenszenen – einschließlich sich bewegender Fußgänger und des Verkehrs – können Fachleute äußerst realistische Simulationen erstellen, um Modelle für autonome Navigation vor ihrem Einsatz in der realen Welt sicher zu testen.
Daten für die 4D-Rekonstruktion vorbereiten#
Ein wichtiger Schritt zur Erstellung hochwertiger 4D-Szenen ist die Isolierung bewegter Objekte vom statischen Hintergrund. Entwickler verwenden häufig Objektverfolgung und Instanzsegmentierung, um dynamische Masken zu erstellen, bevor das Splatting beginnt.
Mit einem Segmentierungsmodell Ultralytics YOLO26 kannst du sich bewegende Objekte in einem Video verfolgen und für jedes Bild segmentweise Masken erzeugen. Der folgende Code zeigt diesen Vorverarbeitungsschritt:
from ultralytics import YOLO
# YOLO26-Modell für die Instanzsegmentierung laden
model = YOLO("yolo26n-seg.pt")
# Sich bewegende Objekte in einem dynamischen Szenenvideo verfolgen und für jedes Objekt in jedem Bild eine Maske erzeugen
results = model.track(source="dynamic_scene.mp4", show=True, save=True)Teams können ihre aufgezeichneten Videos und Annotationen auf die Ultralytics Platform hochladen, um Datensätze zu verwalten und benutzerdefinierte Modelle zu trainieren. Anschließend lässt sich mithilfe von Tipps zum Modelltraining die Trennung der dynamischen Elemente vom statischen Hintergrund durch die erzeugten Masken verbessern, bevor die 4D-Szene erstellt wird.










