Stereo Vision
Entdecke, wie Stereo Vision 3D-Tiefeninformationen für KI erfasst. Erfahre, wie die Technologie funktioniert, wo sie eingesetzt wird und wie du sie mit dem neuesten Ultralytics YOLO26 integrierst.
Stereoskopisches Sehen, auch als stereoskopisches Sehen bezeichnet, ist eine Computer-Vision-Technik zur Gewinnung von 3D-Tiefeninformationen aus digitalen Bildern. Durch den Vergleich zweier oder mehrerer 2D-Bilder derselben Szene, die aus leicht unterschiedlichen Blickwinkeln aufgenommen wurden – ähnlich dem menschlichen binokularen Sehen –, können KI-Systeme Entfernungen zu Objekten präzise berechnen. Diese Fähigkeit ist grundlegend für räumliche Intelligenz und ermöglicht Maschinen, sich in ihrer Umgebung zu bewegen und sicher mit physischen Objekten zu interagieren.
So funktioniert stereoskopisches Sehen#
Bei diesem Verfahren werden die Unterschiede zwischen der linken und der rechten Kameraansicht ermittelt. Die zentrale Herausforderung ist das Korrespondenzproblem: Dabei müssen in beiden Bildern exakt dieselben Pixel oder Merkmale identifiziert werden. Sobald die passenden Punkte gefunden sind, berechnet das System die horizontale Verschiebung und erstellt eine Disparitätskarte.
In einer Disparitätskarte weisen größere Verschiebungen auf näher gelegene Objekte hin, während kleinere Verschiebungen bedeuten, dass das Objekt weiter entfernt ist. Mithilfe der Triangulation wird diese Karte anschließend in eine dichte 3D-Punktwolke umgewandelt. Früher dominierten traditionelle mathematische Algorithmen diese Berechnungen. Moderne Ansätze setzen jedoch zunehmend auf Faltungsneuronale Netze (CNNs) und Deep Learning, um den Merkmalsabgleich bei komplexen Lichtverhältnissen oder texturarmen Bereichen zu verbessern, wie aktuelle IEEE-Forschung zur Computer Vision ausführlich beschreibt.
Stereoskopisches Sehen im Vergleich zur monokularen Tiefenschätzung#
Es ist wichtig, stereoskopisches Sehen von Tiefenschätzungsverfahren zu unterscheiden, die nur eine Kamera verwenden. Bei der monokularen Tiefenschätzung sagen Deep-Learning-Modelle anhand visueller Hinweise wie Perspektive und Schattierung 3D-Strukturen aus einem einzelnen 2D-Bild voraus. Stereoskopische Systeme messen die Tiefe dagegen direkt anhand der geometrischen Beziehung zwischen zwei Kameraobjektiven. Monokulare Verfahren benötigen zwar weniger Rechenleistung, stereoskopisches Sehen liefert jedoch in der Regel präzisere Tiefenmessungen in Echtzeit, die für sicherheitskritische Systeme unverzichtbar sind.
KI-Anwendungen in der Praxis#
Stereoskopische Systeme sind in verschiedenen Branchen unverzichtbar, in denen reale 3D-Objekterkennung und räumliches Bewusstsein gefragt sind.
- Navigation für autonomes Fahren: Technologien für selbstfahrende Fahrzeuge, die von Unternehmen wie Waymo entwickelt werden, nutzen Stereokameras, um Entfernungen zu Fußgängern, anderen Fahrzeugen und Hindernissen in Echtzeit präzise einzuschätzen. Diese genauen Tiefendaten fließen in Systeme zur Vorhersagemodellierung ein, die sichere Routen planen.
- Automatisierung in der Industrierobotik: Fertigungsroboter nutzen stereoskopisches Sehen für komplexe Aufgaben beim Greifen von Teilen aus Behältern. Indem sie die genaue Tiefe und Ausrichtung verstreuter Teile auf einem Förderband berechnen, können Robotersysteme ihre Greifer präzise ausrichten und so die Effizienz in intelligenten Fertigungsabläufen steigern.
- Fortschrittliche medizinische Bildgebung: Operationsroboter und Diagnosesysteme nutzen stereoskopische Kameras, um Chirurgen bei minimalinvasiven Eingriffen eine hochpräzise 3D-Ansicht der Patientenanatomie zu bieten. Dieser Trend wird häufig in aktuellen arXiv-Vorabveröffentlichungen zu medizinischer KI hervorgehoben.
KI mit Stereodaten integrieren#
Entwickler kombinieren stereoskopisches Sehen häufig mit Objekterkennung, um sowohl das Was als auch das Wie weit entfernt zu bestimmen. Das OpenCV-Framework wird häufig zur Erstellung von Disparitätskarten verwendet und oft in umfassendere PyTorch- oder TensorFlow-Pipelines integriert, während KI-Modelle die Wahrnehmung übernehmen. Unten siehst du ein konzeptionelles Beispiel, bei dem Objekte mit Ultralytics YOLO26 erkannt und ihre Begrenzungsrahmen abgerufen werden. Diese könnten anschließend dazu dienen, durchschnittliche Entfernungswerte aus einer zugehörigen OpenCV-Disparitätskarte auszulesen.
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific regionFortschritte und künftige Entwicklungen#
Das Training und die Bereitstellung fortschrittlicher Wahrnehmungsmodelle sind deutlich einfacher geworden. Mit Tools wie der Ultralytics Platform können Teams Stereobildpaare sicher annotieren, robuste Modelle trainieren und sie für Inferenz mit niedriger Latenz auf Edge-KI-Geräten in optimierte Formate wie TensorRT exportieren.
Neuere Entwicklungen von Organisationen wie dem Stanford Vision and Learning Lab zeigen einen wachsenden Trend, stereoskopisches Sehen mit Vision-Transformern (ViT) und Basismodellen von Google DeepMind zu verbinden, um das Korrespondenzproblem schneller zu lösen. Mit der Weiterentwicklung multimodaler KI-Modelle führender Unternehmen wie Anthropic und OpenAI wird die Integration robuster räumlicher 3D-Daten die Möglichkeiten verkörperter KI-Agenten, ihre Umgebung wahrzunehmen und zu verstehen, weiter ausbauen.










