Was ist monokulare Tiefenschätzung? Ein Überblick
Erfahre, wie die monokulare Tiefenschätzung funktioniert, wie sie sich von sensorbasierten Tiefenmethoden unterscheidet und wie sie skalierbare 3D-Wahrnehmung in Vision-Systemen ermöglicht.

Selbstfahrende Autos sind darauf ausgelegt, zu verstehen, was in ihrer Umgebung geschieht, damit sie sicher fahren können. Das bedeutet, mehr zu leisten, als einfach nur Objekte wie Fußgänger oder andere Fahrzeuge zu erkennen.
Sie müssen außerdem wissen, wie weit diese Objekte entfernt sind, um richtig reagieren zu können. Maschinen dieses Entfernungsverständnis zu vermitteln, ist jedoch nicht einfach. Anders als Menschen nehmen sie Tiefe aus Bildern nicht von selbst wahr und müssen dies ausdrücklich lernen.
Ein Grund dafür ist, dass die meisten Kameras die Welt als flache, zweidimensionale Bilder aufnehmen. Diese Bilder in etwas umzuwandeln, das die tatsächliche Tiefe und 3D-Struktur der Welt widerspiegelt, ist schwierig, insbesondere wenn Systeme unter alltäglichen Bedingungen zuverlässig funktionieren müssen.
Interessanterweise ermöglicht Computer Vision, ein Bereich der KI, der sich auf die Interpretation und das Verständnis visueller Daten konzentriert, Maschinen, die Welt anhand von Bildern besser zu verstehen. Die monokulare Tiefenschätzung ist beispielsweise eine Computer-Vision-Technik, die die Entfernung von Objekten anhand des Bildes einer einzigen Kamera schätzt.
Indem sie visuelle Hinweise wie Objektgröße, Perspektive, Textur und Schattierung lernen, können diese Modelle die Tiefe vorhersagen, ohne auf zusätzliche Sensoren wie LiDAR (Lichtdetektion und Entfernungsmessung) oder Stereokameras angewiesen zu sein. In diesem Artikel sehen wir uns an, was monokulare Tiefenschätzung ist, wie sie funktioniert und welche praktischen Anwendungen es gibt. Legen wir los!
Eine kurze Einführung in die monokulare Tiefenschätzung#
Die monokulare Tiefenschätzung ermöglicht es einer Maschine, anhand eines einzigen Bildes zu verstehen, wie weit Objekte von ihr entfernt sind. Da sie nur auf einer einzigen Kamera beruht, bietet dieser Ansatz mehrere Vorteile, darunter geringere Kosten und einfachere Hardwareanforderungen.
Sie kann beispielsweise in kostengünstigen Haushaltsrobotern eingesetzt werden, die mit einer einzigen Kamera arbeiten. Selbst anhand eines einzigen Bildes kann das Robotersystem erkennen, welche Wände näher und welche Türen weiter entfernt sind, und die räumliche Tiefe insgesamt ableiten.
Ein einzelnes Bild enthält häufig keine Informationen im richtigen Maßstab, daher konzentriert sich die monokulare Tiefenschätzung im Allgemeinen auf die relative Tiefe. Mit anderen Worten: Sie kann bestimmen, welche Objekte näher und welche weiter entfernt sind, selbst wenn die genauen Entfernungen unbekannt sind.
Wenn ein Modell mit Daten trainiert wird, die Referenzentfernungen oder absolute Tiefen enthalten, etwa Tiefenmessungen von Sensoren wie LiDAR, kann es lernen, Entfernungen in realen Einheiten wie Metern vorherzusagen. Ohne solche Referenzdaten kann das Modell weiterhin die relative Tiefe ableiten, aber absolute Entfernungen nicht zuverlässig schätzen.
Das Ergebnis der monokularen Tiefenschätzung ist normalerweise eine Tiefenkarte. Dabei handelt es sich um ein Bild, in dem jedes Pixel angibt, wie nah oder weit entfernt der entsprechende Teil der Szene ist. Eine Tiefenkarte vermittelt Bildverarbeitungssystemen ein grundlegendes Verständnis der 3D-Struktur ihrer Umgebung.

Abb. 1. Beispiel einer mit monokularer Tiefenschätzung erstellten vorhergesagten Tiefenkarte (Quelle)
Von Sensoren zu Bildern: Tiefen schätzen#
Die Tiefenschätzung kann je nach verfügbaren Sensoren, Hardwareeinschränkungen und Genauigkeitsanforderungen auf verschiedene Arten umgesetzt werden. Traditionelle Methoden stützen sich oft auf mehrere Perspektiven oder spezielle Sensoren, um die Entfernung direkt zu messen.
Ein gängiger Ansatz ist die Stereobildverarbeitung. Dabei wird die Tiefe durch den Vergleich zweier synchronisierter Bilder geschätzt, die aus leicht unterschiedlichen Perspektiven aufgenommen wurden. Durch die Messung des Unterschieds zwischen entsprechenden Punkten in den beiden Bildern kann das System ableiten, wie weit Objekte von der Kamera entfernt sind.
Ein weiterer Ansatz sind RGB-D-Systeme (Rot, Grün, Blau und Tiefe), die aktive Tiefensensoren verwenden, um die Entfernung an jedem Pixel direkt zu messen. Diese Systeme können in kontrollierten Umgebungen genaue Tiefeninformationen liefern, erfordern jedoch zusätzliche Hardware.
LiDAR-basierte Methoden verwenden dagegen Laserpulse, um präzise dreidimensionale Darstellungen einer Szene zu erzeugen. LiDAR-Sensoren sind zwar sehr genau, aber häufig teuer und erhöhen die Komplexität der Hardware erheblich.
Im Gegensatz dazu leitet die monokulare Tiefenschätzung die Tiefe ausschließlich aus einem einzelnen RGB-Bild ab. Da sie nicht von mehreren Kameras oder speziellen Sensoren abhängt, lässt sie sich einfacher in großem Maßstab einsetzen und eignet sich gut, wenn Kosten und Hardware-Ressourcen begrenzt sind.
Tiefe aus einem einzelnen Bild lernen#
Bei der Tiefenschätzung aus einem einzelnen Bild lernen monokulare Tiefenmodelle, visuelle Hinweise zu erkennen, die Menschen instinktiv zur Beurteilung von Entfernungen nutzen. Dazu gehören Perspektivlinien, Objektgröße, Texturdichte, Objektüberlappung und Schattierung. Sie alle geben Hinweise darauf, wie weit Objekte von der Kamera entfernt sind.
Diese Hinweise wirken zusammen und erzeugen einen Eindruck von Tiefe. Objekte, die kleiner erscheinen oder teilweise verdeckt sind, befinden sich häufig weiter entfernt, während deutlich erkennbare Details und ein größeres Erscheinungsbild meist darauf hindeuten, dass etwas näher ist.
Um diese Muster zu lernen, werden monokulare Tiefenmodelle mit umfangreichen Bilddatensätzen trainiert, die oft mit Tiefeninformationen aus anderen Quellen wie LiDAR- oder Stereosystemen kombiniert werden. Während des Trainings lernen die Modelle, wie visuelle Hinweise mit Tiefe zusammenhängen, und können so bei der Inferenz die Entfernung aus einem einzigen Bild ableiten.
Mit vielfältigen Trainingsdaten können moderne Bildverarbeitungsmodelle dieses erlernte Verständnis auf eine große Bandbreite von Umgebungen übertragen, darunter Innen- und Außenszenen, und mit unbekannten Perspektiven umgehen.
Ein Blick auf verschiedene Verfahren zur monokularen Tiefenschätzung#
Als Nächstes sehen wir uns die wichtigsten Ansätze zur Tiefenschätzung aus einem einzelnen Bild an und wie sich diese Methoden im Laufe der Zeit weiterentwickelt haben.
Klassische und geometriebasierte Ansätze#
Frühe Verfahren zur Tiefenschätzung stützten sich auf einfache visuelle Regeln im Zusammenhang mit der Kamerageometrie. Hinweise wie Perspektive, Objektgröße und die Verdeckung eines Objekts durch ein anderes wurden zur Schätzung der Entfernung verwendet.
Wenn beispielsweise zwei ähnliche Objekte in unterschiedlichen Größen erschienen, wurde angenommen, dass sich das kleinere weiter entfernt befindet. In kontrollierten Umgebungen, in denen Faktoren wie Beleuchtung, Kameraposition und Szenenaufbau konstant blieben, funktionierten diese Ansätze recht gut.
In realen Szenen versagen diese Annahmen jedoch häufig. Veränderungen der Beleuchtung, wechselnde Perspektiven und eine höhere Komplexität der Szene können zu unzuverlässigen Tiefenschätzungen führen und die Wirksamkeit klassischer Methoden in unkontrollierten Umgebungen begrenzen.
Frühe Ansätze des maschinellen Lernens#
Frühe Methoden des maschinellen Lernens machten die Tiefenschätzung flexibler, indem sie Muster direkt aus Daten lernten. Statt sich ausschließlich auf feste geometrische Regeln zu stützen, versuchten diese Modelle, den Zusammenhang zwischen visuellen Informationen und Entfernung zu lernen, und behandelten die Tiefenvorhersage als Regressionsproblem auf Grundlage von Hinweisen wie Kanten, Texturen und Farbveränderungen.
Die Auswahl dieser Merkmale war ein zentraler Bestandteil des Prozesses. Ingenieure mussten entscheiden, welche visuellen Signale extrahiert und wie sie dargestellt werden sollten, und die Leistung des Modells hing stark von diesen Entscheidungen ab.
Obwohl dieser Ansatz besser funktionierte als frühere Methoden, hatte er weiterhin Einschränkungen. Wenn den ausgewählten Merkmalen wichtiger Kontext fehlte, waren die Tiefenvorhersagen weniger genau. Mit zunehmender Komplexität und Vielfalt der Szenen hatten diese Modelle häufig Schwierigkeiten, zuverlässige Ergebnisse zu liefern.
Algorithmen des Deep Learning#
Die meisten modernen Systeme zur monokularen Tiefenschätzung verwenden Deep Learning, also neuronale Netze mit vielen Schichten, die komplexe Muster aus Daten lernen können. Diese Modelle lernen, die Tiefe direkt aus Bildern vorherzusagen, und erzeugen Tiefenkarten.
Viele Ansätze basieren auf Faltungsneuronalen Netzen (CNNs), einer Art neuronaler Netze, die Bilder verarbeitet, indem sie Muster wie Kanten und Formen erkennt. Diese Modelle verwenden häufig eine Encoder-Decoder-Struktur: Der Encoder extrahiert visuelle Merkmale aus dem Bild, und der Decoder wandelt diese Merkmale in eine Tiefenkarte um. Die Verarbeitung des Bildes auf mehreren Maßstabsebenen hilft dem Modell, den Gesamtaufbau der Szene zu erfassen und zugleich klare Objektgrenzen zu erkennen.
Neuere Modelle konzentrieren sich darauf, Beziehungen zwischen verschiedenen Teilen eines Bildes zu verstehen. Transformer-basierte Modelle und Vision-Transformer-Modelle (ViT) verwenden Aufmerksamkeitsmechanismen. Diese ermöglichen es dem Modell, die relevantesten Bildbereiche zu erkennen und entfernte Bereiche miteinander in Beziehung zu setzen. Dadurch kann das Modell ein konsistenteres Verständnis der Tiefe in der gesamten Szene aufbauen.
Einige Systeme kombinieren beide Ansätze. Hybride CNN-Transformer-Modelle verwenden CNNs, um feine lokale Details zu erfassen, und Transformer, um den globalen Kontext der Szene zu modellieren. Das verbessert häufig die Genauigkeit, erfordert aber typischerweise mehr Rechenressourcen wie zusätzlichen Speicher und mehr Rechenleistung.
Warum das Verständnis von Tiefe für KI-Systeme zur Bildverarbeitung wichtig ist#
Wenn du dich mit monokularer Tiefenschätzung beschäftigst, fragst du dich vielleicht, warum das Verständnis von Tiefe ein so wichtiger Bestandteil KI-basierter Bildverarbeitungssysteme ist.
Wenn ein System schätzen kann, wie weit Objekte und Oberflächen entfernt sind, gewinnt es ein besseres Verständnis des Aufbaus einer Szene und der Beziehungen zwischen ihren verschiedenen Elementen. Dieses räumliche Verständnis ist entscheidend für zuverlässige Entscheidungen, insbesondere bei praktischen Anwendungen wie dem autonomen Fahren.
Tiefeninformationen liefern außerdem wertvollen Kontext für andere Aufgaben der Computer Vision. Die Objekterkennung, die von Modellen wie Ultralytics YOLO26 unterstützt wird, kann einem System beispielsweise sagen, was in einer Szene vorhanden ist. Die Tiefe hilft jedoch bei der Beantwortung der Frage, wo sich diese Objekte in Bezug auf die Kamera und aufeinander befinden.
Zusammen ermöglichen diese Fähigkeiten zahlreiche Anwendungen der KI-basierten Bildverarbeitung, etwa das Erstellen von 3D-Karten, die Navigation in komplexen Umgebungen und das ganzheitliche Verständnis einer Szene.
Roboter und autonome Fahrzeuge sind auf diese Informationen angewiesen, um sich sicher zu bewegen, Hindernissen auszuweichen und in Echtzeit auf Veränderungen zu reagieren. Der Ansatz des rein visuellen Fahrens von Tesla nutzt beispielsweise Kamerabilder in Kombination mit Tiefenschätzung statt LiDAR, um zu verstehen, wie weit Objekte entfernt sind und wie sie auf der Straße positioniert sind.
So funktionieren Modelle zur monokularen Tiefenschätzung#
Obwohl sich die Modellarchitekturen unterscheiden, folgen die meisten Modelle zur monokularen Tiefenschätzung einem ähnlichen Prozess, um ein einzelnes Bild in eine Tiefenkarte umzuwandeln. Hier ist ein kurzer Überblick über die wichtigsten Schritte:
- Eingabe und Vorverarbeitung: Der Ablauf beginnt mit einem Eingabebild. Bevor es dem Modell zugeführt wird, wird das Originalbild normalerweise in der Größe angepasst, normalisiert und in einen Tensor umgewandelt. Ein Tensor ist ein Format, das neuronale Netze zur effizienten Verarbeitung von Bilddaten verwenden.
- Merkmalsextraktion: Ein Encoder-Netz analysiert das Bild, um aussagekräftige visuelle Merkmale zu extrahieren. Diese Merkmale erfassen Informationen wie Texturen, Objektgrenzen und den Gesamtaufbau der Szene. Die meisten Modelle arbeiten auf mehreren Maßstabsebenen, damit sie sowohl feine Details als auch die globale Struktur verstehen können.
- Tiefeninterpretation: Anhand der extrahierten Merkmale kombiniert das Modell lokale Details mit globalem Kontext, um räumliche Beziehungen in der Szene zu interpretieren. In dieser Phase lernt es, welche Bildbereiche näher an der Kamera und welche weiter entfernt sind.
- Erzeugung der Tiefenkarte: Anschließend wandelt ein Decoder diese Informationen in eine dichte Tiefenkarte um. Jedem Pixel im Bild wird ein Tiefenwert zugewiesen, häufig durch die Kombination von Vorhersagen aus verschiedenen Maßstabsebenen, um Genauigkeit und Konsistenz zu verbessern.
So werden Modelle zur monokularen Tiefenschätzung trainiert#
Der gerade beschriebene Prozess setzt voraus, dass bereits ein trainiertes oder vortrainiertes Modell vorhanden ist. Doch wie funktioniert das Training eines Modells zur monokularen Tiefenschätzung eigentlich?
Das Training beginnt mit der Aufbereitung von Bilddaten, damit sie vom Netz effizient verarbeitet werden können. Eingabebilder werden auf eine einheitliche Größe gebracht und normalisiert. Anschließend werden sie durch das Modell geleitet, um eine vorhergesagte Tiefenkarte zu erzeugen, die die Entfernung an jedem Pixel schätzt.
Die vorhergesagte Tiefenkarte wird anschließend mithilfe einer Verlustfunktion mit Referenztiefendaten verglichen. Diese misst, wie stark die Vorhersage des Modells von der Referenztiefe abweicht. Der Verlustwert stellt den aktuellen Fehler des Modells dar und liefert ein Signal für Verbesserungen.
Ein Optimierer verwendet dieses Signal, um das Modell durch die Anpassung seiner internen Gewichte zu aktualisieren. Dazu berechnet der Optimierer den Gradienten, der beschreibt, wie sich der Verlust in Bezug auf jeden Modellparameter verändert, und wendet diese Aktualisierungen über mehrere Epochen hinweg wiederholt an, also über vollständige Durchläufe durch den Trainingsdatensatz.
Dieser iterative Prozess des überwachten Lernens wird durch Hyperparameter wie die Lernrate gesteuert, die die Größe jedes Aktualisierungsschritts festlegt, und die Batchgröße, die bestimmt, wie viele Bilder gleichzeitig verarbeitet werden. Da das Training eine große Anzahl mathematischer Operationen umfasst, wird es typischerweise mithilfe eines Grafikprozessors (GPU) beschleunigt, der sich besonders für parallele Berechnungen eignet.
Nach Abschluss des Trainings wird das Modell anhand standardisierter Bewertungsmetriken mit einem Validierungssatz evaluiert, der aus Bildern besteht, die während des Trainings nicht verwendet wurden. Diese Bewertung hilft zu messen, wie gut das Modell auf neue Daten generalisiert.
Das trainierte Modell kann anschließend für neue Szenarien wiederverwendet oder feinabgestimmt werden. Insgesamt ermöglicht dieser Trainingsprozess Modellen zur monokularen Tiefenschätzung, konsistente Tiefenschätzungen zu erzeugen, die für nachgelagerte Aufgaben wie 3D-Rekonstruktion und den Einsatz in der Praxis unerlässlich sind.
Aktuelle Modelle und Forschungstrends im Überblick#
Die monokulare Tiefenschätzung hat sich schnell weiterentwickelt, da Modelle immer besser darin geworden sind, ganze Szenen statt nur kleiner visueller Details zu verstehen. Frühere Ansätze erzeugten insbesondere in komplexen Umgebungen häufig ungleichmäßige Tiefenkarten.
Neuere Modelle, wie aktuelle auf arXiv veröffentlichte Forschungsergebnisse zeigen, konzentrieren sich stärker auf den globalen Kontext. Das führt zu Tiefenvorhersagen, die stabiler und realistischer wirken. Bekannte Modelle wie MiDaS und DPT trieben diesen Wandel voran, indem sie Tiefe aus vielfältigen hochauflösenden Datensätzen lernten und gut auf viele Szenen generalisierten.
Neuere Modelle wie ZoeDepth und Depth Anything V2 bauen auf dieser Arbeit auf, indem sie die Maßstabskonsistenz verbessern und gleichzeitig eine starke Leistung in einer großen Bandbreite von Umgebungen beibehalten. Dieser Fortschritt wird häufig anhand gängiger Benchmarkdatensätze wie KITTI und NYU gemessen, die sowohl Außen- als auch Innenaufnahmen abdecken.
Ein weiterer deutlicher Trend ist die ausgewogene Verbindung von Genauigkeit und Praxistauglichkeit. Kleinere Modelle werden für Geschwindigkeit optimiert und können in Echtzeit auf Edge- oder Mobilgeräten ausgeführt werden, während größere Modelle eine höhere Auflösung und eine genauere Tiefenschätzung über große Entfernungen priorisieren.
Anwendungen der monokularen Tiefenschätzung#
Als Nächstes sehen wir uns einige praktische Beispiele an, die zeigen, wie monokulare Tiefenschätzung verwendet wird, um die 3D-Struktur einer Szene aus einem einzigen Bild abzuleiten.
In all diesen Fällen ist es wichtig zu beachten, dass die Tiefeninformationen eine aus visuellen Hinweisen abgeleitete Schätzung und keine präzise Messung sind. Dadurch eignet sich die monokulare Tiefenschätzung zum Verständnis relativer Anordnungen und räumlicher Beziehungen, ist aber kein Ersatz für Sensoren, die zur genauen Entfernungsmessung entwickelt wurden, etwa LiDAR- oder Stereosysteme.
Geländekartierung und Navigation mit Drohnen#
Drohnen arbeiten häufig in Umgebungen, in denen GPS-Signale unzuverlässig sind, etwa in Wäldern, auf Baustellen, in Katastrophengebieten oder in dicht besiedelten Stadtgebieten. Um unter diesen Bedingungen sicher zu fliegen, müssen sie das umliegende Gelände verstehen und wissen, wie weit Hindernisse entfernt sind. Früher mussten dafür typischerweise Sensoren wie LiDAR oder Stereokameras hinzugefügt werden, was Gewicht, Energieverbrauch und Gesamtkosten erhöht.
Die monokulare Tiefenschätzung ist eine einfachere Alternative. Mit nur einer einzigen RGB-Kamera können Drohnen die Tiefe aus Bildern schätzen und ein grundlegendes 3D-Verständnis ihrer Umgebung aufbauen. Dadurch können sie Hindernisse wie Gebäude und Bäume oder plötzliche Geländeveränderungen erkennen und ihre Flugbahn in Echtzeit anpassen.
Diese Tiefenschätzungen unterstützen wichtige Navigationsaufgaben wie Hindernisvermeidung, Höhensteuerung und sichere Landungen. Dadurch können leichte Drohnen Kartierungs-, Inspektions- und Navigationsaufgaben ohne spezielle Tiefensensoren ausführen.

Abb. 2. Monokulare Tiefenschätzung kann zur Analyse von Drohnenaufnahmen eingesetzt werden (Quelle)
Blindbereiche bei autonomen Rennfahrzeugen ausfüllen#
Autonome Fahrzeuge stützen sich in der Regel stark auf LiDAR-Sensoren, die mithilfe von Laserpulsen Entfernungen messen und eine 3D-Ansicht der Straße erstellen. LiDAR ist zwar sehr genau, kann aber bei scharfen Kuppen, steilen Hängen, Verdeckungen oder einer plötzlichen Nickbewegung des Fahrzeugs Schwierigkeiten haben und teilweise lückenhafte oder fehlende Tiefendaten liefern.
Die monokulare Tiefenschätzung kann dazu beitragen, diese Lücken zu schließen, indem sie selbst bei unvollständigen LiDAR-Daten dichte Tiefeninformationen aus einem einzelnen RGB-Bild liefert. Stell dir vor, ein selbstfahrendes Auto nähert sich mit hoher Geschwindigkeit einer Hügelkuppe. Die LiDAR-Strahlen können über die Straße hinter der Kuppe hinausschießen, sodass unklar bleibt, was vor dem Fahrzeug liegt.
Die kamerabasierte Tiefenschätzung kann dagegen anhand visueller Hinweise wie Perspektive und Textur weiterhin die Form der Straße ableiten. So kann das Fahrzeug eine zuverlässige Wahrnehmung aufrechterhalten, bis sich die LiDAR-Daten stabilisieren. Zusammen ermöglichen LiDAR und monokulare Tiefenschätzung eine stabilere Wahrnehmung und eine sicherere Steuerung unter anspruchsvollen Fahrbedingungen.

Abb. 3. Visualisierung des Einsatzes monokularer Tiefenschätzung für autonomes Rennfahren (Quelle)
Roboternavigation und Hindernisvermeidung#
Roboter werden häufig an Orten eingesetzt, an denen keine detaillierten Karten verfügbar sind und sich die Bedingungen ständig ändern. Um sich sicher zu bewegen, benötigen sie ein zuverlässiges Verständnis dafür, wie viel Raum sie umgibt und wo sich Hindernisse befinden.
Die monokulare Tiefenschätzung kann dieses räumliche Verständnis mithilfe einer einzigen RGB-Kamera bereitstellen, ohne auf schwere oder teure Hardware angewiesen zu sein. Durch das Erlernen visueller Hinweise wie Maßstab und Perspektive können Tiefenschätzungsmodelle dichte Tiefenkarten der Umgebung erzeugen. Dadurch erhalten Roboter einen klaren Überblick über die Entfernung zu Oberflächen und Objekten.
Insbesondere wenn Tiefeninformationen mit Computer-Vision-Aufgaben wie Objekterkennung und semantischer Segmentierung kombiniert werden, erhalten Roboter ein umfassenderes Bild ihrer Umgebung. Sie können Objekte erkennen, ihre Entfernung verstehen und entscheiden, wo sie sich sicher bewegen können. Das unterstützt die Hindernisvermeidung, die Erkennung freier Flächen und die Echtzeitplanung von Pfaden.

Abb. 4. Erkennung von Objekten mit monokularer Tiefenschätzung und Objekterkennung (Quelle)
Vor- und Nachteile der monokularen Tiefenschätzung#
Hier sind einige der wichtigsten Vorteile der monokularen Tiefenschätzung:
- Geringes Gewicht und energieeffizient: Die Verwendung einer einzigen Kamera reduziert das Systemgewicht und den Energieverbrauch, was insbesondere für mobile Roboter, Drohnen und eingebettete Systeme wichtig ist.
- Gut für die Sensors融合: Die monokulare Tiefenschätzung kann andere Sensoren wie LiDAR oder Radar ergänzen, indem sie Lücken schließt oder Redundanz bereitstellt.
- Funktioniert in vielen Umgebungen: Derselbe kamerabasierte Ansatz kann in Innenräumen, im Freien und auf verschiedenen Plattformen eingesetzt werden, ohne dass Hardwareänderungen erforderlich sind.
Die monokulare Tiefenschätzung bietet zwar klare Vorteile, aber auch einige Einschränkungen, die du berücksichtigen solltest:
- Geringere Genauigkeit als aktive Sensoren: Obwohl sich die monokulare Tiefenschätzung schnell verbessert, erreicht sie unter kontrollierten Bedingungen im Allgemeinen nicht die absolute Genauigkeit von LiDAR- oder Sensoren mit strukturiertem Licht.
- Empfindlichkeit gegenüber den Lichtverhältnissen: Die Leistung kann bei schlechten Lichtverhältnissen, starken Schatten, Blendung oder Szenen mit schwacher Textur abnehmen.
- Herausforderungen bei der Generalisierung: Ein Modell, das in einer Umgebung trainiert wurde, lässt sich ohne Anpassung oder Feinabstimmung möglicherweise nicht zuverlässig auf unbekannte Bereiche übertragen.
Wann du dich nicht auf die monokulare Tiefenschätzung verlassen solltest#
Die monokulare Tiefenschätzung ist zwar ein interessantes Forschungsgebiet, aber es ist wichtig zu verstehen, wo sie praktisch eingesetzt werden kann und wo nicht. Die von ihr erzeugten Entfernungen sind Schätzungen auf Grundlage dessen, was das Modell in einem Bild erkennt, und keine exakten Messungen aus der realen Welt.
Daher kann sich die Qualität der Ergebnisse abhängig von Faktoren wie Beleuchtung, Szenenkomplexität und der Ähnlichkeit der Szene mit den Trainingsdaten des Modells verändern. Die monokulare Tiefenschätzung kann meist gut angeben, was näher und was weiter entfernt ist, ist aber nicht zuverlässig, wenn du exakte Entfernungen benötigst.
In Situationen, in denen Präzision wirklich wichtig ist, etwa bei sicherheitskritischen Systemen, der industriellen Inspektion oder Robotern, die sehr präzise mit Objekten interagieren müssen, muss die Tiefe direkt gemessen werden. Sensoren wie LiDAR, Radar, Stereokameras oder Systeme mit strukturiertem Licht wurden dafür entwickelt und liefern deutlich zuverlässigere Entfernungsinformationen.
Auch unter visuell schwierigen Bedingungen kann die monokulare Tiefenschätzung an ihre Grenzen stoßen. Schlechte Beleuchtung, starke Schatten, reflektierende oder transparente Oberflächen, Nebel, Rauch oder Szenen mit sehr wenig visueller Textur können Tiefenschätzungen unzuverlässiger machen. Die Schätzung von Tiefen über große Entfernungen ist ein weiterer Fall, in dem spezielle Sensoren in der Regel besser funktionieren.
Bei Lösungen für die reale Welt eignet sich die monokulare Tiefenschätzung am besten als unterstützendes Werkzeug und nicht als eigenständige Lösung. Sie kann nützliche räumliche Informationen liefern, helfen, Lücken zu schließen, wenn andere Sensoren nur eingeschränkt verfügbar sind, und das allgemeine Szenenverständnis verbessern. Wenn Genauigkeit, Sicherheit oder strenge Zuverlässigkeitsanforderungen wichtig sind, sollte sie jedoch nicht die einzige Quelle für Tiefeninformationen sein.
Wichtige Erkenntnisse#
Die monokulare Tiefenschätzung ist eine Computer-Vision-Technik, mit der Maschinen anhand des Bildes einer einzigen Kamera abschätzen können, wie weit Objekte entfernt sind. Durch das Erlernen visueller Hinweise wie Perspektive, Objektgröße, Textur und Schattierung können diese KI-Modelle die 3D-Struktur einer Szene ableiten, ohne auf Sensoren wie LiDAR oder Stereokameras angewiesen zu sein. Dadurch ist die monokulare Tiefenschätzung ein kostengünstiger und skalierbarer Ansatz für Anwendungen wie autonomes Fahren, Robotik und das Verständnis von 3D-Szenen.
Wenn du mehr über Vision-KI erfahren möchtest, besuche unser GitHub-Repository und tritt unserer Community bei. Auf unseren Lösungsseiten erfährst du mehr über KI in der Robotik und Computer Vision in der Fertigung. Entdecke unsere Lizenzoptionen, um noch heute mit Computer Vision zu beginnen!









