Sicherheit für Unternehmen: ISO 27001 + SOC 2 Type I-konform.
Blog

Ultralytics YOLO26 unterstützt jetzt monokulare Tiefenschätzung

Erfahre, wie die neue Tiefenschätzungsaufgabe in Ultralytics YOLO26 pixelgenaue Tiefen im metrischen Maßstab aus einem einzigen RGB-Bild vorhersagt – ganz ohne Stereokamera oder LiDAR.

NUNuvola Ladi
Ultralytics YOLO26 unterstützt jetzt monokulare Tiefenschätzung

Bisher bedeutete das Hinzufügen von Tiefe zu einer YOLO-Pipeline, diese selbst zusammenzustellen. Das etablierte Muster bestand darin, YOLO für die Detektion auszuführen und es mit einem separaten Tiefenmodell aus einem anderen Projekt wie MiDaS oder Depth Anything zu kombinieren. Das bedeutete eine zweite Abhängigkeit, ein zweites Framework und zwei Sätze von Ein- und Ausgabeformaten, die aufeinander abgestimmt werden mussten.

Die monokulare Tiefenschätzung ist jetzt eine native Aufgabe in Ultralytics YOLO26. Ein einzelnes RGB-Bild erzeugt einen Distanzwert für jedes Pixel, wobei dasselbe Paket, derselbe Workflow und derselbe Exportpfad wie bei Detektion, Segmentierung und Pose verwendet werden.

Link to this sectionWas ist Tiefenschätzung?#

Tiefenschätzung prognostiziert eine Tiefenkarte pro Pixel aus einem einzigen RGB-Bild, ohne dass eine zweite Kamera oder ein zusätzlicher Sensor erforderlich ist. Jedes Ausgabepixel enthält einen Tiefenwert in Metern, der die geschätzte Entfernung von der Kamera zu diesem Oberflächenpunkt darstellt.

Die Ausgabe ist eine dichte Gleitkommakarte mit der Form (H, W), die auf die Eingabe ausgerichtet ist, wobei jedes Pixel einen absoluten Abstand in Metern trägt; ein Abstand von der Kamera, keine relative Reihenfolge, was näher und weiter entfernt ist.

Tiefe ist eine eigenständige Aufgabe mit einem eigenen Checkpoint, und ihre Ausgabe ist allein die Tiefenkarte; sie gibt keine Bounding Boxes oder Segmentierungsmasken zurück. Die Kombination von Detektion mit Tiefe erfordert daher die Ausführung von zwei Modellen und zwei Forward Passes. Was sich von der bisherigen Praxis unterscheidet, ist, dass sich beide nun in einem einzigen Paket befinden und sich eine Installation, eine Trainings- und Vorhersageschnittstelle, einen Exportpfad sowie eine einzige zu verfolgende Version teilen, anstatt dass ein zweites Framework neben dem ersten gewartet werden muss.

Diese Ausgabe pro Pixel ist das, was Tiefe nützlich macht für Hindernis- und Freiraumdetektion, Abstandsprüfung, Szenen-Layout und das Verständnis, was vor was liegt.

Frame 1077243491 Abb. 1. Ultralytics YOLO26 Tiefenschätzung für die Sicherheits- und Compliance-Überwachung.

Ultralytics YOLO26 liefert fünf vortrainierte Tiefenmodelle aus, von yolo26n-depth bis hin zu yolo26x-depth, trainiert auf einer breiten Mischung aus mehreren Datensätzen mit rund 2,19 Millionen Innen- und Außenbildern. Auf dem NYU Depth V2-Set reichen sie von einer Genauigkeit von 0,882 δ1 beim Nano-Modell bis zu 0,933 beim Extra-Large-Modell, sodass du den Kompromiss zwischen Geschwindigkeit und Genauigkeit wählen kannst, der zu deinem Bereitstellungsziel passt.

Link to this sectionUngebundene Tiefe per Design#

Die meisten Tiefenmodelle beschränken ihre Vorhersagen auf einen festen Bereich wie 0–10 Meter, was für Innenszenen gut funktioniert, im Freien jedoch versagt. Ultralytics prognostiziert die Tiefe stattdessen auf einer offenen Log-Skala ohne harte Schnittgrenze.

Der Unterschied zeigt sich im Test. Ein begrenztes Modell plateauartig fast sofort, wenn es mit gemischten Innen- und Außendaten trainiert wird, und bricht bei Datensätzen mit größerer Reichweite wie KITTI zusammen, wo Objekte 80 Meter entfernt sein können. Der Ansatz von YOLO26 hat keine solche Obergrenze, sodass er sich mit mehr Daten weiter verbessert und von wenigen Zentimetern bis zu einigen hundert Metern standhält. Auf KITTI erreicht δ1 0,942 bei einer Reichweite von 80 m. Das bedeutet, dass eine Modellfamilie eine Tischszene und eine Autobahnszene gleichermaßen gut handhabt.

Link to this sectionVergleich von Ultralytics YOLO26 Tiefe vs. Depth Anything V2#

Wenn du Depth Anything heute zusammen mit YOLO ausführst, besteht der Unterschied in der Geschwindigkeit und der damit verbundenen Rechenlast. Die YOLO26-Tiefe läuft bis zu 20,3-mal schneller als Depth Anything V2 Base und 7,7-mal schneller als Depth Anything V2 Small, ausgehend von einem viel kleineren Modell, unter 10 Millionen Parametern bei Nano, im Vergleich zu etwa 24 Millionen für den kleineren Checkpoint von DA V2.

Screenshot 2026-07-29 at 15.02.18 Abb. 2. Geschwindigkeits-Benchmarks für die Ultralytics YOLO26 Tiefe im Vergleich zu Depth Anything V2.

Diese Lücke ist der Sinn des Designs. Die Modelle von Depth Anything V2 sind wesentlich größer; YOLO26-Depth ist auf eine starke Tiefenleistung bei einer Größe und Geschwindigkeit ausgelegt, die pro Frame weniger Rechenleistung kostet und auf Hardware eingesetzt werden kann, die diese Modelle nicht erreichen. Die Genauigkeitszahlen für die einzelnen Modelle auf NYU Depth V2 und KITTI sind in der Dokumentation veröffentlicht, sodass du sie anhand deiner tatsächlichen Anforderungen überprüfen kannst.

Link to this sectionWo es läuft#

Dieser Größenunterschied bestimmt, wohin die Tiefe tatsächlich gelangen kann. Den meisten Teams, die die Tiefe evaluieren, mangelt es nicht an Ideen; es mangelt ihnen an Rechenleistung. Low-Power-Drohnen, vierbeinige Roboter, Wearables, Dashcams, Konferenz-Hardware und Industrie-PCs stoßen alle an eine Leistungs- und Kostenobergrenze, bevor sie an eine Genauigkeitsobergrenze stoßen.

Die Tiefe wird als fünf vortrainierte Modelle ausgeliefert, sodass du die Größe wählen kannst, die zum Ziel passt, statt der Größe, die einen Benchmark gewinnt. Da die Tiefe eine native YOLO26-Aufgabe ist, verwendet sie denselben Exportpfad wie Detektion, Segmentierung und Pose mit den folgenden Formaten: ONNX, TensorRT, CoreML, NCNN, LiteRT.

Link to this sectionErste Schritte mit der Ultralytics YOLO26 Tiefe#

Das Ultralytics Python-Paket bietet eine einzige, einheitliche Schnittstelle zum Trainieren, Validieren und Ausführen von Inferenz für jede YOLO26-Aufgabe, einschließlich Tiefe. Das Ausführen eines vortrainierten Tiefenmodells erfordert einen einzigen Befehl:

from ultralytics import YOLO

from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load an official model
model = YOLO("path/to/best.pt")  # load a custom model

# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg")  # predict on an image

# Access the results
for result in results:
    depth_map = result.depth.data.cpu().numpy()  # torch.Tensor → NumPy float32, shape (H, W), meters

Oder über das CLI:

yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg'  # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg'   # predict with custom model

Die absolute Entfernung hängt von deiner Kamera und deiner Szene ab. Wenn die Form der Tiefenkarte stimmt, aber die Skalierung nicht, passt model.calibrate() nur zwei Variablen im Tiefenkopf des Modells an – eine Skalierung und einen Versatz – auf etwa 100 beschrifteten Frames in Sekundenschnelle, ohne Training und ohne Änderung am Rest des Netzwerks.

Link to this sectionFine-Tuning mit eigenen Daten#

Um ein vortrainiertes Tiefenmodell an deine eigene Kamera oder Domain anzupassen, beginne bei den vortrainierten Gewichten, verwende AdamW und senke die Lernrate weit unter den Standardwert für das Training von Grund auf ab, damit das Fine-Tuning das Modell verfeinert, anstatt es zu überschreiben:

from ultralytics import YOLO

from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt")  # start from pretrained weights
model.train(
    data="path/to/your_dataset.yaml",
    epochs=20,
    imgsz=640,
    optimizer="AdamW",
    lr0=1e-4,  # ~100x below the from-scratch default
    warmup_bias_lr=1e-4,  # keep warmup gentle too
)

Da der Standard-Log-Kopf unbegrenzt ist, funktioniert dies sofort, unabhängig davon, ob dein Datensatz nah oder fern ist, ohne dass eine max_depth-Anpassung erforderlich ist. Wenn nur die absolute Skalierung für deine spezifische Kamera nicht stimmt, passt model.calibrate() eine leichte, geschlossene Korrektur auf einem kleinen beschrifteten Split in Sekundenschnelle an, ohne die Netzwerkgewichte zu berühren.

Datensätze verknüpfen jedes RGB-Bild mit einer .npy-Tiefendatei in einer übereinstimmenden Ordnerstruktur, und Ultralytics liefert integrierte Konfigurationen für NYU Depth V2, KITTI, Hypersim, SUN RGB-D und ARKitScenes mit, sodass die meisten Teams sofort mit der Validierung anhand eines Standard-Benchmarks beginnen können.

Weitere Informationen findest du in unserem Schnellstart-Leitfaden.

Link to this sectionWichtigste Anwendungsfälle für die Tiefenschätzung#

Da diese neue Funktion mit einer einzigen gewöhnlichen Kamera arbeiten kann, eröffnet die monokulare Tiefenschätzung unzählige Möglichkeiten für Produkte und Branchen, die sich die Kosten, den Stromverbrauch oder den Kalibrierungsaufwand eines Stereo- oder LiDAR-Setups sonst nicht rechtfertigen können. Werfen wir also einen Blick auf einige wichtige Branchen und Anwendungsfälle, die von dieser Funktion profitieren können:

  • Robotik und autonome Navigation. Mobile Roboter und Drohnen können Hindernisentfernungen und Freiräume von einer einzigen Onboard-Kamera schätzen und so die Echtzeit-Pfadplanung ohne dedizierte Tiefenhardware unterstützen.
  • Industrie- und Logistikwahrnehmung. Abstandsprüfung, Freiraumdetektion sowie Regal- oder Gangkontext von einer einzigen festen Kamera, überall dort, wo das Hinzufügen eines zweiten Sensors nicht praktikabel ist.
  • Sicherheits- und Compliance-Überwachung. Gabelstapler- und Lager-Sicherheitszonen, Erkennung von Eisenbahnunfällen, Erkennung von gestürzten Personen und zurückgelassenen Objekten in bestehenden CCTV-Systemen: Distanzkontext, der zu bereits installierten Kamerastrecken hinzugefügt wird, anstelle von vorhandenen sicherheitszertifizierten Sensoren statt an deren Stelle.
  • Infrastruktur- und Anlageninspektion. Analyse des Freiraums von Oberleitungen, drohnenbasierte Anlagen- und Korrosionsinspektion sowie Luftbildvermessungsarbeiten, bei denen dieselbe Modellfamilie sowohl Nahaufnahmen als auch Szenen aus großer Entfernung handhaben muss.
  • Fahrerassistenz und Automobilwahrnehmung. Eine weitreichende, ungebundene Tiefenausgabe bedeutet, dass dieselbe Modellfamilie, die eine Nahaufnahme-Innenszene verarbeitet, auch auf Fahrszenen von 80 m und mehr verallgemeinert werden kann.
  • AR und räumliche Inhalte. Das glaubwürdige Platzieren virtueller Objekte in einer realen Szene oder das Anwenden tiefenbewusster Effekte beginnt damit zu wissen, wie weit jedes Pixel tatsächlich von der Kamera entfernt ist.

Link to this sectionTiefenschätzung für jede YOLO26-Bereitstellung#

Da die Tiefenschätzung nun eine native YOLO26-Aufgabe ist, können Teams die Distanz pro Pixel von jeder RGB-Kamera branchenübergreifend nutzen. Dabei verwenden sie denselben Train-, Val-, Predict- und Export-Workflow, den sie bereits von Detektion, Segmentierung und Pose kennen, und haben eine Drittanbieter-Abhängigkeit weniger zu warten.

Wenn du also deine Bereitstellung mit der Ultralytics YOLO26 Tiefe planst, werfen wir einen Blick auf einige wichtige Punkte, die du beachten solltest:

  • Ultralytics YOLO Depth ist für RGB-Kameras gebaut. Jede Standardkamera funktioniert, einschließlich Webcams, Smartphones, Industriekameras oder Drohnen. Andere Modalitäten wie LiDAR-Punktwolken, Radar, Sonar, Thermal- und Multispektralbänder oder Mesh- und IFC-Daten liegen jedoch außerhalb des Eingabeformats des Modells.
  • Metrische Entfernung für Wahrnehmungsentscheidungen. Die Ausgabe ist eine echte Entfernung in Metern, wodurch sie sich gut für Navigation, Freiraum und Überwachung eignet. Für jede Anwendung, bei der eine zertifizierte Toleranz erforderlich ist, bleibt jedoch dedizierte Messtechnik das richtige Instrument.
  • Inferenz pro Bild. Die Tiefe läuft für jeden Frame unabhängig, im Einklang mit jeder anderen YOLO26-Aufgabe, und lässt sich daher ohne Änderungen in eine bestehende Frame-für-Frame-Pipeline integrieren. Das Schließen von Zusammenhängen über eine Sequenz hinweg verbleibt in deiner Anwendungsschicht.
  • Ultralytics YOLO26-Depth ist auf texturierten, undurchsichtigen Oberflächen am stärksten. Glas, Spiegel, stehendes Wasser, poliertes Metall und der offene Himmel sind für jede Einzelkamera-Methode von Natur aus mehrdeutig, weshalb es sich lohnt, sie an Szenen zu validieren, die deiner Umgebung entsprechen.

Neugierig auf Vision AI? Entdecke unsere Lizenzierungsoptionen, um Computer Vision in deine Projekte zu integrieren. Besuche unser GitHub-Repository, um die gesamte Bandbreite an Ultralytics-Aufgaben und -Integrationen zu entdecken, und sieh dir die Ultralytics Platform an, um mit dem Aufbau deiner eigenen End-to-End-Vision-AI-Workflows zu beginnen.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens