YOLO Vision 2026:
Ultralytics YOLO

Die Entwicklung der Objekterkennung und der YOLO-Modelle von Ultralytics

Begleite uns, wenn wir auf die Entwicklung der Objekterkennung zurückblicken. Wir konzentrieren uns darauf, wie YOLO (You Only Look Once)-Modelle in den letzten Jahren fortgeschritten sind.

ABAbirami Vina4 min read
Die Entwicklung der Objekterkennung und von YOLO-Modellen

Computer vision ist ein Teilgebiet der künstlichen Intelligenz (KI), das sich darauf konzentriert, Maschinen beizubringen, Bilder und Videos zu sehen und zu verstehen, ähnlich wie Menschen die reale Welt wahrnehmen. Während das Erkennen von Objekten oder das Identifizieren von Aktionen für Menschen eine Selbstverständlichkeit ist, erfordern diese Aufgaben bei Maschinen spezifische und spezialisierte Computer-Vision-Techniken. Eine zentrale Aufgabe in der Computer Vision ist beispielsweise die Objekterkennung, bei der Objekte in Bildern oder Videos identifiziert und lokalisiert werden.

Seit den 1960er Jahren arbeiten Forscher daran, zu verbessern, wie Computer Objekte erkennen können. Frühe Methoden wie das Template Matching bestanden darin, eine vordefinierte Vorlage über ein Bild zu schieben, um Übereinstimmungen zu finden. Auch wenn diese Ansätze innovativ waren, hatten sie mit Veränderungen bei Objektgröße, Ausrichtung und Beleuchtung zu kämpfen. Heute haben wir fortschrittliche Modelle wie Ultralytics YOLO11, die selbst kleine und teilweise versteckte Objekte, sogenannte verdeckte Objekte, mit beeindruckender Genauigkeit erkennen können.

Da sich Computer Vision kontinuierlich weiterentwickelt, ist es wichtig, auf die Entwicklung dieser Technologien zurückzublicken. In diesem Artikel untersuchen wir die Evolution der Objekterkennung und beleuchten die Transformation der YOLO (You Only Look Once)-Modelle. Fangen wir an!

Die Ursprünge der Computer Vision#

Bevor wir in die Objekterkennung eintauchen, werfen wir einen Blick darauf, wie Computer Vision ihren Anfang nahm. Die Ursprünge der Computer Vision lassen sich bis in die späten 1950er und frühen 1960er Jahre zurückverfolgen, als Wissenschaftler begannen zu erforschen, wie das Gehirn visuelle Informationen verarbeitet. In Experimenten mit Katzen entdeckten die Forscher David Hubel und Torsten Wiesel, dass das Gehirn auf einfache Muster wie Kanten und Linien reagiert. Dies bildete die Grundlage für die Idee der Merkmals extraktion – dem Konzept, dass visuelle Systeme grundlegende Merkmale in Bildern wie Kanten erkennen und wahrnehmen, bevor sie zu komplexeren Mustern übergehen.

Katzengehirn-Experiment, das die Merkmalsextraktion in der Computer Vision inspirierte

Abb. 1. Die Beobachtung, wie das Gehirn einer Katze auf Lichtbalken reagiert, half bei der Entwicklung der Merkmalsextraktion in der Computer Vision.

Um dieselbe Zeit tauchte neue Technologie auf, die physische Bilder in digitale Formate umwandeln konnte, was das Interesse daran weckte, wie Maschinen visuelle Informationen verarbeiten könnten. Im Jahr 1966 trieb das Summer Vision Project des Massachusetts Institute of Technology (MIT) die Dinge weiter voran. Das Projekt war zwar nicht vollständig erfolgreich, zielte jedoch darauf ab, ein System zu schaffen, das den Vordergrund vom Hintergrund in Bildern trennen konnte. Für viele in der Vision-KI-Community markiert dieses Projekt den offiziellen Beginn der Computer Vision als wissenschaftliches Feld.

Die Geschichte der Objekterkennung verstehen#

Als sich Computer Vision in den späten 1990er und frühen 2000er Jahren weiterentwickelte, verlagerten sich die Methoden zur Objekterkennung von grundlegenden Techniken wie dem Template Matching hin zu fortgeschritteneren Ansätzen. Eine beliebte Methode war Haar Cascade, die für Aufgaben wie die Gesichtserkennung weit verbreitet wurde. Sie funktionierte, indem Bilder mit einem gleitenden Fenster abgescannt wurden, wobei in jedem Bildbereich nach spezifischen Merkmalen wie Kanten oder Texturen gesucht und diese Merkmale dann kombiniert wurden, um Objekte wie Gesichter zu erkennen. Haar Cascade war viel schneller als frühere Methoden.

Verwendung von Haar Cascade zur Gesichtserkennung

Abb. 2. Verwendung von Haar Cascade zur Gesichtserkennung.

Parallel dazu wurden Methoden wie Histogram of Oriented Gradients (HOG) und Support Vector Machines (SVMs) eingeführt. HOG nutzte die Gleitfenstertechnik, um zu analysieren, wie sich Licht und Schatten in kleinen Abschnitten eines Bildes veränderten, was dabei half, Objekte anhand ihrer Formen zu identifizieren. SVMs klassifizierten diese Merkmale anschließend, um die Identität des Objekts zu bestimmen. Diese Methoden verbesserten die Genauigkeit, hatten aber in realen Umgebungen nach wie vor Schwierigkeiten und waren im Vergleich zu heutigen Techniken langsamer.

Der Bedarf an Objekterkennung in Echtzeit#

In den 2010er Jahren brachten der Aufstieg von Deep Learning und Convolutional Neural Networks (CNNs) einen großen Wandel in der Objekterkennung. CNNs machten es Computern möglich, automatisch wichtige Merkmale aus großen Mengen an Daten zu lernen, wodurch die Erkennung wesentlich genauer wurde.

Frühe Modelle wie R-CNN (Region-based Convolutional Neural Networks) bedeuteten einen großen Fortschritt in der Präzision und trugen dazu bei, Objekte genauer zu identifizieren als ältere Methoden.

Allerdings waren diese Modelle langsam, da sie Bilder in mehreren Schritten verarbeiteten, was sie für Echtzeitanwendungen in Bereichen wie selbstfahrenden Autos oder Videoüberwachung unpraktisch machte.

Mit dem Fokus auf die Beschleunigung wurden effizientere Modelle entwickelt. Modelle wie Fast R-CNN und Faster R-CNN halfen dabei, die Auswahl von Regionen von Interesse (Regions of Interest) zu verfeinern und die Anzahl der für die Erkennung benötigten Schritte zu reduzieren. Obwohl dies die Objekterkennung beschleunigte, war sie für viele reale Anwendungen, die sofortige Ergebnisse erforderten, immer noch nicht schnell genug. Die wachsende Nachfrage nach Echtzeiterkennung trieb die Entwicklung noch schnellerer und effizienterer Lösungen voran, die sowohl Geschwindigkeit als auch Genauigkeit in Einklang bringen konnten.

Vergleich der Geschwindigkeiten von R-CNN, Fast R-CNN und Faster R-CNN

Abb. 3. Vergleich der Geschwindigkeiten von R-CNN, Fast R-CNN und Faster R-CNN.

YOLO (You Only Look Once) Modelle: Ein wichtiger Meilenstein#

YOLO ist ein Objekterkennungsmodell, das Computer Vision neu definierte, indem es die Echtzeiterkennung von mehreren Objekten in Bildern und Videos ermöglichte, wodurch es sich deutlich von früheren Erkennungsmethoden unterscheidet. Anstatt jedes erkannte Objekt einzeln zu analysieren, behandelt die Architektur von YOLO die Objekterkennung als eine einzige Aufgabe, bei der sowohl der Standort als auch die Klasse von Objekten mithilfe von CNNs in einem einzigen Durchgang vorhergesagt werden.

Das Modell funktioniert, indem es ein Bild in ein Raster unterteilt, wobei jeder Teil für die Erkennung von Objekten in seinem jeweiligen Bereich verantwortlich ist. Es erstellt mehrere Vorhersagen für jeden Abschnitt und filtert die Ergebnisse mit geringerer Konfidenz heraus, sodass nur die genauen übrig bleiben.

Eine Übersicht darüber, wie YOLO funktioniert

Abb. 4. Eine Übersicht darüber, wie YOLO funktioniert.

Die Einführung von YOLO in Computer-Vision-Anwendungen machte die Objekterkennung viel schneller und effizienter als frühere Modelle. Aufgrund seiner Geschwindigkeit und Genauigkeit wurde YOLO schnell zu einer beliebten Wahl für Echtzeitlösungen in Branchen wie Fertigung, Gesundheitswesen und Robotik.

Ein weiterer wichtiger Punkt ist, dass Entwickler und Forscher YOLO kontinuierlich verbessern konnten, da es Open-Source war, was zu noch fortschrittlicheren Versionen führte.

Der Weg von YOLO zu Ultralytics YOLO11#

YOLO-Modelle haben sich im Laufe der Zeit stetig verbessert und auf den Fortschritten jeder Version aufgebaut. Neben einer besseren Leistung haben diese Verbesserungen die Modelle auch benutzerfreundlicher für Personen mit unterschiedlichem technischem Erfahrungsgrad gemacht.

Als zum Beispiel Ultralytics YOLOv5 eingeführt wurde, wurde das Bereitstellen von Modellen mit PyTorch einfacher, wodurch ein breiterer Kreis von Benutzern mit fortgeschrittener KI arbeiten konnte. Es vereinte Genauigkeit und Benutzerfreundlichkeit und gab mehr Menschen die Möglichkeit, Objekterkennung zu implementieren, ohne Code-Experten sein zu müssen.

Die Evolution der YOLO-Modelle

Abb. 5. Die Entwicklung der YOLO-Modelle.

Ultralytics YOLOv8 setzte diese Entwicklung fort, indem es Unterstützung für Aufgaben wie Instanzsegmentierung hinzufügte und die Modelle flexibler gestaltete. Es wurde einfacher, YOLO sowohl für grundlegende als auch für komplexere Anwendungen zu nutzen, wodurch es in einer Vielzahl von Szenarien nützlich ist.

Mit dem neuesten Modell, Ultralytics YOLO11, wurden weitere Optimierungen vorgenommen. Durch die Reduzierung der Anzahl von Parametern bei gleichzeitiger Verbesserung der Genauigkeit ist es nun effizienter für Echtzeitaufgaben. Egal, ob du ein erfahrener Entwickler oder neu im Bereich KI bist, YOLO11 bietet einen fortschrittlichen Ansatz zur Objekterkennung, der leicht zugänglich ist.

Ultralytics YOLO11 kennenlernen: Neue Funktionen und Verbesserungen#

YOLO11, das auf der jährlichen Hybridveranstaltung von Ultralytics, YOLO Vision 2024 (YV24), vorgestellt wurde, unterstützt dieselben Computer-Vision-Aufgaben wie YOLOv8, wie Objekterkennung, Instanzsegmentierung, Bildklassifizierung und Pose Estimation. Benutzer können also problemlos auf dieses neue Modell umsteigen, ohne ihre Arbeitsabläufe anpassen zu müssen. Darüber hinaus macht die verbesserte Architektur von YOLO11 Vorhersagen noch präziser. Tatsächlich erreicht YOLO11m eine höhere mittlere durchschnittliche Präzision (mAP) auf dem COCO-Datensatz bei 22 % weniger Parametern als YOLOv8m.

YOLO11 ist außerdem so konzipiert, dass es effizient auf einer Reihe von Plattformen läuft, von Smartphones und anderen Edge-Geräten bis hin zu leistungsstärkeren Cloud-Systemen. Diese Flexibilität gewährleistet eine reibungslose Leistung über verschiedene Hardware-Setups hinweg für Echtzeitanwendungen. Darüber hinaus ist YOLO11 schneller und effizienter, wodurch Rechenkosten gesenkt und Inferenzzeiten beschleunigt werden. Egal, ob du das Ultralytics Python-Paket oder das Ultralytics HUB ohne Programmieraufwand verwendest, es ist einfach, YOLO11 in deine bestehenden Arbeitsabläufe zu integrieren.

Die Zukunft der YOLO-Modelle und der Objekterkennung#

Die Auswirkungen der fortschrittlichen Objekterkennung auf Echtzeitanwendungen und Edge AI sind branchenübergreifend bereits spürbar. Da Branchen wie Öl und Gas, das Gesundheitswesen und der Einzelhandel zunehmend auf KI setzen, steigt die Nachfrage nach schneller und präziser Objekterkennung weiter an. Ultralytics YOLO11 zielt darauf ab, diese Nachfrage zu erfüllen, indem es eine leistungsstarke Erkennung auch auf Geräten mit begrenzter Rechenleistung ermöglicht.

Mit dem Wachstum von Edge AI wird es wahrscheinlich, dass Objekterkennungsmodelle wie Ultralytics YOLO11 noch unverzichtbarer für die Entscheidungsfindung in Echtzeit in Umgebungen werden, in denen Geschwindigkeit und Genauigkeit entscheidend sind. Mit anhaltenden Verbesserungen beim Design und der Anpassungsfähigkeit verspricht die Zukunft der Objekterkennung noch mehr Innovationen in einer Vielzahl von Anwendungen.

Wichtige Erkenntnisse#

Die Objekterkennung hat einen langen Weg hinter sich und hat sich von einfachen Methoden zu den modernen Deep-Learning-Techniken entwickelt, die wir heute sehen. YOLO-Modelle standen im Zentrum dieses Fortschritts und lieferten branchenübergreifend eine schnellere und genauere Echtzeiterkennung. Ultralytics YOLO11 baut auf diesem Erbe auf, indem es die Effizienz steigert, die Rechenkosten senkt und die Genauigkeit verbessert, was es zu einer zuverlässigen Wahl für eine Vielzahl von Echtzeitanwendungen macht. Mit kontinuierlichen Fortschritten bei KI und Computer Vision erscheint die Zukunft der Objekterkennung rosig, mit Raum für noch mehr Verbesserungen bei Geschwindigkeit, Präzision und Anpassungsfähigkeit.

Neugierig auf AI? Bleibe mit unserer Community verbunden, um weiter zu lernen! Schau dir unser GitHub-Repository an, um zu entdecken, wie wir AI nutzen, um innovative Lösungen in Branchen wie der Fertigung und dem Gesundheitswesen zu entwickeln. 🚀

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens