Ultralytics YOLO27:
Ultralytics YOLO

Die Entwicklung der Objekterkennung und der YOLO-Modelle von Ultralytics

Wir blicken auf die Entwicklung der Objekterkennung zurück. Dabei konzentrieren wir uns darauf, wie sich YOLO-Modelle in den vergangenen Jahren weiterentwickelt haben.

ABAbirami Vina8 min read
Die Entwicklung der Objekterkennung und der YOLO-Modelle

Computer Vision ist ein Teilgebiet der künstlichen Intelligenz (AI), das sich darauf konzentriert, Maschinen beizubringen, Bilder und Videos zu sehen und zu verstehen – ähnlich der menschlichen Wahrnehmung der realen Welt. Während das Erkennen von Objekten oder das Identifizieren von Aktionen für Menschen ganz selbstverständlich ist, erfordern diese Aufgaben bei Maschinen spezielle und hochspezialisierte Computer-Vision-Techniken. Eine zentrale Aufgabe von Computer Vision ist beispielsweise die Objekterkennung, bei der Objekte in Bildern oder Videos identifiziert und lokalisiert werden.

Seit den 1960er-Jahren arbeiten Forschende daran, wie Computer Objekte erkennen können. Frühe Methoden wie der Vorlagenabgleich verschoben eine vordefinierte Vorlage über ein Bild, um Übereinstimmungen zu finden. Obwohl diese Ansätze innovativ waren, hatten sie Schwierigkeiten mit Veränderungen der Objektgröße und -ausrichtung sowie der Beleuchtung. Heute gibt es fortschrittliche Modelle wie Ultralytics YOLO11, die selbst kleine und teilweise verborgene Objekte, sogenannte verdeckte Objekte, mit beeindruckender Genauigkeit erkennen können.

Da sich Computer Vision weiterentwickelt, ist es wichtig, einen Blick darauf zu werfen, wie diese Technologien entstanden sind. In diesem Artikel untersuchen wir die Entwicklung der Objekterkennung und beleuchten die Veränderung der YOLO-Modelle (You Only Look Once). Beginnen wir!

Die Ursprünge von Computer Vision#

Bevor wir uns mit der Objekterkennung befassen, sehen wir uns an, wie Computer Vision entstanden ist. Die Ursprünge von Computer Vision reichen bis in die späten 1950er- und frühen 1960er-Jahre zurück, als Forschende untersuchten, wie das Gehirn visuelle Informationen verarbeitet. In Experimenten mit Katzen entdeckten die Forschenden David Hubel und Torsten Wiesel, dass das Gehirn auf einfache Muster wie Kanten und Linien reagiert. Dies bildete die Grundlage für die Idee der Merkmalsextraktion – das Konzept, dass visuelle Systeme zunächst grundlegende Merkmale in Bildern wie Kanten erkennen und identifizieren, bevor sie sich komplexeren Mustern widmen.

Katzenhirnexperiment als Inspiration für die Merkmalsextraktion in Computer Vision

Abb. 1 Das Verständnis dafür, wie das Gehirn einer Katze auf Lichtbalken reagiert, trug zur Entwicklung der Merkmalsextraktion in Computer Vision bei.

Etwa zur gleichen Zeit entstand neue Technologie, mit der sich physische Bilder in digitale Formate umwandeln ließen. Das weckte das Interesse daran, wie Maschinen visuelle Informationen verarbeiten könnten. 1966 trieb das Summer Vision Project des Massachusetts Institute of Technology (MIT) diese Entwicklung weiter voran. Obwohl das Projekt nicht vollständig erfolgreich war, zielte es darauf ab, ein System zu entwickeln, das Vordergrund und Hintergrund in Bildern trennen konnte. Für viele in der Community für Vision-KI markiert dieses Projekt den offiziellen Beginn von Computer Vision als wissenschaftlichem Fachgebiet.

Die Geschichte der Objekterkennung verstehen#

Als sich Computer Vision in den späten 1990er- und frühen 2000er-Jahren weiterentwickelte, wandelten sich die Methoden der Objekterkennung von grundlegenden Techniken wie dem Vorlagenabgleich hin zu fortschrittlicheren Ansätzen. Eine beliebte Methode war Haar Cascade, die häufig für Aufgaben wie die Gesichtserkennung eingesetzt wurde. Dabei wurden Bilder mit einem gleitenden Fenster durchsucht, um in jedem Bildausschnitt nach bestimmten Merkmalen wie Kanten oder Texturen zu suchen. Anschließend wurden diese Merkmale kombiniert, um Objekte wie Gesichter zu erkennen. Haar Cascade war deutlich schneller als frühere Methoden.

Haar Cascade für die Gesichtserkennung

Abb. 2 Haar Cascade für die Gesichtserkennung.

Daneben wurden Methoden wie Histogram of Oriented Gradients (HOG) und Support Vector Machines (SVMs) eingeführt. HOG nutzte die Technik des gleitenden Fensters, um zu analysieren, wie sich Licht und Schatten in kleinen Bildausschnitten veränderten, und half dabei, Objekte anhand ihrer Formen zu erkennen. SVMs klassifizierten diese Merkmale anschließend, um die Identität des Objekts zu bestimmen. Diese Methoden verbesserten die Genauigkeit, hatten in realen Umgebungen jedoch weiterhin Schwierigkeiten und waren im Vergleich zu heutigen Techniken langsamer.

Der Bedarf an Objekterkennung in Echtzeit#

In den 2010er-Jahren führten der Aufstieg des Deep Learning und der Faltungsneuronalen Netze (CNNs) zu einem grundlegenden Wandel bei der Objekterkennung. CNNs ermöglichten es Computern, wichtige Merkmale automatisch aus großen Mengen an Daten zu lernen, wodurch die Erkennung deutlich genauer wurde.

Frühe Modelle wie R-CNN (regionbasierte Faltungsneuronale Netze) stellten eine erhebliche Verbesserung der Präzision dar und halfen dabei, Objekte genauer zu erkennen als ältere Methoden.

Diese Modelle waren jedoch langsam, da sie Bilder in mehreren Stufen verarbeiteten. Dadurch waren sie für Echtzeitanwendungen in Bereichen wie selbstfahrenden Autos oder der Videoüberwachung unpraktisch.

Mit dem Ziel, die Verarbeitung zu beschleunigen, wurden effizientere Modelle entwickelt. Modelle wie Fast R-CNN und Faster R-CNN verbesserten die Auswahl relevanter Bildbereiche und verringerten die Anzahl der für die Erkennung erforderlichen Schritte. Dadurch wurde die Objekterkennung zwar schneller, für viele Anwendungen in der Praxis, die sofortige Ergebnisse benötigten, war sie jedoch noch nicht schnell genug. Die wachsende Nachfrage nach Erkennung in Echtzeit trieb die Entwicklung noch schnellerer und effizienterer Lösungen voran, die Geschwindigkeit und Genauigkeit gleichermaßen ausbalancieren konnten.

Vergleich der Geschwindigkeiten von R-CNN, Fast R-CNN und Faster R-CNN

Abb. 3. Vergleich der Geschwindigkeiten von R-CNN, Fast R-CNN und Faster R-CNN.

YOLO-Modelle (You Only Look Once): Ein wichtiger Meilenstein#

YOLO ist ein Objekterkennungsmodell, das Computer Vision neu definiert hat, indem es die Echtzeiterkennung mehrerer Objekte in Bildern und Videos ermöglicht und sich dadurch deutlich von früheren Erkennungsmethoden unterscheidet. Statt jedes erkannte Objekt einzeln zu analysieren, behandelt die YOLO-Architektur die Objekterkennung als eine einzige Aufgabe und sagt mithilfe von CNNs in einem Schritt sowohl die Position als auch die Klasse der Objekte voraus.

Das Modell teilt ein Bild in ein Raster auf, wobei jeder Bereich für die Erkennung von Objekten in seinem jeweiligen Abschnitt zuständig ist. Für jeden Abschnitt erstellt es mehrere Vorhersagen und filtert Ergebnisse mit geringerer Konfidenz heraus, sodass nur die präzisen Ergebnisse erhalten bleiben.

Überblick über die Funktionsweise von YOLO

Abb. 4 Überblick über die Funktionsweise von YOLO.

Die Einführung von YOLO in Computer-Vision-Anwendungen machte die Objekterkennung deutlich schneller und effizienter als bei früheren Modellen. Aufgrund seiner Geschwindigkeit und Genauigkeit wurde YOLO schnell zu einer beliebten Wahl für Echtzeitlösungen in Branchen wie Fertigung, Gesundheitswesen und Robotik.

Ein weiterer wichtiger Punkt ist, dass Entwickler und Forschende YOLO kontinuierlich verbessern konnten, da es als Open Source verfügbar war. Dadurch entstanden noch fortschrittlichere Versionen.

Der Weg von YOLO zu Ultralytics YOLO11#

YOLO-Modelle wurden im Laufe der Zeit kontinuierlich verbessert, wobei jede Version auf den Fortschritten ihrer Vorgänger aufbaute. Neben der besseren Leistung haben diese Verbesserungen die Nutzung der Modelle für Menschen mit unterschiedlichen technischen Kenntnissen erleichtert.

Als beispielsweise [Ultralytics YOLOv5](https://ultralytics-translation-0.invalid eingeführt wurde, wurde das Bereitstellen von Modellen mit PyTorch einfacher, sodass eine größere Nutzergruppe mit fortschrittlicher KI arbeiten konnte. Das Modell verband Genauigkeit und Benutzerfreundlichkeit und ermöglichte es mehr Menschen, Objekterkennung umzusetzen, ohne Programmierexperten sein zu müssen.

Die Entwicklung der YOLO-Modelle

Abb. 5. Die Entwicklung der YOLO-Modelle.

Ultralytics YOLOv8 setzte diese Entwicklung fort, indem es Unterstützung für Aufgaben wie Instanzsegmentierung hinzufügte und die Modelle flexibler machte. Dadurch wurde es einfacher, YOLO sowohl für grundlegende als auch für komplexere Anwendungen einzusetzen, wodurch es in verschiedensten Szenarien nützlich wurde.

Mit dem neuesten Modell, Ultralytics YOLO11, wurden weitere Optimierungen vorgenommen. Durch die Verringerung der Anzahl der Parameter bei gleichzeitiger Verbesserung der Genauigkeit ist es nun effizienter für Echtzeitaufgaben. Egal, ob du ein erfahrener Entwickler bist oder gerade erst mit KI beginnst: YOLO11 bietet einen fortschrittlichen und leicht zugänglichen Ansatz für die Objekterkennung.

Ultralytics YOLO11 kennenlernen: Neue Funktionen und Verbesserungen#

YOLO11 wurde auf der jährlichen hybriden Veranstaltung von Ultralytics, YOLO Vision 2024 (YV24), vorgestellt und unterstützt dieselben Computer-Vision-Aufgaben wie YOLOv8, darunter Objekterkennung, Instanzsegmentierung, Bildklassifizierung und Posenschätzung. Daher können Nutzer problemlos zu diesem neuen Modell wechseln, ohne ihre Arbeitsabläufe anpassen zu müssen. Darüber hinaus ermöglicht die verbesserte Architektur von YOLO11 noch präzisere Vorhersagen. Tatsächlich erreicht YOLO11m auf dem COCO-Datensatz eine höhere mittlere durchschnittliche Präzision (mAP) als YOLOv8m und verwendet dabei 22 % weniger Parameter.

YOLO11 wurde außerdem für einen effizienten Betrieb auf einer Vielzahl von Plattformen entwickelt – von Smartphones und anderen Edge-Geräten bis hin zu leistungsstärkeren Cloud-Systemen. Diese Flexibilität gewährleistet eine reibungslose Leistung auf unterschiedlichen Hardwarekonfigurationen für Echtzeitanwendungen. Darüber hinaus ist YOLO11 schneller und effizienter, senkt die Rechenkosten und verkürzt die Inferenzzeiten. Egal, ob du das Ultralytics-Python-Paket oder den No-Code-Dienst Ultralytics HUB verwendest: YOLO11 lässt sich einfach in deine bestehenden Arbeitsabläufe integrieren.

Die Zukunft der YOLO-Modelle und der Objekterkennung#

Die Auswirkungen der fortschrittlichen Objekterkennung auf Echtzeitanwendungen und Edge AI sind bereits branchenübergreifend spürbar. Da Branchen wie die Öl- und Gasindustrie, das Gesundheitswesen und der Einzelhandel zunehmend auf KI setzen, steigt der Bedarf an schneller und präziser Objekterkennung weiter. Ultralytics YOLO11 soll diesem Bedarf gerecht werden, indem es eine leistungsstarke Erkennung auch auf Geräten mit begrenzter Rechenleistung ermöglicht.

Mit dem Wachstum von Edge AI werden Objekterkennungsmodelle wie Ultralytics YOLO11 für Entscheidungen in Echtzeit wahrscheinlich noch wichtiger werden – insbesondere in Umgebungen, in denen Geschwindigkeit und Genauigkeit entscheidend sind. Durch kontinuierliche Verbesserungen bei Design und Anpassungsfähigkeit dürfte die Zukunft der Objekterkennung noch mehr Innovationen für unterschiedlichste Anwendungen hervorbringen.

Wichtige Erkenntnisse#

Die Objekterkennung hat eine lange Entwicklung durchlaufen: von einfachen Methoden bis hin zu den fortschrittlichen Deep-Learning-Techniken, die wir heute sehen. YOLO-Modelle standen im Mittelpunkt dieses Fortschritts und liefern branchenübergreifend eine schnellere und genauere Erkennung in Echtzeit. Ultralytics YOLO11 baut auf diesem Erbe auf, verbessert die Effizienz, senkt die Rechenkosten und steigert die Genauigkeit. Dadurch ist es eine zuverlässige Wahl für verschiedenste Echtzeitanwendungen. Angesichts der laufenden Fortschritte in KI und Computer Vision erscheint die Zukunft der Objekterkennung vielversprechend, mit weiterem Verbesserungspotenzial bei Geschwindigkeit, Präzision und Anpassungsfähigkeit.

Interessierst du dich für AI? Bleibe mit unserer Community in Verbindung und lerne weiter! Sieh dir unser GitHub-Repository an, um zu erfahren, wie wir AI nutzen, um innovative Lösungen in Branchen wie der Fertigung und dem Gesundheitswesen zu entwickeln. 🚀

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens