Ein Leitfaden für einen tiefen Einblick in die Objekterkennung im Jahr 2025
Lerne mehr über Objekterkennung, ihre Bedeutung für KI und wie Modelle wie YOLO11 Branchen wie autonomes Fahren, Gesundheitswesen und Sicherheit verändern.

Viele Branchen integrieren Künstliche Intelligenz (KI) rasant in ihre Abläufe. Unter den vielen heute verfügbaren KI-Technologien gehört Computer Vision zu den beliebtesten. Computer vision ist ein Zweig der KI, der Computern hilft, den Inhalt von Bildern und Videos genau wie Menschen zu sehen und zu verstehen. Sie versetzt Maschinen in die Lage, Objekte zu erkennen, Muster zu identifizieren und zu erfassen, was sie vor sich sehen.
Der globale Marktwert von computer vision wird schätzungsweise bis 2032 auf 175,72 Milliarden US-Dollar anwachsen. Computer Vision umfasst verschiedene Aufgaben, die es Vision-KI-Systemen ermöglichen, visuelle Daten zu analysieren und zu interpretieren. Eine der am häufigsten genutzten und wichtigsten Aufgaben von Computer Vision ist die Objekterkennung.
Object detection konzentriert sich darauf, Objekte in visuellen Daten zu lokalisieren und zu klassifizieren. Wenn du einem Computer beispielsweise ein Bild einer Kuh zeigst, kann er die Kuh erkennen und einen Begrenzungsrahmen darum zeichnen. Diese Fähigkeit ist in realen Anwendungen wie der Tierüberwachung, selbstfahrenden Autos und der Überwachung nützlich.
Wie lässt sich die Objekterkennung also durchführen? Ein Weg führt über Computer-Vision-Modelle. Zum Beispiel ist Ultralytics YOLO11 ein Computer-Vision-Modell, das Computer-Vision-Aufgaben wie die Objekterkennung unterstützt.
In diesem Leitfaden werden wir die Objekterkennung untersuchen und erläutern, wie sie funktioniert. Wir werden auch einige reale Anwendungsfälle für die Objekterkennung und Ultralytics YOLO11 diskutieren.

Fig 1. Verwendung der YOLO11-Unterstützung für Objekterkennung zur Überwachung von Rindern.
Was ist Objekterkennung?#
Objekterkennung ist eine Aufgabe der Computer Vision, die Objekte in Bildern oder Videos identifiziert und lokalisiert. Sie beantwortet zwei Schlüsselfragen: 'Welche Objekte sind auf dem Bild?' und 'Wo befinden sie sich?'
Du kannst dir die Objekterkennung als einen Prozess vorstellen, der aus zwei Hauptschritten besteht. Der erste Schritt, die Objektklassifizierung, ermöglicht es dem System, Objekte zu erkennen und zu beschriften – etwa das Identifizieren einer Katze, eines Autos oder einer Person basierend auf erlernten Mustern. Der zweite Schritt, die Lokalisierung, bestimmt die Position des Objekts, indem ein Begrenzungsrahmen (BBox) darum gezeichnet wird, was anzeigt, wo es im Bild erscheint. Zusammen ermöglichen diese Schritte Maschinen, Objekte in einer Szene zu erkennen und zu verstehen.
Der Aspekt der Objekterkennung, der sie einzigartig macht, ist ihre Fähigkeit, Objekte zu erkennen und deren Standort präzise zu bestimmen. Andere computer vision tasks konzentrieren sich auf andere Ziele.
Zum Beispiel weist die Bildklassifizierung einem gesamten Bild ein Label zu. Die Bildsegmentierung hingegen bietet ein pixelgenaues Verständnis verschiedener Elemente. Die Objekterkennung wiederum kombiniert Erkennung mit Lokalisierung. Dies macht sie besonders nützlich für Aufgaben wie das Zählen mehrerer Objekte in Echtzeit.

Fig 2. Vergleich von Computer-Vision-Aufgaben.
Objekterkennung vs. Objekterkennung#
Wenn du verschiedene Begriffe aus der Computer Vision erkundest, magst du den Eindruck haben, dass Objekterkennung (Object Recognition) und Objekterkennung (Object Detection) austauschbar seien – sie dienen jedoch unterschiedlichen Zwecken. Ein guter Weg, den Unterschied zu verstehen, ist die Betrachtung von Gesichtserkennung (Face Detection) und Gesichtsidentifizierung (Face Recognition).
Gesichtserkennung (Face Detection) ist eine Form der Objekterkennung. Sie identifiziert das Vorhandensein eines Gesichts in einem Bild und markiert dessen Position mit einem Begrenzungsrahmen (BBox). Sie beantwortet die Frage: „Wo befindet sich das Gesicht auf dem Bild?“ Diese Technologie wird häufig in Smartphone-Kameras verwendet, die automatisch auf Gesichter fokussieren, oder in Überwachungskameras, die erkennen, wenn eine Person anwesend ist.
Face recognition hingegen ist eine Form der Objekterkennung. Sie erkennt nicht nur ein Gesicht; sie identifiziert, wessen Gesicht es ist, indem sie einzigartige Merkmale analysiert und diese mit einer Datenbank abgleicht. Sie beantwortet die Frage: „Wer ist diese Person?“ Dies ist die Technologie hinter dem Entsperren deines Handys mit Face ID oder Sicherheitssystemen an Flughäfen, die Identitäten überprüfen.
Einfach ausgedrückt: Die Objekterkennung (Object Detection) findet und lokalisiert Objekte, während die Objekterkennung (Object Recognition) sie klassifiziert und identifiziert.

Abb. 3. Objekterkennung vs. Objektidentifizierung. Bild vom Autor.
Viele Objekterkennungsmodelle wie Ultralytics YOLO11 sind so konzipiert, dass sie Gesichtserkennung (face detection), aber keine Gesichtsidentifikation (face recognition) unterstützen. YOLO11 kann das Vorhandensein eines Gesichts in einem Bild effizient erkennen und einen Bounding-Box darum ziehen, was es nützlich für Anwendungen wie Überwachungssysteme, Personenstromüberwachung und automatisierte Foto-Tags macht. Es kann jedoch nicht bestimmen, wessen Gesicht es ist. YOLO11 kann in Modelle integriert werden, die speziell für die Gesichtserkennung trainiert wurden, wie etwa Facenet oder DeepFace, um sowohl Erkennung als auch Identifikation in einem einzigen System zu ermöglichen.
Verständnis der Funktionsweise der Objekterkennung#
Bevor wir besprechen, wie Objekterkennung funktioniert, lass uns genauer betrachten, wie ein Computer ein Bild analysiert. Anstatt ein Bild so zu sehen wie wir, zerlegt ein Computer es in ein Raster aus winzigen Quadraten, die Pixel genannt werden. Jedes Pixel enthält Farb- und Helligkeitsinformationen, die Computer verarbeiten können, um visuelle Daten zu interpretieren.
Um diese Pixel zu verstehen, gruppieren Algorithmen sie basierend auf Form, Farbe und ihrer Nähe zueinander in aussagekräftige Regionen. Objekterkennungsmodelle wie Ultralytics YOLO11 können Muster oder Merkmale in diesen Pixelgruppen erkennen.
Ein selbstfahrendes Auto sieht einen Fußgänger zum Beispiel nicht so wie wir – es erkennt Formen und Muster, die den Merkmalen eines Fußgängers entsprechen. Diese Modelle basieren auf einem umfangreichen Training mit beschrifteten image datasets, wodurch sie lernen können, die charakteristischen Merkmale von Objekten wie Autos, Verkehrsschildern und Menschen zu erkennen.
Ein typisches Objekterkennungsmodell besteht aus drei Hauptteilen: Backbone, Neck und Head. Der Backbone extrahiert wichtige Merkmale aus einem Bild. Der Neck verarbeitet und verfeinert diese Merkmale, während der Head dafür zuständig ist, Objektpositionen vorherzusagen und sie zu klassifizieren.
Verfeinerung von Erkennungen und Darstellung der Ergebnisse#
Sobald die ersten Erkennungen erfolgt sind, werden Nachbearbeitungstechniken angewendet, um die accuracy zu verbessern und redundante Vorhersagen herauszufiltern. Beispielsweise werden sich überschneidende Begrenzungsrahmen entfernt, um sicherzustellen, dass nur die relevantesten Erkennungen beibehalten werden. Außerdem werden jedem erkannten Objekt Konfidenzwerte (numerische Werte, die angeben, wie sicher sich das Modell ist, dass ein erkanntes Objekt zu einer bestimmten Klasse gehört) zugewiesen, um die Sicherheit des Modells bei seinen Vorhersagen anzuzeigen.
Schließlich werden die Ergebnisse mit Begrenzungsrahmen um die erkannten Objekte herum präsentiert, zusammen mit den vorhergesagten Klassen-Labels und Konfidenzwerten. Diese Ergebnisse können dann für reale Anwendungen verwendet werden.
Beliebte Objekterkennungsmodelle#
Heutzutage gibt es viele Computer-Vision-Modelle, und einige der beliebtesten sind Ultralytics YOLO models. Sie sind bekannt für ihre Geschwindigkeit, Genauigkeit und Vielseitigkeit. Im Laufe der Jahre sind diese Modelle schneller und präziser geworden und können ein breiteres Aufgabenspektrum bewältigen. Die Veröffentlichung von Ultralytics YOLOv5 erleichterte die Bereitstellung mit Frameworks wie PyTorch, sodass mehr Menschen fortschrittliche Vision-KI nutzen können, ohne tiefe technische Fachkenntnisse zu benötigen.
Auf diesem Fundament aufbauend führte Ultralytics YOLOv8 neue Funktionen wie Instanzsegmentierung, Pose-Schätzung und Bildklassifizierung ein. Jetzt treibt YOLO11 die Entwicklung mit einer besseren Leistung über mehrere Aufgaben hinweg noch weiter voran. Mit 22 % weniger Parametern als YOLOv8m erzielt YOLO11m eine höhere mittlere durchschnittliche Präzision (mAP) auf dem COCO-Datensatz. Einfach ausgedrückt kann YOLO11 Objekte mit höherer Präzision bei geringerem Ressourcenverbrauch erkennen, was es schneller und zuverlässiger macht.
Egal, ob du ein KI-Experte bist oder gerade erst anfängst, Ultralytics YOLO11 bietet eine leistungsstarke und dennoch benutzerfreundliche Lösung für Computer-Vision-Anwendungen.
Benutzerdefiniertes Training eines Modells für die Objekterkennung#
Das Training von Vision AI-Modellen beinhaltet, Computern dabei zu helfen, Bilder und Videos zu erkennen und zu verstehen. Allerdings kann das Training zeitaufwendig sein. Anstatt bei Null anzufangen, beschleunigt Transfer Learning den Prozess, indem vortrainierte Modelle verwendet werden, die bereits allgemeine Muster erkennen.
Zum Beispiel wurde Ultralytics YOLO11 bereits auf dem COCO dataset trainiert, das eine Vielzahl alltäglicher Objekte enthält. Dieses vortrainierte Modell kann weiter benutzerdefiniert trainiert werden, um spezifische Objekte zu erkennen, die möglicherweise nicht im Originaldatensatz enthalten sind.
Um Ultralytics YOLO11 zu custom-train, benötigst du einen beschrifteten Datensatz mit Bildern der Objekte, die du erkennen möchtest. Wenn du beispielsweise ein Modell entwickeln möchtest, um verschiedene Obstsorten in einem Lebensmittelladen zu identifizieren, erstellst du einen Datensatz mit beschrifteten Bildern von Äpfeln, Bananen, Orangen usw. Sobald der Datensatz vorbereitet ist, kann YOLO11 trainiert werden, wobei Parameter wie Batch-Größe, Lernrate und Epochen angepasst werden, um die Leistung zu optimieren.
Mit diesem Ansatz können Unternehmen Ultralytics YOLO11 trainieren, um alles zu erkennen – von defekten Teilen in der Fertigung bis hin zu wilden Tierarten in Naturschutzprojekten –, und das Modell exakt an ihre Bedürfnisse anpassen.
Anwendungen der Objekterkennung#
Schauen wir uns als nächstes einige reale Anwendungsfälle der Objekterkennung an und wie sie verschiedene Branchen transformiert.
Gefahrenerkennung für autonomes Fahren#
Self-driving cars nutzen Computer-Vision-Aufgaben wie die Objekterkennung, um sicher zu navigieren und Hindernissen auszuweichen. Diese Technologie hilft ihnen dabei, Fußgänger, andere Fahrzeuge, Schlaglöcher und Straßengefahren zu erkennen, wodurch sie ihre Umgebung besser verstehen können. Durch die kontinuierliche Analyse ihrer Umgebung können sie schnell Entscheidungen treffen und sich sicher durch den Verkehr bewegen.

Fig 4. Ein Beispiel für die Verwendung von Objekterkennung zur Erkennung von Schlaglöchern mit Ultralytics YOLO11.
Analyse medizinischer Bildgebung im Gesundheitswesen#
Medical imaging-Verfahren wie Röntgenaufnahmen, MRTs, CT-Scans und Ultraschall erzeugen hochdetaillierte Bilder des menschlichen Körpers, die bei der Diagnose und Behandlung von Krankheiten helfen. Diese Scans erzeugen große Datenmengen, die Ärzte wie Radiologen und Pathologen sorgfältig analysieren müssen, um Krankheiten zu erkennen. Die detailgenaue Überprüfung jedes einzelnen Bildes kann jedoch zeitaufwändig sein, und menschliche Experten übersehen aufgrund von Müdigkeit oder Zeitdruck manchmal Details.
Objekterkennungsmodelle wie Ultralytics YOLO11 können helfen, indem sie wichtige Merkmale in medizinischen Scans wie Organe, Tumoren oder Auffälligkeiten mit hoher Genauigkeit automatisch identifizieren. Benutzerdefinierte trainierte Modelle können besorgniserregende Bereiche mit Bounding Boxes hervorheben und Ärzten helfen, sich schneller auf potenzielle Probleme zu konzentrieren. Dies reduziert die Arbeitsbelastung, verbessert die Effizienz und liefert schnelle Einblicke.

Fig 5. Analyse medizinischer Bilder mit Ultralytics YOLO11.
Erhöhung der Sicherheit durch Personen- und Anomalieerkennung#
Object tracking ist eine Computer-Vision-Aufgabe, die von Ultralytics YOLO11 unterstützt wird und Echtzeitüberwachung sowie Sicherheitsverbesserungen ermöglicht. Sie baut auf der Objekterkennung auf, indem sie Objekte identifiziert und deren Bewegung über Frames hinweg kontinuierlich verfolgt. Diese Technologie wird häufig in Überwachungssystemen eingesetzt, um die Sicherheit in verschiedenen Umgebungen zu verbessern.
Zum Beispiel kann das Object Tracking in Schulen und Kindertagesstätten helfen, Kinder im Auge zu behalten und zu verhindern, dass sie weglaufen. In Sicherheitsanwendungen spielt es eine Schlüsselrolle bei der Erkennung von Eindringlingen in Sperrgebieten, der Überwachung von Menschenmengen auf Überfüllung oder verdächtiges Verhalten und dem Senden von Echtzeit-Benachrichtigungen bei Erkennung unerlaubter Aktivitäten. Indem sie Objekte bei ihrer Bewegung verfolgen, verbessern von Ultralytics YOLO11 angetriebene Tracking-Systeme die Sicherheit, automatisieren die Überwachung und ermöglichen schnellere Reaktionen auf potenzielle Bedrohungen.
Vor- und Nachteile der Objekterkennung#
Hier sind einige der Hauptvorteile, die die Objekterkennung für verschiedene Branchen mit sich bringen kann:
- Automatisierung: Objekterkennung kann helfen, den Bedarf an menschlicher Überwachung bei Aufgaben wie der Sichtung von CCTV-Aufnahmen zu reduzieren.
- Funktioniert mit anderen KI-Modellen: Sie kann mit Gesichtserkennung, Aktionserkennung und Trackingsystemen integriert werden, um Genauigkeit und Funktionalität zu verbessern.
- Echtzeitverarbeitung: Viele Objekterkennungsmodelle wie Ultralytics YOLO11 sind schnell und effizient, was sie ideal für Echtzeitanwendungen macht, die sofortige Ergebnisse erfordern.
Während diese Vorteile verdeutlichen, wie die Objekterkennung verschiedene Anwendungsfälle beeinflusst, ist es auch wichtig, die Herausforderungen bei ihrer Implementierung zu berücksichtigen. Hier sind einige der zentralen Herausforderungen:
-
Data privacy: Die Verwendung visueller Daten, insbesondere in sensiblen Bereichen wie Überwachung oder Gesundheitswesen, kann Datenschutz- und Sicherheitsbedenken aufwerfen.
-
Okklusion: Okklusion tritt bei der Objekterkennung auf, wenn Objekte teilweise verdeckt oder aus dem Blickfeld verborgen sind, was es für das Modell schwierig macht, sie präzise zu erkennen und zu klassifizieren.
-
Rechenintensiv: Hochleistungsmodelle erfordern oft leistungsstarke GPUs (Graphics Processing Units) für die Verarbeitung, was die Bereitstellung in Echtzeit kostspielig macht.
Wichtige Erkenntnisse#
Die Objekterkennung ist ein bahnbrechendes Werkzeug in Computer Vision, das Maschinen hilft, Objekte in Bildern und Videos zu erkennen und zu lokalisieren. Sie wird in Bereichen von selbstfahrenden Autos bis hin zum Gesundheitswesen eingesetzt, was Aufgaben einfacher, sicherer und effizienter macht. Mit neueren Modellen wie Ultralytics YOLO11 können Unternehmen ganz einfach benutzerdefinierte Objekterkennungsmodelle erstellen, um spezialisierte Computer-Vision-Anwendungen zu entwickeln.
Obwohl es einige Herausforderungen gibt, wie Datenschutzbedenken und das Verdecken von Objekten, ist die Objekterkennung eine zuverlässige Technologie. Ihre Fähigkeit, Aufgaben zu automatisieren, visuelle Daten in Echtzeit zu verarbeiten und sich in andere Vision AI-Tools zu integrieren, macht sie zu einem unverzichtbaren Teil modernster Innovationen.
Besuche unser GitHub repository und tausche dich mit our community aus, um mehr zu erfahren. Entdecke auf unseren Lösungsseiten Innovationen in Bereichen wie AI in self-driving cars und computer vision in agriculture. Schau dir unsere YOLO licensing options an und erwecke deine Vision-KI-Projekte zum Leben. 🚀






