Alles, was du über Computer-Vision-Aufgaben wissen musst
Erfahre, wie Computer-Vision-Aufgaben wie Objektverfolgung, Instanzsegmentierung und Bildklassifizierung funktionieren und wie Ultralytics YOLO11 sie unterstützt.

Dank Kameras und Fortschritten in der künstlichen Intelligenz (AI) können Computer und Maschinen die Welt heute ähnlich wahrnehmen wie Menschen. Sie können beispielsweise Personen erkennen, Objekte verfolgen und sogar den Kontext des Geschehens in einem Video verstehen.
Insbesondere ist Computer Vision ein Teilgebiet der AI, das Maschinen ermöglicht, visuelle Informationen aus ihrer Umgebung zu verstehen und zu interpretieren. Computer Vision umfasst verschiedene Aufgaben, die jeweils darauf ausgelegt sind, eine bestimmte Art von Informationen aus Bildern oder Videos zu gewinnen. Die Objekterkennung hilft beispielsweise dabei, verschiedene Elemente in einem Bild zu identifizieren und zu lokalisieren, während andere Aufgaben wie Verfolgung, Segmentierung und Posenschätzung Maschinen helfen, Bewegungen, Formen und Positionen genauer zu verstehen.
Die für eine bestimmte Anwendung verwendete Computer-Vision-Aufgabe hängt von der Art der benötigten Informationen ab. Computer-Vision-Modelle wie Ultralytics YOLO11 unterstützen verschiedene Computer-Vision-Aufgaben und sind daher eine zuverlässige Wahl für die Entwicklung praxisnaher Systeme für visuelle KI.
In diesem Leitfaden sehen wir uns die von Modellen wie YOLO11 unterstützten Computer-Vision-Aufgaben genauer an. Wir untersuchen, wie die einzelnen Aufgaben funktionieren und wie sie in verschiedenen Branchen eingesetzt werden. Legen wir los!
Was sind Computer-Vision-Aufgaben?#
Computer-Vision-Aufgaben versuchen, menschliche Fähigkeiten des Sehens auf unterschiedliche Weise nachzubilden. Sie können Maschinen dabei helfen, Objekte zu erkennen, ihre Bewegungen zu verfolgen, Posen zu schätzen und sogar einzelne Elemente in Bildern und Videos zu umranden. In der Regel werden Computer-Vision-Aufgaben durch Modelle ermöglicht, die visuelle Daten in kleinere Teile zerlegen, damit sie das Geschehen klarer interpretieren können.
Modelle für visuelle KI wie die Ultralytics-YOLO-Modelle unterstützen mehrere Aufgaben wie Erkennung, Verfolgung und Segmentierung innerhalb eines Frameworks. Dank dieser Vielseitigkeit lassen sich YOLO11-Modelle einfach für eine große Bandbreite an Anwendungsfällen einsetzen.

Abb. 1. Von Ultralytics YOLO11 unterstützte Computer-Vision-Aufgaben.
Ein gutes Beispiel dafür ist die Sportanalyse. YOLO11 kann mithilfe der Objekterkennung jeden Spieler auf dem Spielfeld erkennen und ihn anschließend mit der Objektverfolgung während des gesamten Spiels verfolgen. Gleichzeitig können die Fähigkeiten von YOLO11 zur Posenschätzung dabei helfen, Bewegungen und Techniken der Spieler zu analysieren, während die Instanzsegmentierung jeden Spieler vom Hintergrund trennen und so die Analyse präzisieren kann.
Zusammen liefern diese durch YOLO11 ermöglichten Computer-Vision-Aufgaben ein vollständiges Bild des Spielgeschehens und verschaffen Teams tiefere Einblicke in die Leistung der Spieler, die Taktik und die Gesamtstrategie.
Ein Überblick über die von Ultralytics YOLO11 unterstützten Computer-Vision-Aufgaben#
Nachdem wir uns angesehen haben, was Computer-Vision-Aufgaben sind, sehen wir uns nun anhand praxisnaher Beispiele genauer an, wie die einzelnen von YOLO11 unterstützten Aufgaben funktionieren.
Unterstützung der Bildklassifizierung durch Ultralytics YOLO11#
Wenn du ein Foto betrachtest, können die meisten Menschen leicht erkennen, ob darauf ein Hund, ein Berg oder ein Verkehrsschild zu sehen ist, weil wir alle gelernt haben, wie diese Dinge typischerweise aussehen. Die Bildklassifizierung bringt Maschinen bei, dasselbe zu tun, indem sie lernen, ein Bild anhand seines Hauptobjekts zu klassifizieren und zu beschriften – unabhängig davon, ob es sich um ein „Auto“, eine „Banane“ oder ein „Röntgenbild mit Fraktur“ handelt. Dieses Etikett hilft Computer-Vision-Systemen, den visuellen Inhalt zu verstehen und entsprechend zu reagieren oder Entscheidungen zu treffen.
Eine interessante Anwendung dieser Computer-Vision-Aufgabe ist die Überwachung von Wildtieren. Die Bildklassifizierung kann genutzt werden, um verschiedene Tierarten anhand von in freier Wildbahn aufgenommenen Fotos zu identifizieren. Durch die automatische Beschriftung von Bildern können Forschende Populationen verfolgen, Migrationsmuster überwachen und gefährdete Arten leichter erkennen, um Naturschutzmaßnahmen zu unterstützen.

Abb. 2. Ein Beispiel für die Verwendung von YOLO11 zur Bildklassifizierung.
Objekterkennungsfunktionen von Ultralytics YOLO11#
Während die Bildklassifizierung hilfreich ist, um einen allgemeinen Eindruck vom Inhalt eines Bildes zu erhalten, weist sie dem gesamten Bild nur ein einziges Etikett zu. Wenn detaillierte Informationen erforderlich sind, etwa die genaue Position und Identität mehrerer Objekte, wird die Objekterkennung unverzichtbar.
Objekterkennung ist der Prozess, einzelne Objekte innerhalb eines Bildes zu identifizieren und zu lokalisieren, häufig durch das Zeichnen von Begrenzungsrahmen um sie herum. Ultralytics YOLO11 eignet sich besonders gut für die Objekterkennung in Echtzeit und ist damit ideal für eine große Bandbreite an Anwendungen.
Nehmen wir als Beispiel Computer-Vision-Lösungen, die in Einzelhandelsgeschäften zur Regalbestückung eingesetzt werden. Die Objekterkennung kann dabei helfen, Obst, Gemüse und andere Artikel zu zählen und so einen genauen Lagerbestand sicherzustellen. Auf landwirtschaftlichen Feldern kann dieselbe Technologie den Reifegrad von Nutzpflanzen überwachen und Landwirten helfen, den besten Erntezeitpunkt zu bestimmen, indem sie sogar zwischen reifen und unreifen Erzeugnissen unterscheidet.
Abb. 3. Obst mit Ultralytics YOLO11 erkennen.
Instanzsegmentierung mit YOLO11#
Die Objekterkennung verwendet Begrenzungsrahmen, um Objekte in einem Bild zu identifizieren und zu lokalisieren, erfasst jedoch nicht deren genaue Formen. Hier kommt die Instanzsegmentierung ins Spiel. Statt einen Rahmen um ein Objekt zu zeichnen, verfolgt die Instanzsegmentierung dessen exakte Kontur.
Du kannst es dir so vorstellen: Statt lediglich anzuzeigen, dass sich „in diesem Bereich ein Apfel befindet“, zeichnet sie die genaue Form des Apfels sorgfältig nach und füllt sie aus. Dieser detaillierte Prozess hilft AI-Systemen, die Grenzen eines Objekts klar zu verstehen, insbesondere wenn Objekte dicht beieinander liegen.
Die Instanzsegmentierung kann in vielen Anwendungsbereichen eingesetzt werden, von Infrastrukturinspektionen bis hin zu geologischen Untersuchungen. So können beispielsweise Daten aus geologischen Untersuchungen mit YOLO11 analysiert werden, um sowohl große als auch kleine Risse oder Anomalien an der Oberfläche zu segmentieren. Durch das Zeichnen präziser Grenzen um diese Anomalien können Ingenieurinnen und Ingenieure Probleme genau lokalisieren und beheben, bevor ein Projekt beginnt.

Abb. 4. Risssegmentierung mit YOLO11.
Objektverfolgung: Objekte über mehrere Einzelbilder hinweg mit YOLO11 verfolgen#
Bisher haben sich die von uns betrachteten Computer-Vision-Aufgaben auf den Inhalt eines einzelnen Bildes konzentriert. Bei Videos benötigen wir jedoch Informationen, die über ein einzelnes Einzelbild hinausgehen. Dafür kann die Aufgabe der Objektverfolgung eingesetzt werden.
Die Objektverfolgung von YOLO11 kann ein bestimmtes Objekt, etwa eine Person oder ein Auto, verfolgen, während es sich durch eine Reihe von Videoeinzelbildern bewegt. Selbst wenn sich der Kamerawinkel ändert oder andere Objekte auftauchen, verfolgt das System dasselbe Ziel weiter.
Das ist für Anwendungen, die eine Überwachung über einen längeren Zeitraum erfordern, von entscheidender Bedeutung, etwa für die Verfolgung von Autos im Verkehr. YOLO11 kann Fahrzeuge tatsächlich präzise verfolgen und jedem Auto folgen, um seine Geschwindigkeit in Echtzeit zu schätzen. Dadurch wird die Objektverfolgung zu einer wichtigen Komponente in Systemen zur Verkehrsüberwachung.

Abb. 5. Die Unterstützung von YOLO11 für die Objektverfolgung kann zur Geschwindigkeitsschätzung eingesetzt werden.
Orientierte Begrenzungsrahmen (OBB) mit YOLO11 erkennen#
Objekte in der realen Welt sind nicht immer perfekt ausgerichtet – sie können geneigt, seitlich gedreht oder in ungewöhnlichen Winkeln positioniert sein. Auf Satellitenbildern erscheinen Schiffe und Gebäude beispielsweise häufig gedreht.
Herkömmliche Objekterkennungsmethoden verwenden feste rechteckige Rahmen, die sich nicht an die Ausrichtung eines Objekts anpassen. Dadurch ist es schwierig, diese gedrehten Formen präzise zu erfassen. Die Erkennung orientierter Begrenzungsrahmen (OBB) löst dieses Problem, indem sie Rahmen verwendet, die sich drehen und eng an ein Objekt anlegen, sodass sie dessen Winkel folgen und eine präzisere Erkennung ermöglichen.
Bei der Hafenüberwachung kann die OBB-Erkennung von YOLO11 dabei helfen, Schiffe unabhängig von ihrer Ausrichtung präzise zu identifizieren und zu verfolgen. So wird sichergestellt, dass jedes in den Hafen ein- oder aus ihm ausfahrende Schiff ordnungsgemäß überwacht wird. Diese präzise Erkennung liefert Echtzeitinformationen über die Positionen und Bewegungen von Schiffen, was für die Verwaltung stark frequentierter Häfen und die Vermeidung von Kollisionen entscheidend ist.

Abb. 6. Boote mit OBB-Erkennung und YOLO11 erkennen.
Posenschätzung und YOLO11: Schlüsselpunkte verfolgen#
Posenschätzung ist eine Computer-Vision-Technik, die Schlüsselpunkte wie Gelenke, Gliedmaßen oder andere Orientierungspunkte verfolgt, um zu verstehen, wie sich ein Objekt bewegt. Anstatt ein gesamtes Objekt oder einen Körper als eine unteilbare Einheit zu behandeln, zerlegt diese Methode ihn in seine wesentlichen Teile. Dadurch lassen sich Bewegungen, Gesten und Interaktionen detailliert analysieren.
Eine verbreitete Anwendung dieser Technologie ist die Posenschätzung des menschlichen Körpers. Durch die Echtzeitverfolgung der Positionen verschiedener Körperteile liefert sie ein klares Bild davon, wie sich eine Person bewegt. Diese Informationen können für vielfältige Zwecke genutzt werden, von der Gestenerkennung und Aktivitätsüberwachung bis hin zur Leistungsanalyse im Sport.
Auch in der körperlichen Rehabilitation können Therapeutinnen und Therapeuten die Posenschätzung des menschlichen Körpers und YOLO11 nutzen, um die Bewegungen von Patientinnen und Patienten während der Übungen zu überwachen. So lässt sich sicherstellen, dass jede Bewegung korrekt ausgeführt wird, während gleichzeitig die Fortschritte im Laufe der Zeit verfolgt werden.

Abb. 7. YOLO11 kann ein Training mithilfe der Posenschätzung überwachen.
Wie YOLO11 verschiedene Computer-Vision-Aufgaben unterstützt#
Nachdem wir alle von YOLO11 unterstützten Computer-Vision-Aufgaben ausführlich betrachtet haben, sehen wir uns nun an, wie YOLO11 diese unterstützt.
YOLO11 ist nicht nur ein einzelnes Modell – es ist eine Sammlung spezialisierter Modellvarianten, die jeweils für eine bestimmte Computer-Vision-Aufgabe entwickelt wurden. Dadurch ist YOLO11 ein vielseitiges Werkzeug, das sich an eine große Bandbreite an Anwendungen anpassen lässt. Du kannst diese Modelle außerdem mit eigenen Datensätzen feinabstimmen, um die spezifischen Herausforderungen deiner Projekte zu bewältigen.
Hier sind die YOLO11-Modellvarianten, die für bestimmte visuelle Aufgaben vortrainiert wurden:
- YOLO11: Dieses Modell erkennt und beschriftet mehrere Objekte in Echtzeit und eignet sich daher ideal für die schnelle visuelle Erkennung.
- YOLO11-seg: Diese Variante konzentriert sich auf die Segmentierung und verwendet detaillierte Masken, um Objekte von ihrem Hintergrund zu trennen.
- YOLO11-obb: Dieses Modell wurde entwickelt, um gedrehte Objekte zu erkennen, indem es Begrenzungsrahmen zeichnet, die an der Ausrichtung des jeweiligen Objekts ausgerichtet sind.
- YOLO11-cls: Diese Variante klassifiziert Bilder, indem sie auf Grundlage des Gesamtinhalts ein einzelnes Kategorieetikett zuweist.
- YOLO11-pose: Dieses Modell schätzt Schlüsselpunkte am Körper, um Körperhaltung, Positionen der Gliedmaßen und Bewegungen zu verfolgen.
Jede Variante ist in verschiedenen Größen verfügbar, sodass du für deine spezifischen Anforderungen das passende Gleichgewicht zwischen Geschwindigkeit und Genauigkeit wählen kannst.
Wichtige Erkenntnisse#
Computer-Vision-Aufgaben verändern die Art und Weise, wie Maschinen die Welt verstehen und mit ihr interagieren. Indem Bilder und Videos in wesentliche Elemente zerlegt werden, erleichtern diese Technologien die detaillierte Analyse von Objekten, Bewegungen und Interaktionen.
Von der Verbesserung der Verkehrssicherheit und sportlichen Leistung bis zur Optimierung industrieller Prozesse können Modelle wie YOLO11 Echtzeitinformationen liefern, die Innovationen vorantreiben. Während sich visuelle KI weiterentwickelt, wird sie wahrscheinlich eine immer wichtigere Rolle dabei spielen, wie wir visuelle Daten im Alltag interpretieren und nutzen.
Tritt unserer Community bei und besuche unser GitHub-Repository, um KI in Aktion zu erleben. Informiere dich über unsere Lizenzoptionen und erfahre auf unseren Lösungsseiten mehr über KI in der Landwirtschaft und Computer Vision in der Fertigung.









