Erkunde, wie die Anwendungen von Computer Vision funktionieren
Tauche mit uns tief in die Anwendungen von Computer Vision ein. Wir führen dich auch durch verschiedene Computer Vision-Aufgaben wie Objekterkennung und Segmentierung.

Als wir die history of computer vision models untersuchten, sahen wir, wie sich computer vision entwickelt hat und welchen Weg es zu den fortschrittlichen Visionsmodellen von heute geführt hat. Moderne Modelle wie Ultralytics YOLOv8 unterstützen mehrere computer vision tasks und werden in verschiedenen spannenden Anwendungen eingesetzt.
In diesem Artikel werfen wir einen Blick auf die Grundlagen von Computer Vision und Vision-Modellen. Wir gehen darauf ein, wie sie funktionieren und welche vielfältigen Einsatzmöglichkeiten sie in verschiedenen Branchen haben. Innovationen im Bereich Computer Vision sind überall und prägen unsere Welt im Stillen. Lass uns diese nacheinander aufdecken!
Was ist Computer Vision?#
Künstliche Intelligenz (KI) ist ein Oberbegriff, der viele Technologien umfasst, die darauf abzielen, einen Teil der menschlichen Intelligenz nachzubilden. Ein solches Teilgebiet der KI ist Computer Vision. Computer Vision konzentriert sich darauf, Maschinen Augen zu geben, mit denen sie ihre Umgebung sehen, beobachten und verstehen können.
Genau wie beim menschlichen Sehen zielen Computer-Vision-Lösungen darauf ab, Objekte zu unterscheiden, Abstände zu berechnen und Bewegungen zu erkennen. Im Gegensatz zu Menschen, die über einen lebenslangen Erfahrungsschatz verfügen, der ihnen beim Sehen und Verstehen hilft, verlassen sich Computer jedoch auf riesige Datenmengen, hochauflösende Kameras und komplexe Algorithmen.

Fig 1. Vergleich zwischen menschlicher Vision und Computer Vision.
Computer-Vision-Systeme können visuelle Daten wie Bilder und Videos mit unglaublicher Geschwindigkeit und Genauigkeit verarbeiten und analysieren. Die Fähigkeit, riesige Mengen an visuellen Informationen schnell und präzise zu analysieren, macht Computer Vision zu einem leistungsstarken Werkzeug in verschiedenen Branchen, von der manufacturing bis zum healthcare.
Vision-Modelle unterstützen verschiedene Computer-Vision-Aufgaben#
Computer-Vision-Modelle bilden den Kern jeder Computer-Vision-Anwendung. Im Wesentlichen handelt es sich dabei um Rechenalgorithmen, die auf Deep-Learning-Techniken basieren und Maschinen die Fähigkeit verleihen sollen, visuelle Informationen zu interpretieren und zu verstehen. Vision-Modelle ermöglichen entscheidende Computer-Vision-Aufgaben, die von der image classification bis zur object detection reichen. Schauen wir uns einige dieser Aufgaben und ihre Anwendungsfälle im Detail an.
Bildklassifizierung#
Image classification beinhaltet das Kategorisieren und Etikettieren von Bildern in vordefinierte Klassen oder Kategorien. Ein Vision-Modell wie YOLOv8 kann anhand großer datasets mit gekennzeichneten Bildern trainiert werden. Während des Trainings lernt das Modell, Muster und Merkmale zu erkennen, die mit jeder Klasse verbunden sind. Nach dem Training kann es die Kategorie neuer, ungesehener Bilder vorhersagen, indem es deren Merkmale analysiert und sie mit den gelernten Mustern vergleicht.

Abb. 2. Ein Beispiel für Bildklassifizierung. (Quelle: towardsdatascience.com)
Es gibt verschiedene Arten der Bildklassifizierung. Wenn du dich beispielsweise mit medical images befasst, kannst du die binäre Klassifizierung verwenden, um Bilder in zwei Gruppen wie gesund oder krank aufzuteilen. Eine andere Art ist die Multiklassen-Klassifizierung. Sie kann dabei helfen, Bilder in viele Gruppen zu klassifizieren, wie zum Beispiel classifying different animals on a farm wie Schweine, Ziegen und Kühe. Oder angenommen, du möchtest Tiere in Gruppen und Untergruppen einteilen – wie etwa die Klassifizierung von Tieren in Säugetiere und Vögel und dann weiter in Arten wie Löwen, Tiger, Adler und Spatzen –, dann wäre die hierarchische Klassifizierung die beste Option.
Objekterkennung#
Objekterkennung ist der Prozess des Identifizierens und Lokalisierens von Objekten in Bildern und Videoframes mithilfe von Computer Vision. Sie besteht aus zwei Aufgaben: Objektlokalisierung, bei der Begrenzungsrahmen um Objekte gezogen werden, und Objektklassifizierung, bei der die Kategorie jedes Objekts identifiziert wird. Basierend auf Begrenzungsrahmen-Annotationen kann ein Vision-Modell lernen, Muster und Merkmale zu erkennen, die für jede Objektkategorie spezifisch sind, und das Vorhandensein sowie den Standort dieser Objekte in neuen, ungesehenen Bildern vorherzusagen.
Abb. 3. YOLOv8 Objekterkennung, die verwendet wird, um Spieler auf einem Fußballfeld zu erkennen.
Objekterkennung hat viele Anwendungsfälle in verschiedenen Branchen, von sports bis hin zur Meeresbiologie. In der retail verwendet beispielsweise die Technologie von Amazon’s Just Walk Out die Objekterkennung, um den Bezahlvorgang zu automatisieren, indem sie Artikel identifiziert, die Kunden aufnehmen. Eine Kombination aus Computer Vision und Sensordaten ermöglicht es Kunden, ihre Artikel einzupacken und zu gehen, ohne Schlange stehen zu müssen.
Hier ist ein genauerer Blick darauf, wie das funktioniert:
- An der Decke montierte Kameras erfassen Kunden, die sich durch das Geschäft bewegen, und dieses Videomaterial wird in Echtzeit von Vision-Modellen verarbeitet.
- Objekterkennung wird verwendet, um genau das Produkt zu erkennen, das ein Kunde auswählt und in seinen Korb legt, um dessen virtuellen Warenkorb entsprechend zu aktualisieren.
- Gewichtssensoren in den Regalen verbessern die Genauigkeit, indem sie das Entfernen oder Hinzufügen von Artikeln erkennen.
- Wenn der Kunde das Geschäft verlässt, können Objekterkennung und die Technologie der facial recognition verwendet werden, um zu bestätigen, dass der Kunde gegangen ist, und seine Zahlungsdaten, wie etwa eine Kreditkarte, können genutzt werden, um ihn automatisch zu belasten.
Semantische und Instanz-Segmentierung#
Semantische Segmentierung und instance segmentation sind Computer-Vision-Aufgaben, die dabei helfen, Bilder in aussagekräftige Segmente zu unterteilen. Die semantische Segmentierung klassifiziert Pixel basierend auf ihrer semantischen Bedeutung und behandelt alle Objekte innerhalb einer Kategorie als eine einzige Einheit mit demselben Label. Sie eignet sich zum Kennzeichnen von nicht zählbaren Objekten wie „dem Himmel“ oder „Ozean“ oder von Clustern wie „Blättern“ oder „Gras“.
Die Instanz-Segmentierung hingegen kann verschiedene Instanzen derselben Klasse unterscheiden, indem jedem erkannten Objekt eine eindeutige Bezeichnung zugewiesen wird. Du kannst die Instanz-Segmentierung verwenden, um zählbare Objekte zu segmentieren, bei denen die Anzahl und die Unabhängigkeit der Objekte wichtig sind. Dies ermöglicht eine präzisere Identifizierung und Differenzierung.
Abb. 4. Ein Beispiel für semantische und Instanz-Segmentierung.
Wir können den Kontrast zwischen semantischer und Instanz-Segmentierung anhand eines Beispiels im Zusammenhang mit self-driving cars klarer verstehen. Semantische Segmentierung eignet sich hervorragend für Aufgaben, die ein Verständnis des Inhalts einer Szene erfordern, und kann in autonomen Fahrzeugen verwendet werden, um Merkmale auf der Straße wie Fußgängerüberwege und Verkehrsschilder zu klassifizieren. Inzwischen kann Instanz-Segmentierung in autonomen Fahrzeugen verwendet werden, um zwischen einzelnen Fußgängern, Fahrzeugen und Hindernissen zu unterscheiden.
Pose-Schätzung#
Pose estimation ist eine Computer-Vision-Aufgabe, die sich auf das Erkennen und Verfolgen von Schlüsselpunkten der Posen eines Objekts in Bildern oder Videos konzentriert. Sie wird am häufigsten für die menschliche Posen-Schätzung verwendet, wobei Schlüsselpunkte Bereiche wie Schultern und Knie umfassen. Die Schätzung der Pose eines Menschen hilft uns dabei, Aktionen und Bewegungen zu verstehen und zu erkennen, die für verschiedene Anwendungen von entscheidender Bedeutung sind.

Fig 5. Ein Beispiel für Posen-Schätzung mit YOLOv8.
Pose-Schätzung kann im Sport verwendet werden, um die Bewegungsabläufe von Athleten zu analysieren. Die NBA nutzt Pose-Schätzung, um Spielerbewegungen und Positionen während des Spiels zu untersuchen. Durch die Verfolgung von Schlüsselpunkten wie Schultern, Ellbogen, Knien und Knöcheln liefert die Pose-Schätzung detaillierte Einblicke in die Bewegungen der Spieler. Diese Erkenntnisse helfen Trainern, bessere Strategien zu entwickeln, Trainingsprogramme zu optimieren und Anpassungen in Echtzeit während der Spiele vorzunehmen. Außerdem können die Daten helfen, die Ermüdung der Spieler und das Verletzungsrisiko zu überwachen, um die allgemeine Gesundheit und Leistung der Spieler zu verbessern.
Objekterkennung mit orientierten Begrenzungsrahmen#
Oriented Bounding Boxes Object Detection (OBB) verwendet gedrehte Rechtecke, um Objekte in einem Bild präzise zu identifizieren und zu lokalisieren. Im Gegensatz zu Standard-Bounding-Boxes, die an den Bildachsen ausgerichtet sind, drehen sich OBBs so, dass sie zur Ausrichtung des Objekts passen. Dies macht sie besonders nützlich für Objekte, die nicht perfekt horizontal oder vertikal sind. Sie eignen sich hervorragend dazu, gedrehte Objekte genau zu lokalisieren und zu isolieren, um Überschneidungen in überfüllten Umgebungen zu verhindern.
Abb. 6. Ein Beispiel für die Erkennung von orientierten Begrenzungsrahmen auf einem Luftbild von Booten mit YOLOv8.
In der maritime Überwachung ist die Identifizierung und Verfolgung von Schiffen der Schlüssel für Sicherheit und Ressourcenmanagement. OBB-Erkennung kann für die präzise Lokalisierung von Schiffen verwendet werden, selbst wenn diese dicht gedrängt oder in verschiedenen Winkeln ausgerichtet sind. Sie hilft dabei, Schifffahrtswege zu überwachen, den Schiffsverkehr zu verwalten und den Hafenbetrieb zu optimieren. Sie kann auch bei der Katastrophenhilfe unterstützen, indem sie nach Ereignissen wie Hurrikans oder oil spills Schäden an Schiffen und Infrastruktur schnell identifiziert und bewertet.
Objektverfolgung#
Bisher haben wir Computer-Vision-Aufgaben besprochen, die sich mit Bildern befassen. Object tracking ist eine Computer-Vision-Aufgabe, die ein Objekt über die Frames eines Videos hinweg verfolgen kann. Sie beginnt damit, das Objekt im ersten Frame mithilfe von Erkennungsalgorithmen zu identifizieren, und verfolgt dann kontinuierlich seine Position, während es sich durch das Video bewegt. Die Objektverfolgung umfasst Techniken wie Objekterkennung, Merkmalsextraktion und Bewegungsvorhersage, um die Verfolgung genau zu halten.

Abb. 7. Verwendung von YOLOv8 zur Verfolgung von Fischen.
Vision-Modelle wie YOLOv8 können verwendet werden, um track fish in marine biology. Mithilfe von Unterwasserkameras können Forscher die Bewegungen und das Verhalten von Fischen in ihren natürlichen Lebensräumen überwachen. Der Prozess beginnt mit dem Erkennen einzelner Fische in den ersten Frames und verfolgt dann deren Positionen über das gesamte Video hinweg. Das Verfolgen von Fischen hilft Wissenschaftlern, Migrationsmuster, Sozialverhaltensweisen und Interaktionen mit der Umwelt zu verstehen. Es unterstützt auch nachhaltige Fischereipraktiken, indem es Einblicke in die Verteilung und Häufigkeit von Fischen liefert.
Ein abschließender Blick auf Computer Vision#
Computer Vision verändert aktiv die Art und Weise, wie wir Technologie nutzen und mit der Welt interagieren. Durch den Einsatz von Deep-Learning-Modellen und komplexen Algorithmen zum Verständnis von Bildern und Videos hilft Computer Vision Branchen dabei, viele Prozesse zu rationalisieren. Computer-Vision-Aufgaben wie Objekterkennung und Objektverfolgung machen es möglich, Lösungen zu schaffen, die man sich vorher nicht vorstellen konnte. Da sich die Computer-Vision-Technologie ständig verbessert, hält die Zukunft noch viele weitere innovative Anwendungen bereit!
Lass uns gemeinsam lernen und wachsen! Erkunde unser GitHub repository, um unsere Beiträge zur KI zu sehen. Sieh dir an, wie wir Branchen wie self-driving cars und agriculture mit KI neu definieren. 🚀






