Wie die Anwendungen von Computer Vision funktionieren
Tauche mit uns tief in die Anwendungen von Computer Vision ein. Wir zeigen dir außerdem verschiedene Computer-Vision-Aufgaben wie Objekterkennung und Segmentierung.

Als wir die Geschichte der Computer-Vision-Modelle untersucht haben, haben wir gesehen, wie sich Computer Vision entwickelt hat und welcher Weg zu den fortschrittlichen Vision-Modellen geführt hat, die wir heute haben. Moderne Modelle wie Ultralytics YOLOv8 unterstützen mehrere Computer-Vision-Aufgaben und werden in verschiedenen spannenden Anwendungsbereichen eingesetzt.
In diesem Artikel werfen wir einen Blick auf die Grundlagen von Computer Vision und Vision-Modellen. Wir erklären, wie sie funktionieren und welche vielfältigen Anwendungen sie in verschiedenen Branchen haben. Innovationen im Bereich Computer Vision sind überall und prägen unsere Welt oft unbemerkt. Entdecken wir sie Schritt für Schritt!
Was ist Computer Vision?#
Künstliche Intelligenz (AI) ist ein Oberbegriff für viele Technologien, die darauf abzielen, einen Teil der menschlichen Intelligenz nachzubilden. Ein solches Teilgebiet der AI ist Computer Vision. Computer Vision konzentriert sich darauf, Maschinen Augen zu geben, mit denen sie ihre Umgebung sehen, beobachten und verstehen können.
Genau wie das menschliche Sehvermögen zielen Computer-Vision-Lösungen darauf ab, Objekte zu unterscheiden, Entfernungen zu berechnen und Bewegungen zu erkennen. Im Gegensatz zu Menschen, die auf lebenslange Erfahrungen zurückgreifen können, um zu sehen und zu verstehen, sind Computer jedoch auf große Datenmengen, hochauflösende Kameras und komplexe Algorithmen angewiesen.

Abb. 1 Vergleich von menschlichem Sehvermögen und Computer Vision.
Computer-Vision-Systeme können visuelle Daten wie Bilder und Videos mit unglaublicher Geschwindigkeit und Genauigkeit verarbeiten und analysieren. Die Fähigkeit, große Mengen visueller Informationen schnell und präzise zu analysieren, macht Computer Vision zu einem leistungsstarken Werkzeug in verschiedenen Branchen, von der Fertigung bis zum Gesundheitswesen.
Vision-Modelle unterstützen verschiedene Computer-Vision-Aufgaben#
Computer-Vision-Modelle bilden den Kern jeder Computer-Vision-Anwendung. Im Wesentlichen handelt es sich um Rechenalgorithmen, die auf Deep-Learning-Techniken basieren und Maschinen die Fähigkeit geben, visuelle Informationen zu interpretieren und zu verstehen. Vision-Modelle ermöglichen wichtige Computer-Vision-Aufgaben, von der Bildklassifizierung bis zur Objekterkennung. Sehen wir uns einige dieser Aufgaben und ihre Anwendungsfälle nun genauer an.
Bildklassifizierung#
Bei der Bildklassifizierung werden Bilder vordefinierten Klassen oder Kategorien zugeordnet und entsprechend beschriftet. Ein Vision-Modell wie YOLOv8 kann mit großen Datensätzen beschrifteter Bilder trainiert werden. Während des Trainings lernt das Modell, Muster und Merkmale zu erkennen, die mit jeder Klasse verbunden sind. Nach dem Training kann es die Kategorie neuer, bisher unbekannter Bilder vorhersagen, indem es deren Merkmale analysiert und mit den erlernten Mustern vergleicht.

Abb. 2. Ein Beispiel für Bildklassifizierung. (Quelle: towardsdatascience.com)
Es gibt verschiedene Arten der Bildklassifizierung. Bei medizinischen Bildern kannst du beispielsweise die binäre Klassifizierung verwenden, um Bilder in zwei Gruppen wie gesund oder krank einzuteilen. Eine weitere Art ist die Multiklassenklassifizierung. Damit lassen sich Bilder in viele Gruppen einteilen, etwa bei der Klassifizierung verschiedener Tiere auf einem Bauernhof wie Schweinen, Ziegen und Kühen. Wenn du Tiere dagegen in Gruppen und Untergruppen einteilen möchtest, beispielsweise zunächst in Säugetiere und Vögel und anschließend in Arten wie Löwen, Tiger, Adler und Spatzen, ist die hierarchische Klassifizierung die beste Option.
Objekterkennung#
Objekterkennung ist der Prozess, bei dem Objekte in Bildern und Videoframes mithilfe von Computer Vision identifiziert und lokalisiert werden. Sie umfasst zwei Aufgaben: die Objektlokalisierung, bei der Begrenzungsrahmen um Objekte gezeichnet werden, und die Objektklassifizierung, bei der die Kategorie jedes Objekts bestimmt wird. Auf Grundlage von Annotationen der Begrenzungsrahmen kann ein Vision-Modell lernen, für jede Objektkategorie spezifische Muster und Merkmale zu erkennen und das Vorhandensein sowie die Position dieser Objekte in neuen, bisher unbekannten Bildern vorherzusagen.
Abb. 3. Objekterkennung mit YOLOv8 zur Erkennung von Spielern auf einem Fußballfeld.
Objekterkennung hat in verschiedenen Branchen zahlreiche Anwendungsfälle, vom Sport bis zur Meeresbiologie. Im Einzelhandel nutzt beispielsweise die Technologie Just Walk Out von Amazon Objekterkennung, um den Bezahlvorgang zu automatisieren, indem sie von Kunden entnommene Artikel identifiziert. Die Kombination aus Computer Vision und Sensordaten ermöglicht es Kunden, ihre Artikel zu nehmen und den Laden zu verlassen, ohne anzustehen.
So funktioniert das im Detail:
- An der Decke montierte Kameras erfassen, wie sich Kunden im Laden bewegen, und diese Videoaufnahmen werden von Vision-Modellen in Echtzeit verarbeitet.
- Mithilfe der Objekterkennung wird das genaue Produkt erkannt, das ein Kunde nimmt und in seinen Einkaufskorb legt, damit der virtuelle Warenkorb entsprechend aktualisiert werden kann.
- Gewichtssensoren in den Regalen verbessern die Genauigkeit, indem sie das Entfernen oder Zurücklegen von Artikeln erkennen.
- Wenn der Kunde den Laden verlässt, können Objekterkennung und Gesichtserkennung eingesetzt werden, um zu bestätigen, dass der Kunde gegangen ist. Anschließend können seine Zahlungsdaten, etwa eine Kreditkarte, verwendet werden, um den Betrag automatisch abzubuchen.
Semantische und Instanzsegmentierung#
Semantische Segmentierung und Instanzsegmentierung sind Computer-Vision-Aufgaben, mit denen sich Bilder in aussagekräftige Segmente unterteilen lassen. Bei der semantischen Segmentierung werden Pixel anhand ihrer semantischen Bedeutung klassifiziert, wobei alle Objekte einer Kategorie als eine einzige Einheit mit derselben Bezeichnung behandelt werden. Sie eignet sich für nicht zählbare Objekte wie „der Himmel“ oder „das Meer“ sowie für Ansammlungen wie „Blätter“ oder „Gras“.
Die Instanzsegmentierung kann dagegen verschiedene Instanzen derselben Klasse unterscheiden, indem sie jedem erkannten Objekt eine eindeutige Bezeichnung zuweist. Du kannst die Instanzsegmentierung verwenden, um zählbare Objekte zu segmentieren, bei denen die Anzahl und die Eigenständigkeit der Objekte wichtig sind. Dadurch werden eine präzisere Identifizierung und Unterscheidung möglich.
Abb. 4. Ein Beispiel für semantische Segmentierung und Instanzsegmentierung.
Den Unterschied zwischen semantischer Segmentierung und Instanzsegmentierung verstehen wir anhand eines Beispiels im Zusammenhang mit selbstfahrenden Autos noch besser. Die semantische Segmentierung eignet sich hervorragend für Aufgaben, bei denen der Inhalt einer Szene verstanden werden muss. In autonomen Fahrzeugen kann sie verwendet werden, um Merkmale auf der Straße wie Fußgängerüberwege und Verkehrsschilder zu klassifizieren. Die Instanzsegmentierung kann dagegen in autonomen Fahrzeugen eingesetzt werden, um einzelne Fußgänger, Fahrzeuge und Hindernisse voneinander zu unterscheiden.
Posenschätzung#
Posenschätzung ist eine Computer-Vision-Aufgabe, die sich auf die Erkennung und Verfolgung wichtiger Punkte der Körperhaltung eines Objekts in Bildern oder Videos konzentriert. Sie wird am häufigsten zur Schätzung der menschlichen Körperhaltung eingesetzt, wobei zu den wichtigen Punkten beispielsweise Schultern und Knie gehören. Die Schätzung der menschlichen Körperhaltung hilft uns, für verschiedene Anwendungen wichtige Handlungen und Bewegungen zu verstehen und zu erkennen.

Abb. 5 Ein Beispiel für Posenschätzung mit YOLOv8.
Posenschätzung kann im Sport eingesetzt werden, um die Bewegungen von Athleten zu analysieren. Die NBA nutzt Posenschätzung, um die Bewegungen und Positionen von Spielern während des Spiels zu untersuchen. Durch die Verfolgung wichtiger Punkte wie Schultern, Ellbogen, Knie und Knöchel liefert die Posenschätzung detaillierte Einblicke in die Bewegungen der Spieler. Diese Erkenntnisse helfen Trainern, bessere Strategien zu entwickeln, Trainingsprogramme zu optimieren und während des Spiels Anpassungen in Echtzeit vorzunehmen. Außerdem können die Daten dabei helfen, die Ermüdung und das Verletzungsrisiko von Spielern zu überwachen und so deren Gesundheit und Leistung insgesamt zu verbessern.
Objekterkennung mit orientierten Begrenzungsrahmen#
Bei der Objekterkennung mit orientierten Begrenzungsrahmen (OBB) werden gedrehte Rechtecke verwendet, um Objekte in einem Bild präzise zu identifizieren und zu lokalisieren. Im Gegensatz zu standardmäßigen Begrenzungsrahmen, die an den Bildachsen ausgerichtet sind, werden OBBs gedreht, um der Ausrichtung des Objekts zu entsprechen. Dadurch eignen sie sich besonders für Objekte, die nicht exakt horizontal oder vertikal ausgerichtet sind. Sie können gedrehte Objekte auch in dicht besetzten Umgebungen präzise lokalisieren und isolieren und so Überlappungen vermeiden.
Abb. 6. Ein Beispiel für die Erkennung orientierter Begrenzungsrahmen in einer Luftaufnahme von Booten mit YOLOv8.
Bei der Überwachung des maritimen Bereichs ist die Identifizierung und Verfolgung von Schiffen entscheidend für Sicherheit und Ressourcenmanagement. Die OBB-Erkennung kann zur präzisen Lokalisierung von Schiffen eingesetzt werden, selbst wenn diese dicht beieinander liegen oder in unterschiedlichen Winkeln ausgerichtet sind. Sie hilft bei der Überwachung von Schifffahrtswegen, der Steuerung des Seeverkehrs und der Optimierung von Hafenabläufen. Außerdem kann sie die Katastrophenhilfe unterstützen, indem sie nach Ereignissen wie Hurrikans oder Ölunfällen Schäden an Schiffen und Infrastruktur schnell identifiziert und bewertet.
Objektverfolgung#
Bisher haben wir Computer-Vision-Aufgaben behandelt, die sich mit Bildern beschäftigen. Die Objektverfolgung ist eine Computer-Vision-Aufgabe, bei der ein Objekt über die einzelnen Frames eines Videos hinweg verfolgt werden kann. Sie beginnt damit, das Objekt mithilfe von Erkennungsalgorithmen im ersten Frame zu identifizieren, und verfolgt anschließend kontinuierlich seine Position, während es sich im Video bewegt. Zur Objektverfolgung gehören Techniken wie Objekterkennung, Merkmalsextraktion und Bewegungsprognose, damit die Verfolgung präzise bleibt.

Abb. 7. Verfolgung von Fischen mit YOLOv8.
Vision-Modelle wie YOLOv8 können eingesetzt werden, um Fische in der Meeresbiologie zu verfolgen. Mithilfe von Unterwasserkameras können Forschende die Bewegungen und das Verhalten von Fischen in ihrem natürlichen Lebensraum überwachen. Der Prozess beginnt mit der Erkennung einzelner Fische in den ersten Frames und verfolgt anschließend ihre Positionen über das gesamte Video hinweg. Die Verfolgung von Fischen hilft Wissenschaftlern, Migrationsmuster, Sozialverhalten und Wechselwirkungen mit der Umwelt zu verstehen. Außerdem unterstützt sie nachhaltige Fischereipraktiken, indem sie Erkenntnisse über die Verteilung und den Bestand von Fischen liefert.
Ein abschließender Blick auf Computer Vision#
Computer Vision verändert aktiv, wie wir Technologie nutzen und mit der Welt interagieren. Durch den Einsatz von Deep-Learning-Modellen und komplexen Algorithmen zum Verständnis von Bildern und Videos hilft Computer Vision Branchen dabei, viele Prozesse zu optimieren. Computer-Vision-Aufgaben wie Objekterkennung und Objektverfolgung ermöglichen die Entwicklung von Lösungen, die bisher nicht vorstellbar waren. Mit der kontinuierlichen Weiterentwicklung von Computer Vision hält die Zukunft noch viele innovative Anwendungen bereit!
Lass uns gemeinsam lernen und wachsen! Besuche unser GitHub-Repository, um unsere Beiträge zur KI zu sehen. Erfahre, wie wir Branchen wie selbstfahrende Autos und die Landwirtschaft mit KI neu gestalten. 🚀









