Computer Vision (CV)
Entdecke, wie Computer Vision Maschinen die Interpretation von Bildern und Videos ermöglicht. Erfahre mehr über Kernaufgaben und Branchenanwendungen und wie du mit Ultralytics YOLO startest.
Computer Vision (CV) ist ein Bereich der künstlichen Intelligenz (AI), der es Computern und Systemen ermöglicht, aus digitalen Bildern, Videos und anderen visuellen Eingaben aussagekräftige Informationen abzuleiten. Wenn AI Maschinen das Denken ermöglicht, lässt Computer Vision sie sehen, beobachten und verstehen. Im Gegensatz zu regelbasierten Bildverarbeitungswerkzeugen lernen moderne Systeme direkt aus Daten: Ihnen wird nicht ausdrücklich gesagt, wie ein Auto oder ein Tumor aussieht. Stattdessen erkennen sie zugrunde liegende Muster in Tausenden beschrifteten Beispielen und verallgemeinern dieses Wissen auf Bilder, die sie noch nie zuvor gesehen haben. Durch den Einsatz von maschinellem Lernen (ML) und Deep Learning (DL) verwandelt Computer Vision unstrukturierte visuelle Daten in Entscheidungen, die Software umsetzen kann.
So funktioniert Computer Vision#
Ein Computer sieht ein Bild als Anordnung numerischer Werte, die Pixel darstellen. Die Umwandlung dieser Anordnung in eine Aktion erfolgt über eine Pipeline mit fünf Stufen.

Bilderfassung. Der Ablauf beginnt mit Hardware – CMOS-Sensoren, Infrarotkameras oder LiDAR-Scanner – die Licht erfassen und in ein digitales Pixelraster umwandeln. Vor Beginn der Analyse berücksichtigt die Kamerakalibrierung die Geometrie des Objektivs.
Vorverarbeitung. Die erfassten Daten werden normalisiert, damit das Modell konsistente Eingaben erhält: Sie werden in der Größe angepasst, entrauscht und kontrastoptimiert.
Merkmalsextraktion. Das System erkennt Merkmale niedriger Ebene wie Kanten, Gradienten und Ecken. Je tiefer sich die Daten durch das Netzwerk bewegen, desto mehr verbinden sich diese Grundelemente zu Merkmalen höherer Ebene – Texturen, Muster und komplexe Geometrien. Ein System könnte vertikale Linien erkennen, sie als Zaunpfosten identifizieren und die Szene anschließend als Begrenzung eines Geländes verstehen. Dieser Prozess wird als Merkmalsextraktion bezeichnet.
Modellausführung. Das Herzstück moderner Computer Vision ist das Faltungsneuronale Netz (CNN). Im Gegensatz zu einem herkömmlichen neuronalen Netz, das ein Bild als flache Zahlenliste behandelt, bewahren CNNs die räumlichen Beziehungen zwischen Pixeln. Dazu verwenden sie Filter, die über das Bild gleiten und Muster unabhängig von ihrer Position im Bildausschnitt erkennen. In jüngerer Zeit haben sich Vision Transformer (ViTs) als leistungsfähige Alternative etabliert. Sie wenden den Aufmerksamkeitsmechanismus aus der Verarbeitung natürlicher Sprache auf Bilddaten an.
Ausgabe und Aktion. Das Modell gibt ein strukturiertes Ergebnis zurück – ein Label, eine Reihe von Begrenzungsrahmen oder eine Pixelmaske –, auf das das umgebende System reagiert: Es weist ein fehlerhaftes Bauteil zurück, bremst ein Fahrzeug oder löst einen Alarm aus.
Wie ein Modell lernt#
Ein Modell ist nur so gut wie die Daten, die es verarbeitet. Überwachtes Lernen erfordert große Mengen an Trainingsdaten, und Benchmarks wie ImageNet und COCO liefern Millionen annotierter Beispiele. Während des Trainings erstellt das Modell eine Vorhersage, vergleicht sie mit dem Ground-Truth-Label und passt seine internen Gewichte an, um den Fehler zu reduzieren. Nach dem Training führt dasselbe Modell den oben beschriebenen Inferenzschritt aus.
Der Wandel von regelbasierten Systemen zu Deep Learning#

Frühe Computer-Vision-Systeme beruhten auf manueller Merkmalsentwicklung: Ingenieure definierten starre geometrische Parameter, damit Maschinen Objekte erkennen konnten. Diese Systeme waren störanfällig und versagten, sobald sich die Beleuchtung änderte oder ein Objekt aus einem ungewohnten Winkel erschien. Die Veröffentlichung von AlexNet im Jahr 2012, das mit mehr als einer Million beschrifteter ImageNet-Bilder trainiert wurde, markierte den Wendepunkt. Sie zeigte, dass Faltungsnetze Ansätze mit von Hand entwickelten Merkmalen in großem Maßstab übertreffen konnten. Deep Learning ersetzte von Hand abgestimmte Regeln durch Architekturen, die ihre Merkmale selbst lernen – flexibel genug, um unter realen Bedingungen zuverlässig zu funktionieren, die nie vollständig kontrolliert werden können.
Computer Vision im Vergleich zu Bildverarbeitung und industrieller Bildverarbeitung#
Es ist wichtig, Computer Vision von den angrenzenden Bereichen zu unterscheiden, mit denen sie häufig verwechselt wird.
- Bildverarbeitung verändert ein Bild, um es zu verbessern oder Informationen daraus zu extrahieren – etwa durch Anpassung von Helligkeit und Kontrast oder durch Anwendung von Filtern. Ihre Ausgabe ist normalerweise ein weiteres Bild. Computer Vision verwendet ein Bild als Eingabe und gibt eine Interpretation aus („In diesem Raum befinden sich drei Personen“). Computer Vision nutzt Bildverarbeitung regelmäßig als Vorbereitungsschritt.
- Industrielle Bildverarbeitung bezeichnet industrielle Prüfsysteme, die in streng kontrollierten Umgebungen mit fester Beleuchtung und bekannten Positionen der Bauteile arbeiten. Computer Vision ist das umfassendere Fachgebiet und wurde für unvorhersehbare, unkontrollierte Bedingungen entwickelt.
- Verarbeitung natürlicher Sprache befasst sich mit Text und Sprache. Computer Vision konzentriert sich vollständig auf visuelle Daten, auch wenn Vision-Language-Modelle zunehmend eine Verbindung zwischen beiden Bereichen herstellen.
Zentrale Aufgaben von Computer Vision#
Computer Vision ist keine einzelne Funktion, sondern eine Gruppe verschiedener Aufgaben, die jeweils ein anderes Problem lösen. Eine ausführliche Erklärung findest du im vollständigen Leitfaden zu Computer-Vision-Aufgaben.
- Bildklassifizierung: weist einem gesamten Bild ein einzelnes Label zu und beantwortet die Frage „Was ist auf diesem Bild zu sehen?“ – beispielsweise indem Produkte als fehlerhaft oder fehlerfrei sortiert werden. Eng damit verwandt ist die Bilderkennung, die identifiziert, was vorhanden ist.
- Objekterkennung: identifiziert einzelne Objekte und zeichnet um jedes einen Begrenzungsrahmen. Dadurch können Systeme mehrere Objekte in einem einzigen Bildausschnitt zählen und lokalisieren.
- Instanzsegmentierung: erzeugt für jedes erkannte Objekt eine Maske auf Pixelebene und trennt einzelne Instanzen derselben Klasse voneinander. Die semantische Segmentierung weist dagegen jedem Pixel eine Klasse zu, ohne zwischen einzelnen Instanzen zu unterscheiden.
- Posenschätzung: erkennt Schlüsselpunkte an einem Objekt, etwa Gelenke des menschlichen Körpers, um Bewegung und Körperhaltung zu verfolgen.
- Gedrehte Begrenzungsrahmen: passen gedrehte Rahmen an Objekte an, die nicht achsenparallel ausgerichtet sind – unverzichtbar für Luft- und Satellitenbilder.
- Objektverfolgung: verfolgt ein Objekt in einem Videostream und behält zwischen den Bildern eine konsistente ID bei. Optischer Fluss erweitert dies, indem die scheinbare Bewegung zwischen aufeinanderfolgenden Bildern analysiert wird.
- Optische Zeichenerkennung (OCR): wandelt Bilder von gedrucktem oder handgeschriebenem Text in maschinenlesbare Daten um und automatisiert so die Dokumentenverarbeitung in großem Maßstab.
Die richtige Aufgabe auswählen#
Wenn du die technische Aufgabe von Anfang an am Geschäftsziel ausrichtest, vermeidest du kostspielige Nacharbeiten.
| Geschäftsziel | Geeignete Aufgabe |
|---|---|
| Produkte in Kategorien sortieren | Bildklassifizierung |
| Elemente zählen oder ihre Position bestimmen | Objekterkennung |
| Die genaue Form oder Begrenzung eines Objekts analysieren | Instanzsegmentierung |
| Bewegungen über mehrere Videobilder hinweg verfolgen | Objektverfolgung |
| Körperposition oder Gelenkwinkel messen | Posenschätzung |
| Gedrehte Objekte in Luftbildern erkennen | Gedrehte Begrenzungsrahmen |
| Text aus Dokumenten oder Beschriftungen lesen | Optische Zeichenerkennung |
Anwendungen in der Praxis#
Computer Vision bildet inzwischen die Grundlage für Produktionssysteme in den meisten wichtigen Branchen.

- Fertigung und Qualitätskontrolle. Moderne Produktionslinien arbeiten schneller, als Menschen visuell prüfen können. Bildverarbeitungssysteme führen eine sofortige Qualitätsprüfung durch und erkennen mikroskopisch kleine Risse oder falsch ausgerichtete Bauteile mit der Geschwindigkeit der Produktionslinie, ohne die Ermüdung, die sich bei menschlichen Prüfern ansammelt. Die Überwachung von Verschleißmustern an Maschinen ermöglicht außerdem eine vorausschauende Wartung, da Anzeichen für einen Ausfall erkannt werden, bevor ein Defekt ungeplante Stillstandszeiten verursacht. Siehe Computer Vision in der Fertigung und Fehlererkennung.
- Gesundheitswesen und Diagnostik. Algorithmen zur medizinischen Bildanalyse verarbeiten Röntgenbilder, MRTs und CT-Aufnahmen, um Tumore im Frühstadium, Mikrorisse und Anomalien der Netzhaut zu erkennen, die unter Zeitdruck leicht übersehen werden. Im Operationssaal liefern Bildverarbeitungssysteme während minimalinvasiver Eingriffe eine räumliche Darstellung in Echtzeit. Siehe Computer Vision im Gesundheitswesen.
- Einzelhandel. Geschäfte ohne Kassen nutzen die Zusammenführung von Sensordaten und Bildverarbeitungsalgorithmen, um zu verfolgen, welche Artikel aus den Regalen genommen werden, und Kunden automatisch abzurechnen. Dieselben Systeme überwachen den Füllstand der Regale in Echtzeit und lösen Nachbestellwarnungen aus. Dadurch unterstützen sie die Bestandsverwaltung und die Vermeidung von Verlusten im Einzelhandel. Siehe Computer Vision im Einzelhandel.
- Autonomer Verkehr. Die Wahrnehmungsebene ist die sicherheitskritischste Komponente eines selbstfahrenden Autos. Bildverarbeitungssysteme erkennen Fahrbahnmarkierungen, Verkehrsschilder, Fußgänger und andere Fahrzeuge in Echtzeit. Sie kombinieren Kamerabilder mit Radar und LiDAR, um mithilfe der 3D-Objekterkennung ein 360-Grad-Modell der Fahrzeugumgebung zu erstellen. Siehe autonome Fahrzeuge.
- Sicherheit und Überwachung. Die Sicherheitsinfrastruktur hat sich von der passiven Aufzeichnung hin zu proaktiven Maßnahmen entwickelt: Sie erkennt das Verweilen in Sperrzonen, markiert ungewöhnliche Verhaltensmuster bereits während ihres Auftretens und unterstützt das Warteschlangenmanagement in öffentlichen Bereichen. Anomalieerkennung ist die zugrunde liegende Fähigkeit.
- Landwirtschaft. Drohnen und Traktoren beurteilen den Gesundheitszustand von Nutzpflanzen auf Ebene einzelner Pflanzen und analysieren multispektrale Bilder auf Anzeichen von Dehydrierung, Schädlingsbefall oder Nährstoffmangel. Wasser, Pestizide und Dünger werden anschließend nur dort eingesetzt, wo sie benötigt werden, statt auf ganzen Feldern. Siehe Computer Vision in der Landwirtschaft.
Computer Vision am Edge#
Die visuelle Analyse in Echtzeit findet zunehmend am Edge statt – direkt auf der Kamera oder einem lokalen Gateway –, anstatt Videos an einen zentralen Cloud-Server weiterzuleiten. Das ist aus zwei Gründen wichtig.
Die Latenz sinkt auf nahezu null. Das ist für autonome Robotik oder die Prüfung von Produktionslinien unverzichtbar, da eine Verzögerung von wenigen Millisekunden bereits Fehler verursacht. Da außerdem nur Metadaten und nicht das Rohvideo über das Netzwerk übertragen werden, sinkt der Bandbreitenbedarf deutlich und der Datenschutz verbessert sich, weil sensible Aufnahmen das lokale Gerät nie verlassen. Edge AI und Inferenz in Echtzeit machen dies praktikabel. Optionen für die Modellbereitstellung wie ONNX und TensorRT ermöglichen es, ein einziges trainiertes Modell auf unterschiedlicher Hardware auszuführen.
Herausforderungen und Einschränkungen#
Datenqualität. Ein Modell spiegelt die Qualität seiner Trainingsdaten wider. Datensätze mit niedriger Auflösung, fehlerhaften Labels oder mangelnder Repräsentativität führen zu unzuverlässigen Modellen. Der Aufbau eines vielfältigen annotierten Datensatzes ist häufig arbeitsintensiver als die Entwicklung des Algorithmus. Siehe Datenbeschriftung.
Umgebungsbedingungen. Starker Regen, Lens Flare, teilweise Verdeckung und eine variable Objektgröße beeinträchtigen die Leistung. Robuste Systeme nutzen während des Trainings Datenerweiterung, um diese Bedingungen zu simulieren und vor der Bereitstellung Widerstandsfähigkeit aufzubauen. Außerdem ist eine sorgfältige Validierung erforderlich, um Overfitting zu vermeiden.
Ethische Aspekte und Verzerrungen. Ein Modell, das mit einem Datensatz ohne demografische Vielfalt trainiert wurde, erzielt in verschiedenen Bevölkerungsgruppen unterschiedlich gute Ergebnisse. Organisationen, die Systeme zur Analyse von Personen einsetzen – etwa in der medizinischen Bildgebung, bei der Sicherheit am Arbeitsplatz oder in öffentlichen Bereichen –, müssen ihre Datensätze auf Fairness prüfen und neue gesetzliche Vorgaben zur automatisierten Entscheidungsfindung einhalten.
Die Zukunft von Computer Vision#
Vision Transformer verändern, was bei Aufgaben möglich ist, die ein Verständnis der Beziehungen zwischen weit voneinander entfernten Bildbereichen erfordern. Darüber hinaus verbindet multimodales Lernen visuelle Daten mit Text, Audio und Tiefeninformationen, um Systeme mit einem umfassenderen Kontextverständnis zu entwickeln. Vision-Language-Modelle, die Fragen zu Bildern beantworten, sind ein frühes Beispiel dafür.
Generative AI geht den Mangel an Daten direkt an. Synthetische Daten ermöglichen die Erstellung hyperrealistischer Bilder seltener Szenarien – etwa bestimmter Fehlerbilder oder ungewöhnlicher Krankheitsausprägungen –, die in der realen Welt nicht in ausreichender Menge erfasst werden können. Gleichzeitig führen Kameras mit Tiefensensoren und LiDAR Systeme über die flache Bildanalyse hinaus in Richtung Spatial Computing. Dabei werden digitale Informationen für Anwendungen wie wartungsunterstützte Augmented Reality und die Vermessung von Bauwerken in die physische Welt eingeblendet.
Computer Vision mit Ultralytics implementieren#
Für Teams, die ein Computer-Vision-Projekt erproben, ist Ultralytics YOLO26 ein praktischer Ausgangspunkt für die Objekterkennung in Echtzeit: Die Lösung ist quelloffen, umfassend dokumentiert und schnell genug für den Einsatz am Edge. Genauigkeits- und Latenzwerte für verschiedene Hardware werden auf der Benchmark-Seite veröffentlicht. Die Dokumentation enthält außerdem Modellvergleiche nebeneinander. Das weitere Ökosystem umfasst OpenCV für klassische Bildverarbeitung und PyTorch als primäres Framework für das Training.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Dieses Skript verwendet ein vortrainiertes Modell, um mit wenigen Zeilen eine Inferenz durchzuführen. Teams, die von einem Pilotprojekt in die Produktion wechseln, können die Ultralytics Platform nutzen, um Datensätze zu annotieren, Modelle in der Cloud zu trainieren und Bereitstellungen zu verwalten. Alternativ können sie Transfer Learning einsetzen, um ein vortrainiertes Modell mit deutlich weniger beschrifteten Daten als beim Training von Grund auf an einen benutzerdefinierten Datensatz anzupassen.
Häufig gestellte Fragen
Maschinelles Lernen ist das umfassendere Fachgebiet zur Entwicklung von Systemen, die aus Daten lernen. Computer Vision ist die Anwendung dieses Fachgebiets – in der Regel mithilfe von Deep Learning – auf visuelle Eingaben wie Bilder und Videos. Fast alle modernen Computer-Vision-Systeme basieren auf maschinellem Lernen, maschinelles Lernen umfasst jedoch auch Text, Audio- und Tabellendaten.
Nein. Bilderkennung ist eine Aufgabe innerhalb von Computer Vision: Sie identifiziert, was auf einem Bild zu sehen ist. Computer Vision umfasst außerdem Objekterkennung, Segmentierung, Posenschätzung, Objektverfolgung und Szenenverständnis.
Das hängt von der Komplexität der Aufgabe und dem Umfang der Variationen ab, die das Modell verarbeiten muss. Transfer Learning mit einem vortrainierten Modell wie Ultralytics YOLO26 reduziert den Bedarf erheblich. Nützliche benutzerdefinierte Detektoren werden häufig mit einigen Hundert bis einigen Tausend beschrifteten Bildern pro Klasse trainiert und nicht mit den Millionen von Bildern, die zum Training von Basismodellen verwendet werden.
Ja. Modelle können direkt auf Edge-Geräten bereitgestellt und vollständig offline ausgeführt werden. Das ist üblich, wenn Latenz, Bandbreite oder Datenschutzbestimmungen dagegen sprechen, Videos an die Cloud zu senden.
Python dominiert aufgrund des ausgereiften Ökosystems aus dem Paket
ultralytics, PyTorch und OpenCV. C++ wird eingesetzt, wenn maximale Inferenzleistung erforderlich ist, typischerweise in eingebetteten Systemen und in der Automobiltechnik.









