Convolutional Neural Network (CNN)
Entdecke, wie Convolutional Neural Networks (CNNs) moderne Computer Vision antreiben. Erfahre mehr über Schichten und Anwendungen sowie darüber, wie du Ultralytics YOLO26 für Echtzeit-KI ausführst.
Ein Faltungsneuronales Netzwerk (CNN) ist eine spezialisierte Deep-Learning-Architektur, die für die Verarbeitung von Daten mit einer gitterartigen Struktur entwickelt wurde, insbesondere von digitalen Bildern. Inspiriert von der biologischen Struktur des visuellen Kortex können CNNs räumliche Beziehungen innerhalb von Eingabedaten auf einzigartige Weise bewahren. Im Gegensatz zu herkömmlichen neuronalen Netzwerken, die ein Bild in eine lange Liste von Zahlen umwandeln, analysieren CNNs kleine, überlappende Bildbereiche, um automatisch Hierarchien von Merkmalen zu erlernen – von einfachen Kanten und Texturen bis hin zu komplexen Formen und Objekten. Diese Fähigkeit macht sie zur grundlegenden Technologie moderner Computer-Vision-(CV)-Systeme.
Funktionsweise von Faltungsneuronalen Netzwerken#
Die Leistungsfähigkeit eines CNN beruht auf seiner Fähigkeit, ein komplexes Bild in eine leichter zu verarbeitende Form umzuwandeln, ohne Merkmale zu verlieren, die für eine gute Vorhersage entscheidend sind. Dies wird durch eine Pipeline verschiedener Schichten erreicht, die das Eingabevolumen in eine Ausgabeklasse oder einen Ausgabewert umwandeln:
- Faltungsschicht: Sie ist der zentrale Baustein. Sie verwendet eine Reihe lernbarer Filter (oder Kernel), die wie eine Taschenlampe über das Eingabebild gleiten. An jeder Position führt der Filter eine mathematische Operation namens Faltung durch und erzeugt eine Merkmalskarte, die bestimmte Muster wie horizontale Linien oder Farbverläufe hervorhebt.
- Aktivierungsfunktion: Nach der Faltung wird eine nichtlineare Funktion auf die Ausgabe angewendet. Die häufigste Wahl ist die ReLU (Rectified Linear Unit), die negative Pixelwerte auf null setzt. Dadurch wird Nichtlinearität eingeführt, sodass das Netzwerk komplexe Muster erlernen kann, die über einfache lineare Beziehungen hinausgehen.
- Pooling-Schicht: Diese auch als Downsampling bezeichnete Schicht reduziert die Dimensionalität der Merkmalskarten. Verfahren wie Max-Pooling behalten in einem Bereich nur die wichtigsten Merkmale (die höchsten Werte) bei. Dadurch wird der Rechenaufwand reduziert und Overfitting verhindert.
- Vollständig verbundene Schicht: In der letzten Phase werden die verarbeiteten Merkmale abgeflacht und in ein standardmäßiges neuronales Netzwerk (NN) eingespeist. Diese Schicht nutzt die von den vorherigen Schichten ermittelten übergeordneten Merkmale, um eine abschließende Klassifizierung oder Vorhersage zu treffen, beispielsweise „Katze“ oder „Hund“.
Anwendungen in der Praxis#
CNNs haben Branchen verändert, indem sie visuelle Aufgaben mit übermenschlicher Genauigkeit automatisieren.
- Medizinische Diagnostik: Im Gesundheitswesen unterstützen CNNs Radiologen, indem sie Anomalien in medizinischen Aufnahmen schneller als das menschliche Auge erkennen. So analysieren Deep-Learning-Modelle beispielsweise MRI- und CT-Aufnahmen, um frühe Anzeichen von Tumoren oder Frakturen zu erkennen. Die Forschung zu AI in der Radiologie zeigt, wie diese Werkzeuge die diagnostische Konsistenz und Geschwindigkeit verbessern.
- Autonome Systeme: Selbstfahrende Autos sind stark auf CNNs angewiesen, um ihre Umgebung wahrzunehmen. Modelle wie YOLO26 verwenden effiziente CNN-Backbones, um in Echtzeit Objekte zu erkennen, darunter Fußgänger, Verkehrsschilder und andere Fahrzeuge, und so Entscheidungen innerhalb von Sekundenbruchteilen zu treffen.
CNNs im Vergleich zu Vision-Transformern (ViT)#
Während CNNs lange Zeit der Standard für Bildverarbeitungsaufgaben waren, hat sich eine neuere Architektur namens Vision-Transformer (ViT) etabliert.
- CNNs verarbeiten Bilder mithilfe lokaler Merkmale und sind bei kleineren Datensätzen aufgrund ihrer „induktiven Verzerrung“ besonders effizient (sie gehen davon aus, dass benachbarte Pixel miteinander verbunden sind). Sie eignen sich hervorragend für Szenarien, die Echtzeit-Inferenz auf Edge-Geräten erfordern.
- ViTs teilen Bilder in Bildausschnitte auf und verarbeiten diese mithilfe globaler Selbstaufmerksamkeitsmechanismen. Dadurch können sie weitreichende Abhängigkeiten innerhalb eines Bildes erfassen, benötigen für ein effektives Training jedoch typischerweise sehr große Datensätze und mehr Rechenleistung.
Implementierungsbeispiel#
Moderne Bibliotheken machen die Verwendung CNN-basierter Modelle unkompliziert. Das Paket ultralytics bietet Zugriff auf hochmoderne Modelle wie YOLO26, die über hochgradig optimierte CNN-Architekturen für schnelle Inferenz verfügen.
Das folgende Beispiel zeigt, wie du ein vortrainiertes CNN-Modell lädst und eine Vorhersage ausführst:
from ultralytics import YOLO
# Load a YOLO26 model, which uses an advanced CNN architecture
model = YOLO("yolo26n.pt")
# Run inference on an image to identify objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the prediction results
results[0].show()Werkzeuge für die Entwicklung#
Die Entwicklung von CNNs wird durch ein leistungsfähiges Ökosystem von Open-Source-Werkzeugen unterstützt. Ingenieure verwenden typischerweise Frameworks wie PyTorch oder TensorFlow, um eigene Architekturen zu erstellen. Diese Bibliotheken stellen die grundlegenden Tensoroperationen bereit, die für Faltung und Backpropagation erforderlich sind.
Für Teams, die den Lebenszyklus von Computer-Vision-Projekten – von der Datenerfassung bis zur Bereitstellung – optimieren möchten, bietet die Ultralytics Platform eine umfassende Lösung. Sie vereinfacht komplexe Arbeitsabläufe, sodass sich Entwickler auf den Einsatz von CNNs zur Lösung geschäftlicher Probleme konzentrieren können, anstatt die Infrastruktur zu verwalten. Außerdem können Modelle in Formate wie ONNX oder TensorRT exportiert werden, um eine leistungsstarke Bereitstellung auf Edge-Geräten zu ermöglichen.









