YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Capsule Networks (CapsNet)

Erkunde Capsule Networks (CapsNets) und wie sie die Einschränkungen von CNNs lösen. Lerne mehr über dynamisches Routing, räumliche Hierarchien und den Vergleich von CapsNets mit YOLO26.

Capsule Networks, oft als CapsNets abgekürzt, stellen eine fortgeschrittene Architektur im Bereich des Deep Learning dar, die entwickelt wurde, um spezifische Einschränkungen herkömmlicher neuronaler Netze zu überwinden. Eingeführt von Geoffrey Hinton und seinem Team, versuchen CapsNets, die biologische neuronale Organisation des menschlichen Gehirns genauer nachzuahmen als Standardmodelle. Im Gegensatz zu einem typischen convolutional neural network (CNN), das sich hervorragend zur Merkmalserkennung eignet, aber aufgrund von Downsampling häufig räumliche Beziehungen verliert, organisiert ein Capsule Network Neuronen in Gruppen namens „Kapseln“. Diese Kapseln kodieren nicht nur die Wahrscheinlichkeit des Vorhandenseins eines Objekts, sondern auch dessen spezifische Eigenschaften wie Ausrichtung, Größe und Textur, wodurch die hierarchischen räumlichen Beziehungen innerhalb visueller Daten effektiv erhalten bleiben.

Die Einschränkung traditioneller CNNs#

Um die Innovation von CapsNets zu verstehen, ist es hilfreich zu betrachten, wie herkömmliche Computer-Vision-Modelle arbeiten. Ein konventionelles CNN verwendet Schichten zur feature extraction, gefolgt von Pooling-Schichten – insbesondere max pooling –, um die Rechenlast zu verringern und eine Transformationsinvarianz zu erreichen. Das bedeutet, dass ein CNN eine „Katze“ unabhängig davon identifizieren kann, wo sie sich im Bild befindet.

Jedoch verwirft dieser Prozess häufig präzise Standortdaten, was zum „Picasso-Problem“ führt: Ein CNN klassifiziert ein Gesicht möglicherweise korrekt, selbst wenn sich der Mund auf der Stirn befindet, einfach weil alle notwendigen Merkmale vorhanden sind. CapsNets begegnen diesem Problem, indem sie Pooling-Schichten entfernen und sie durch einen Prozess ersetzen, der die spatial hierarchies von Objekten berücksichtigt.

Wie Kapsel-Netzwerke funktionieren#

Der Kernbaustein dieser Architektur ist die Kapsel, eine verschachtelte Menge von Neuronen, die einen Vektor statt eines Skalars ausgibt. In der vector mathematics hat ein Vektor sowohl Betrag als auch Richtung. In einem CapsNet:

  • Betrag (Länge): Repräsentiert die Wahrscheinlichkeit, dass eine bestimmte Entität im aktuellen Input existiert.
  • Richtung (Ausrichtung): Kodiert die Instanziierungsparameter wie die pose estimation, den Maßstab und die Rotation des Objekts.

Kapseln in unteren Schichten (die einfache Formen wie Kanten erkennen) sagen die Ausgabe von Kapseln in höheren Schichten voraus (die komplexe Objekte wie Augen oder Reifen erkennen). Diese Kommunikation wird durch einen Algorithmus namens „Dynamic Routing“ oder „Routing by Agreement“ gesteuert. Wenn die Vorhersage einer Kapsel auf niedriger Ebene mit dem Zustand der Kapsel auf höherer Ebene übereinstimmt, wird die Verbindung zwischen ihnen gestärkt. Dies ermöglicht es dem Netzwerk, Objekte aus verschiedenen 3D-Blickwinkeln zu erkennen, ohne die massive data augmentation zu erfordern, die normalerweise nötig ist, um CNNs Rotation und Skalierung beizubringen.

Hauptunterschiede: CapsNets vs. CNNs#

Während beide Architekturen für computer vision (CV) von grundlegender Bedeutung sind, unterscheiden sie sich darin, wie sie visuelle Daten verarbeiten und repräsentieren:

  • Skalar vs. Vektor: CNN-Neuronen verwenden skalare Ausgaben, um das Vorhandensein von Merkmalen anzuzeigen. CapsNets verwenden Vektoren, um das Vorhandensein (Länge) und Pose-Parameter (Orientierung) zu kodieren.
  • Routing vs. Pooling: CNNs verwenden Pooling, um Daten downzusampeln, wobei oft Standortdetails verloren gehen. CapsNets nutzen Dynamic Routing, um räumliche Daten zu erhalten, was sie hochgradig effektiv für Aufgaben macht, die eine präzise object tracking erfordern.
  • Dateneffizienz: Da Kapseln 3D-Blickwinkel und affine transformations implizit verstehen, können sie oft aus weniger training data verallgemeinern als CNNs, die möglicherweise umfangreiche Beispiele benötigen, um jede mögliche Rotation eines Objekts zu lernen.

Praxisanwendungen#

Während CapsNets oft rechenintensiver sind als optimierte Modelle wie YOLO26, bieten sie in spezialisierten Bereichen deutliche Vorteile:

  1. Analyse medizinischer Bilder: Im Gesundheitswesen sind die genaue Ausrichtung und Form einer Anomalie von entscheidender Bedeutung. Forscher haben CapsNets auf die brain tumor segmentation angewendet, bei der das Modell einen Tumor anhand subtiler räumlicher Hierarchien vom umliegenden Gewebe unterscheiden muss, die Standard-CNNs möglicherweise glätten. Du kannst weiterführende Forschung zu Capsule Networks in Medical Imaging erkunden.

  2. Erkennung überlappender Ziffern: CapsNets erzielten auf dem MNIST dataset State-of-the-Art-Ergebnisse, insbesondere in Szenarien, in denen sich Ziffern überlappen. Da das Netzwerk die „Pose“ jeder Ziffer verfolgt, kann es zwei überlappende Zahlen (z. B. eine ‚3‘ über einer ‚5‘) als eigenständige Objekte entflechten, anstatt sie zu einer einzigen verwirrten Merkmalsskarte zu verschmelzen.

Praktischer Kontext und Implementierung#

Kapsel-Netzwerke sind primär eine Klassifizierungsarchitektur. Während sie theoretische Robustheit bieten, bevorzugen moderne Industrieanwendungen oft Hochgeschwindigkeits-CNNs oder Transformer für Echtzeitleistung. Dennoch ist das Verständnis der für CapsNets verwendeten Klassifizierungs-Benchmarks, wie z. B. MNIST, nützlich.

Das folgende Beispiel zeigt, wie man ein modernes YOLO classification model mithilfe des ultralytics-Pakets auf dem MNIST dataset trainiert. Dies entspricht der primären Benchmark-Aufgabe zur Validierung von Capsule Networks.

from ultralytics import YOLO

# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")

# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)

# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist/")

Zukunft von Kapseln und Vision AI#

Die Prinzipien hinter Capsule Networks beeinflussen weiterhin die Forschung zu AI safety und Interpretierbarkeit. Durch die explizite Modellierung von Teil-Ganzes-Beziehungen bieten Kapseln eine „Glaskasten“-Alternative zum „Black Box“-Charakter tiefer neuronaler Netze, wodurch Entscheidungen erklärbarer werden. Zukünftige Entwicklungen zielen darauf ab, die räumliche Robustheit von Kapseln mit der Inferenzgeschwindigkeit von Architekturen wie YOLO11 oder dem neueren YOLO26 zu kombinieren, um die Leistung bei der 3D object detection und in der Robotik zu verbessern. Forscher untersuchen zudem Matrix Capsules with EM Routing, um die Rechenkosten des Übereinstimmungsalgorithmus weiter zu senken.

Für Entwickler, die Datensätze verwalten und Modelle effizient trainieren möchten, bietet die Ultralytics Platform eine einheitliche Umgebung, um Daten zu annotieren, in der Cloud zu trainieren und Modelle zu deployen, die die Geschwindigkeit von CNNs mit der für komplexe Vision-Aufgaben erforderlichen Genauigkeit in Einklang bringen.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens