Ultralytics YOLO27:
Zurück zum Ultralytics-Glossar

Vision Mamba

Entdecke Vision Mamba, eine Alternative zu Transformern mit linearer Komplexität. Erfahre, wie Zustandsraummodelle (SSMs) die Effizienz bei der hochauflösenden Bildverarbeitung verbessern.

Vision Mamba steht für einen bedeutenden Wandel bei Deep-Learning-Architekturen für Computer Vision und wendet sich von der Dominanz aufmerksamkeitbasierter Mechanismen in Transformern ab. Die Architektur ist eine Anpassung von Mamba, das ursprünglich für eine effiziente Sequenzmodellierung in der Verarbeitung natürlicher Sprache entwickelt wurde, und wurde gezielt für visuelle Aufgaben ausgelegt. Mithilfe von Zustandsraummodellen (SSMs) bietet Vision Mamba eine Alternative mit linearer Komplexität zu den quadratisch komplexen herkömmlichen Self-Attention-Layern. Dadurch lassen sich hochauflösende Bilder effizienter verarbeiten. Das ist besonders wertvoll bei begrenzten Rechenressourcen oder wenn weitreichende Abhängigkeiten in visuellen Daten erfasst werden müssen, ohne den für Vision Transformer (ViT) typischen hohen Speicherbedarf.

Funktionsweise von Vision Mamba#

Im Kern von Vision Mamba steht das Konzept, Daten selektiv zu durchlaufen. Herkömmliche Convolutional Neural Networks (CNNs) verarbeiten Bilder mit lokalen gleitenden Fenstern. Das eignet sich hervorragend zur Erkennung von Texturen und Kanten, erfasst aber den globalen Kontext nur schwer. Transformer hingegen nutzen globale Aufmerksamkeit, um jedes Pixel (oder Bildsegment) mit allen anderen in Beziehung zu setzen. Das liefert einen hervorragenden Kontext, wird jedoch mit steigender Bildauflösung rechenintensiv. Vision Mamba schließt diese Lücke, indem es Bilder in Sequenzen umwandelt und mithilfe selektiver Zustandsräume verarbeitet. So kann das Modell visuelle Informationen in einem Zustand fester Größe zusammenfassen, relevante Details über große Distanzen in der Bildsequenz hinweg bewahren und unwichtiges Rauschen verwerfen.

Die Architektur umfasst üblicherweise einen bidirektionalen Scan-Mechanismus. Da Bilder zweidimensionale Strukturen und nicht wie Text von Natur aus sequenziell sind, durchläuft Vision Mamba die Bildsegmente sowohl vorwärts als auch rückwärts (manchmal auch entlang verschiedener Pfade). Dadurch werden räumliche Beziehungen unabhängig von der Scan-Reihenfolge erfasst. Mit diesem Ansatz erreicht das Modell globale Empfangsfelder, die denen von Transformern ähneln, benötigt jedoch weniger Inferenzzeit und Speicher und erzielt bei Benchmarks wie ImageNet häufig vergleichbare Ergebnisse auf dem neuesten Stand der Technik.

Anwendungen in der Praxis#

Dank seiner Effizienz eignet sich Vision Mamba besonders für Umgebungen mit begrenzten Ressourcen und Aufgaben mit hoher Auflösung.

  • Medizinische Bildanalyse: In Fachgebieten wie der Radiologie erfordert die Analyse hochauflösender MRT- oder CT-Aufnahmen, dass unauffällige Anomalien erkannt werden, die innerhalb eines großen Bildes weit voneinander entfernt liegen können. Vision Mamba kann diese Dateien zur medizinischen Bildanalyse effizient verarbeiten, ohne an den Speicherengpässen zu scheitern, die herkömmliche Transformer oft beeinträchtigen. So unterstützt Vision Mamba Ärzte dabei, Tumore oder Knochenbrüche präzise zu erkennen.
  • Autonome Navigation auf Edge-Geräten: Selbstfahrende Autos und Drohnen sind auf Edge Computing angewiesen, um Videodaten in Echtzeit zu verarbeiten. Dank der linearen Skalierung kann Vision Mamba Eingaben mit hoher Bildrate für die Objekterkennung und semantische Segmentierung effizienter verarbeiten als umfangreiche Transformer-Modelle. So können sicherheitskritische Entscheidungen schneller getroffen werden.

Vision Mamba vs. Vision Transformer (ViT)#

Beide Architekturen zielen darauf ab, den globalen Kontext zu erfassen, unterscheiden sich jedoch grundlegend in ihrer Funktionsweise.

  • Vision Transformer (ViT): Verwendet den Aufmerksamkeitsmechanismus, der die Beziehung zwischen jedem Paar von Bildsegmenten berechnet. Das führt zu quadratischer Komplexität ($O(N^2)$): Eine Verdopplung der Bildgröße vervierfacht den Rechenaufwand.
  • Vision Mamba: Verwendet Zustandsraummodelle (SSMs), um visuelle Tokens mit linearer Komplexität ($O(N)$) zu verarbeiten. Das Modell führt einen fortlaufenden Zustand, der beim Erkennen neuer Bildsegmente aktualisiert wird. Dadurch lässt sich die Auflösung deutlich besser skalieren, während eine vergleichbare Genauigkeit erhalten bleibt.

Beispiel: Effizienter Inferenzablauf#

Vision Mamba ist zwar eine spezielle Architektur, doch ihre Effizienzprinzipien entsprechen den Zielen moderner Echtzeitmodelle wie Ultralytics YOLO26. Wer optimierte Bildverarbeitungsaufgaben umsetzen möchte, kann dafür die Ultralytics Platform zum Training und zur Bereitstellung nutzen. Im folgenden Beispiel wird das Paket ultralytics für die Inferenz verwendet. Es zeigt, wie einfach sich hochgradig optimierte Bildverarbeitungsmodelle einsetzen lassen.

from ultralytics import YOLO

# Ein vortrainiertes YOLO26-Modell laden (auf Geschwindigkeit und Genauigkeit optimiert)
model = YOLO("yolo26n.pt")  # 'n' für nano, mit Schwerpunkt auf Effizienz

# Inferenz auf einem Bild ausführen
results = model.predict("path/to/image.jpg")

# Ergebnisse anzeigen
results[0].show()

Zentrale Vorteile und Ausblick#

Die Einführung Mamba-basierter Architekturen in der Computer Vision deutet auf einen Wandel hin zu stärker hardwarebewusster KI. Indem der Rechenaufwand für globale Aufmerksamkeit sinkt, eröffnen Forschende neue Möglichkeiten, fortgeschrittene KI-Agenten auf kleineren Geräten einzusetzen.

Neuere Forschung, darunter das VMamba-Paper und Entwicklungen im Bereich des effizienten Deep Learning, zeigt das Potenzial dieser Modelle, herkömmliche Backbones in Aufgaben von Videoverständnis bis hin zur 3D-Objekterkennung zu ersetzen. Während die Community Scan-Strategien und die Integration mit Faltungsschichten weiter verbessert, dürfte Vision Mamba neben CNNs und Transformern zu einem festen Bestandteil des Deep Learning-Werkzeugkastens werden.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Wandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeit-Erkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse um.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Setze Vision AI für die Überwachung aus der Luft mit Ultralytics YOLO-Modellen ein. Nutze Computer-Vision-Lösungen für Drohnen, Abläufe in der Luft- und Raumfahrt, Umweltschutz und Geodatenbranchen.
Mehr erfahren
Computer Vision im Sicherheitsbereich

Computer Vision im Sicherheitsbereich

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision-KI ermöglicht die Überwachung von Grundstücksgrenzen, die Erkennung von Bedrohungen, die Kennzeichenerkennung und die Sicherheit am Arbeitsplatz.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mach Maschinen mit Ultralytics YOLO-Modellen leistungsfähiger. Vision-KI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Bildverarbeitung in der Logistik

Bildverarbeitung in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketprüfung, Sortierung und Fahrzeugverfolgung sowie die Sicherheitsüberwachung von Lagerhäusern in Echtzeit.
Mehr erfahren
Bildverarbeitung im Einzelhandel

Bildverarbeitung im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung und Warteschlangenmanagement und liefert bessere Einblicke in das Kundenverhalten.
Mehr erfahren
Bildverarbeitung im Gesundheitswesen

Bildverarbeitung im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI ermöglicht im Gesundheitswesen schnellere medizinische Bildgebung, bessere Diagnostik und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics-YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Überprüfung der Einhaltung von Vorgaben zu persönlicher Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilbranche

Computer Vision in der Automobilbranche

Setze Computer Vision in der Automobilbranche mit Ultralytics-YOLO-Modellen ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung – für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Setze mit Ultralytics YOLO-Modellen KI für Bildverarbeitung in der intelligenten Landwirtschaft ein. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und nachhaltigere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Starte deine Reise in die Zukunft des maschinellen Lernens