Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Swin Transformer

Entdecke, wie die Swin-Transformer-Architektur verschobene Fenster für effiziente Computer Vision nutzt, und erkunde Workflows auf der Ultralytics-Plattform.

Der von Forschenden bei Microsoft in der wegweisenden Arbeit aus dem Jahr 2021 „Swin Transformer: Hierarchischer Vision-Transformer mit verschobenen Fenstern“ vorgestellte Deep-Learning-Ansatz (DL) passt den Aufmerksamkeitsmechanismus an, um die Komplexität hochauflösender visueller Daten zu bewältigen. Im Gegensatz zu Modellen für die Verarbeitung natürlicher Sprache, die Text-Token einheitlicher Länge verarbeiten, berücksichtigt diese Architektur, dass sich visuelle Elemente in ihrer Größe stark unterscheiden. Durch den Aufbau einer hierarchischen Repräsentation und den Einsatz einer einzigartigen Fenstertechnik erreicht sie eine lineare Rechenkomplexität in Bezug auf die Bildgröße und ist damit ein äußerst effizienter Backbone für verschiedene Aufgaben im maschinellen Sehen (CV).

Funktionsweise verschobener Fenster und des hierarchischen Aufbaus#

Die wichtigste Innovation liegt in der Strukturierung der Merkmalsextraktion durch das Modell. Zunächst wird ein Eingabebild in kleine, nicht überlappende Bildbereiche unterteilt. Anders als bei früheren Modellen werden diese benachbarten Bildbereiche in tieferen Schichten schrittweise zu größeren Regionen zusammengeführt. Dieser hierarchische Ansatz ermöglicht es dem Netzwerk, aussagekräftige Merkmalskarten zu extrahieren, die den globalen Kontext auf verschiedenen Maßstabsebenen darstellen – von winzigen visuellen Details bis hin zu großen Objekten.

Um die Recheneffizienz aufrechtzuerhalten, wird die Selbstaufmerksamkeit nur innerhalb lokaler, voneinander isolierter Fenster berechnet und nicht über das gesamte Bild hinweg. Damit Informationen über diese Grenzen hinweg fließen können, werden die Fenster zwischen aufeinanderfolgenden Schichten „verschoben“. Dieses Verfahren mit verschobenen Fenstern verbindet voneinander unabhängige Bereiche effektiv und ermöglicht umfassende räumliche Hierarchien über mehrere Maßstabsebenen, ohne den hohen Rechenaufwand globaler Aufmerksamkeit.

Swin Transformer im Vergleich zum Transformer für Bildverarbeitung (ViT)#

Beim Vergleich moderner Architekturen ist es wichtig, dieses Modell vom standardmäßigen Transformer für Bildverarbeitung (ViT) zu unterscheiden. Der ursprüngliche ViT behandelt Bilder als Sequenz von Bildbereichen fester Größe und berechnet gleichzeitig globale Aufmerksamkeit über alle Bereiche. Obwohl dies eine hohe Genauigkeit erzielt, führt es zu einer quadratischen Rechenkomplexität, sodass die Anforderungen an Verarbeitungszeit und Speicher mit zunehmender Bildauflösung drastisch ansteigen.

Im Gegensatz dazu sorgt das hierarchische, fensterbasierte Design der Swin-Architektur für eine lineare Komplexität. Dadurch eignet sie sich wesentlich besser für Aufgaben der dichten Vorhersage, die hochauflösende Eingaben und Ausgaben erfordern. Folglich erzielt sie auf Benchmarks wie dem COCO-Test-Dev-Datensatz bei der Objekterkennung über mehrere Maßstabsebenen und dem ADE20K-Datensatz zur semantischen Segmentierung bei der präzisen Bildsegmentierung Ergebnisse auf dem Stand der Technik.

Anwendungen moderner KI in der Praxis#

Aufgrund ihrer Flexibilität und Effizienz wurde die Implementierung im offiziellen GitHub-Repository von Microsoft Research für komplexe Branchen mit hohen Anforderungen angepasst.

  • Medizinische Bildanalyse: Im klinischen Umfeld nutzen Netzwerke wie Swin-Unet diese Architektur für volumetrische 3D-MRT-Aufnahmen und die hochauflösende histopathologische Analyse. Die Fähigkeit des Modells, dichte räumliche Hierarchien zu erhalten, unterstützt die Erkennung kleinster Auffälligkeiten wie Tumoren im Frühstadium. Mehr über aktuelle Durchbrüche in der medizinischen Bildgebung erfährst du hier.
  • Satellitenbildanalyse: Bei der Umweltüberwachung und Fernerkundung ist die Erfassung großräumiger geografischer Zusammenhänge entscheidend. Die hierarchische Struktur verarbeitet umfangreiche Luftbilddatensätze effizient für die Überwachung der Abholzung, die Stadtplanung und die Beobachtung der Pflanzengesundheit.

Integration in PyTorch und Ultralytics#

Für Entwickler, die eigene neuronale Netzwerke erstellen, ist die Implementierung dieser Architektur anhand der offiziellen PyTorch-Dokumentation unkompliziert. Die torchvision-Bibliothek enthält vortrainierte Varianten, darunter die leichtgewichtige Tiny-Variante, die auf ImageNet optimiert wurde.

import torch
from torchvision.models import Swin_T_Weights, swin_t

# Load a pre-trained Tiny variant with ImageNet weights
weights = Swin_T_Weights.IMAGENET1K_V1
model = swin_t(weights=weights)
model.eval()

# Run a single batch containing a 3-channel, 224x224 dummy image tensor
dummy_image = torch.randn(1, 3, 224, 224)
output = model(dummy_image)

# The output shape is [1, 1000], representing the 1000 ImageNet classes
print(f"Prediction tensor shape: {output.shape}")

Während Transformer-basierte Backbones eine hervorragende Darstellung über mehrere Maßstabsebenen bieten, erfordern moderne Anwendungen häufig vollständig durchgängige Optimierungen für Edge-KI-Geräte. Beispielsweise bietet Ultralytics YOLO26 eine nativ durchgängige Architektur, die kleiner, schneller und sofort äußerst präzise ist und sich in Echtzeitumgebungen am Edge besonders bewährt. Unabhängig davon, ob Entwickler Transformer-lastige Architekturen oder schnelle Faltungsmodelle einsetzen, können sie ihren gesamten Workflow – von der Datenannotation bis zum Training – über die Ultralytics Platform verwalten. Diese umfassende cloudbasierte Toolchain vereinfacht die Bereitstellung von Modellen und die kontinuierliche Modellüberwachung und macht sie effizient.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren
Computer Vision in der Sicherheitstechnik

Computer Vision in der Sicherheitstechnik

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren
Computer Vision in der Sicherheitstechnik

Computer Vision in der Sicherheitstechnik

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren
Computer Vision in der Sicherheitstechnik

Computer Vision in der Sicherheitstechnik

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens