Vision Transformer (ViT)
Entdecke die Möglichkeiten von Vision Transformern (ViT). Erfahre, wie Self-Attention und Patch-Tokenisierung Computer Vision über CNNs hinaus verändern – mit Ultralytics.
Ein Vision Transformer (ViT) ist eine Deep-Learning-Architektur, die die ursprünglich für die Verarbeitung natürlicher Sprache (NLP) entwickelten Selbstaufmerksamkeitsmechanismen anpasst, um visuelle Aufgaben zu lösen. Im Gegensatz zu einem herkömmlichen Faltungsneuronalen Netzwerk (CNN), das Bilder anhand einer Hierarchie lokaler Pixelraster verarbeitet, behandelt ein ViT ein Bild als Folge diskreter Bildausschnitte. Dieser Ansatz wurde durch die wegweisende Forschungsarbeit "An Image is Worth 16x16 Words" bekannt, die zeigte, dass reine Transformer-Architekturen bei Aufgaben der Computer Vision (CV) ohne Faltungsschichten eine Leistung auf dem Stand der Technik erreichen können. Durch die Nutzung globaler Aufmerksamkeit können ViTs bereits ab der ersten Schicht weitreichende Abhängigkeiten im gesamten Bild erfassen.
Funktionsweise von Vision Transformern#
Die grundlegende Innovation des ViT liegt in der Strukturierung der Eingabedaten. Damit ein Bild mit einem standardmäßigen Transformer kompatibel ist, zerlegt das Modell die visuellen Informationen in eine Folge von Vektoren und ahmt damit nach, wie ein Sprachmodell einen Satz aus Wörtern verarbeitet.
-
Tokenisierung in Bildausschnitten: Das Eingabebild wird in ein Raster aus Quadraten fester Größe unterteilt, typischerweise mit 16x16 Pixeln. Jedes Quadrat wird in einen Vektor umgewandelt und wird damit effektiv zu einem visuellen Token.
-
Lineare Projektion: Diese abgeflachten Bildausschnitte werden durch eine trainierbare lineare Schicht geleitet, um dichte Einbettungen zu erzeugen. Dabei werden die rohen Pixelwerte in einen hochdimensionalen Raum abgebildet, den das Modell verarbeiten kann.
-
Positionskodierung: Da die Architektur Folgen parallel verarbeitet und kein angeborenes Verständnis für Reihenfolge oder räumliche Anordnung besitzt, werden den Einbettungen der Bildausschnitte lernbare Positionskodierungen hinzugefügt. Dadurch kann das Modell räumliche Informationen darüber bewahren, wo jeder Bildausschnitt im ursprünglichen Bild hingehört.
-
Selbstaufmerksamkeitsmechanismus: Die Folge wird in den Transformer-Encoder eingespeist, wo Selbstaufmerksamkeit es jedem Bildausschnitt ermöglicht, gleichzeitig mit jedem anderen Bildausschnitt zu interagieren. Dadurch kann das Netzwerk den globalen Kontext erlernen und verstehen, wie ein Pixel in der oberen linken Ecke mit einem Pixel in der unteren rechten Ecke zusammenhängt.
-
Klassifikationskopf: Für Aufgaben wie die Bildklassifikation wird der Folge häufig ein spezieller „Klassen-Token“ vorangestellt. Der abschließende Zustandsvektor dieses Tokens dient als zusammengefasste Repräsentation des Bildes und wird anschließend einem Klassifikator wie einem mehrschichtigen Perzeptron (MLP) zugeführt.
Vision Transformer im Vergleich zu CNNs#
Obwohl beide Architekturen visuelle Daten verstehen sollen, unterscheiden sie sich deutlich in ihrer Funktionsweise. CNNs verfügen über einen starken „induktiven Bias“, der als Translationsinvarianz bezeichnet wird. Das bedeutet, dass sie von vornherein annehmen, lokale Merkmale wie Kanten und Texturen seien unabhängig von ihrer Position wichtig. Dadurch sind CNNs äußerst dateneffizient und für kleinere Datensätze geeignet.
Vision Transformer haben dagegen einen geringeren bildspezifischen Bias. Sie müssen räumliche Beziehungen anhand großer Mengen an Trainingsdaten von Grund auf erlernen, etwa anhand des JFT-300M oder vollständiger ImageNet-Datensätze. Das Training ist dadurch zwar rechenintensiver, aber ViTs lassen sich bemerkenswert gut skalieren. Bei ausreichenden Daten und Rechenleistung können sie CNNs übertreffen, indem sie komplexe globale Strukturen erfassen, die lokale Faltungen möglicherweise nicht erkennen.
Anwendungen in der Praxis#
Die Fähigkeit, den globalen Kontext zu verstehen, macht ViTs besonders nützlich für komplexe Umgebungen, in denen viel auf dem Spiel steht.
- Analyse medizinischer Bilder: Im Bereich der KI im Gesundheitswesen werden ViTs zur Analyse hochauflösender Aufnahmen wie MRTs oder histopathologischer Präparate eingesetzt. Bei der Tumorerkennung kann ein ViT beispielsweise subtile texturbezogene Auffälligkeiten im Gewebe mit umfassenderen strukturellen Veränderungen im gesamten Präparat in Beziehung setzen und so bösartige Muster erkennen, die bei einer lokalen Verarbeitung möglicherweise übersehen würden.
- Satellitenbilder und Fernerkundung: ViTs eignen sich besonders für die Analyse von Satellitenbildern, bei der sich die Beziehungen zwischen Objekten über große Entfernungen erstrecken. Um beispielsweise einen Ort der Abholzung mit einer weiter entfernten Forststraße zu verknüpfen, muss das „große Ganze“ einer Landschaft verstanden werden. Bei dieser Aufgabe übertrifft die globale Aufmerksamkeit eines ViT das begrenzte rezeptive Feld herkömmlicher CNNs.
Transformer mit Ultralytics nutzen#
Die Bibliothek ultralytics unterstützt Transformer-basierte Architekturen, insbesondere den RT-DETR (Transformer zur Echtzeitobjekterkennung). Während das Flaggschiffmodell YOLO26 aufgrund seines ausgewogenen Verhältnisses von Geschwindigkeit und Genauigkeit auf Edge-Geräten häufig bevorzugt wird, bietet RT-DETR eine leistungsstarke Alternative für Szenarien, in denen der globale Kontext im Vordergrund steht.
Das folgende Beispiel in Python zeigt, wie du ein vortrainiertes Transformer-basiertes Modell lädst und eine Inferenz ausführst:
from ultralytics import RTDETR
# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")
# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()Ausblick#
Die Forschung entwickelt sich rasant weiter, um die hohen Rechenkosten von ViTs zu reduzieren. Techniken wie FlashAttention machen diese Modelle schneller und speichereffizienter. Darüber hinaus setzen sich hybride Architekturen immer weiter durch, die die Effizienz von CNNs mit der Aufmerksamkeit von Transformern verbinden. Für Teams, die diese fortgeschrittenen Arbeitsabläufe verwalten möchten, bietet die Ultralytics Platform eine einheitliche Umgebung, um Daten zu annotieren, komplexe Modelle über die Cloud zu trainieren und auf verschiedensten Endpunkten bereitzustellen.









