Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Vision Transformer (ViT)

Entdecke die Möglichkeiten von Vision Transformern (ViT). Erfahre, wie Self-Attention und Patch-Tokenisierung Computer Vision über CNNs hinaus verändern – mit Ultralytics.

Ein Vision Transformer (ViT) ist eine Deep-Learning-Architektur, die die ursprünglich für die Verarbeitung natürlicher Sprache (NLP) entwickelten Selbstaufmerksamkeitsmechanismen anpasst, um visuelle Aufgaben zu lösen. Im Gegensatz zu einem herkömmlichen Faltungsneuronalen Netzwerk (CNN), das Bilder anhand einer Hierarchie lokaler Pixelraster verarbeitet, behandelt ein ViT ein Bild als Folge diskreter Bildausschnitte. Dieser Ansatz wurde durch die wegweisende Forschungsarbeit "An Image is Worth 16x16 Words" bekannt, die zeigte, dass reine Transformer-Architekturen bei Aufgaben der Computer Vision (CV) ohne Faltungsschichten eine Leistung auf dem Stand der Technik erreichen können. Durch die Nutzung globaler Aufmerksamkeit können ViTs bereits ab der ersten Schicht weitreichende Abhängigkeiten im gesamten Bild erfassen.

Funktionsweise von Vision Transformern#

Die grundlegende Innovation des ViT liegt in der Strukturierung der Eingabedaten. Damit ein Bild mit einem standardmäßigen Transformer kompatibel ist, zerlegt das Modell die visuellen Informationen in eine Folge von Vektoren und ahmt damit nach, wie ein Sprachmodell einen Satz aus Wörtern verarbeitet.

  1. Tokenisierung in Bildausschnitten: Das Eingabebild wird in ein Raster aus Quadraten fester Größe unterteilt, typischerweise mit 16x16 Pixeln. Jedes Quadrat wird in einen Vektor umgewandelt und wird damit effektiv zu einem visuellen Token.

  2. Lineare Projektion: Diese abgeflachten Bildausschnitte werden durch eine trainierbare lineare Schicht geleitet, um dichte Einbettungen zu erzeugen. Dabei werden die rohen Pixelwerte in einen hochdimensionalen Raum abgebildet, den das Modell verarbeiten kann.

  3. Positionskodierung: Da die Architektur Folgen parallel verarbeitet und kein angeborenes Verständnis für Reihenfolge oder räumliche Anordnung besitzt, werden den Einbettungen der Bildausschnitte lernbare Positionskodierungen hinzugefügt. Dadurch kann das Modell räumliche Informationen darüber bewahren, wo jeder Bildausschnitt im ursprünglichen Bild hingehört.

  4. Selbstaufmerksamkeitsmechanismus: Die Folge wird in den Transformer-Encoder eingespeist, wo Selbstaufmerksamkeit es jedem Bildausschnitt ermöglicht, gleichzeitig mit jedem anderen Bildausschnitt zu interagieren. Dadurch kann das Netzwerk den globalen Kontext erlernen und verstehen, wie ein Pixel in der oberen linken Ecke mit einem Pixel in der unteren rechten Ecke zusammenhängt.

  5. Klassifikationskopf: Für Aufgaben wie die Bildklassifikation wird der Folge häufig ein spezieller „Klassen-Token“ vorangestellt. Der abschließende Zustandsvektor dieses Tokens dient als zusammengefasste Repräsentation des Bildes und wird anschließend einem Klassifikator wie einem mehrschichtigen Perzeptron (MLP) zugeführt.

Vision Transformer im Vergleich zu CNNs#

Obwohl beide Architekturen visuelle Daten verstehen sollen, unterscheiden sie sich deutlich in ihrer Funktionsweise. CNNs verfügen über einen starken „induktiven Bias“, der als Translationsinvarianz bezeichnet wird. Das bedeutet, dass sie von vornherein annehmen, lokale Merkmale wie Kanten und Texturen seien unabhängig von ihrer Position wichtig. Dadurch sind CNNs äußerst dateneffizient und für kleinere Datensätze geeignet.

Vision Transformer haben dagegen einen geringeren bildspezifischen Bias. Sie müssen räumliche Beziehungen anhand großer Mengen an Trainingsdaten von Grund auf erlernen, etwa anhand des JFT-300M oder vollständiger ImageNet-Datensätze. Das Training ist dadurch zwar rechenintensiver, aber ViTs lassen sich bemerkenswert gut skalieren. Bei ausreichenden Daten und Rechenleistung können sie CNNs übertreffen, indem sie komplexe globale Strukturen erfassen, die lokale Faltungen möglicherweise nicht erkennen.

Anwendungen in der Praxis#

Die Fähigkeit, den globalen Kontext zu verstehen, macht ViTs besonders nützlich für komplexe Umgebungen, in denen viel auf dem Spiel steht.

  • Analyse medizinischer Bilder: Im Bereich der KI im Gesundheitswesen werden ViTs zur Analyse hochauflösender Aufnahmen wie MRTs oder histopathologischer Präparate eingesetzt. Bei der Tumorerkennung kann ein ViT beispielsweise subtile texturbezogene Auffälligkeiten im Gewebe mit umfassenderen strukturellen Veränderungen im gesamten Präparat in Beziehung setzen und so bösartige Muster erkennen, die bei einer lokalen Verarbeitung möglicherweise übersehen würden.
  • Satellitenbilder und Fernerkundung: ViTs eignen sich besonders für die Analyse von Satellitenbildern, bei der sich die Beziehungen zwischen Objekten über große Entfernungen erstrecken. Um beispielsweise einen Ort der Abholzung mit einer weiter entfernten Forststraße zu verknüpfen, muss das „große Ganze“ einer Landschaft verstanden werden. Bei dieser Aufgabe übertrifft die globale Aufmerksamkeit eines ViT das begrenzte rezeptive Feld herkömmlicher CNNs.

Transformer mit Ultralytics nutzen#

Die Bibliothek ultralytics unterstützt Transformer-basierte Architekturen, insbesondere den RT-DETR (Transformer zur Echtzeitobjekterkennung). Während das Flaggschiffmodell YOLO26 aufgrund seines ausgewogenen Verhältnisses von Geschwindigkeit und Genauigkeit auf Edge-Geräten häufig bevorzugt wird, bietet RT-DETR eine leistungsstarke Alternative für Szenarien, in denen der globale Kontext im Vordergrund steht.

Das folgende Beispiel in Python zeigt, wie du ein vortrainiertes Transformer-basiertes Modell lädst und eine Inferenz ausführst:

from ultralytics import RTDETR

# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")

# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Ausblick#

Die Forschung entwickelt sich rasant weiter, um die hohen Rechenkosten von ViTs zu reduzieren. Techniken wie FlashAttention machen diese Modelle schneller und speichereffizienter. Darüber hinaus setzen sich hybride Architekturen immer weiter durch, die die Effizienz von CNNs mit der Aufmerksamkeit von Transformern verbinden. Für Teams, die diese fortgeschrittenen Arbeitsabläufe verwalten möchten, bietet die Ultralytics Platform eine einheitliche Umgebung, um Daten zu annotieren, komplexe Modelle über die Cloud zu trainieren und auf verschiedensten Endpunkten bereitzustellen.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens