Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Transformer

Entdecke die Transformer-Architektur und den Self-Attention-Mechanismus. Erfahre, wie sie KI-Modelle wie RT-DETR und Ultralytics YOLO26 für höhere Genauigkeit antreiben.

Ein Transformer ist eine Deep-Learning-Architektur, die auf einem Mechanismus namens Self-Attention basiert, um sequenzielle Eingabedaten wie natürliche Sprache oder visuelle Merkmale zu verarbeiten. Ursprünglich von Forschern bei Google in der wegweisenden Arbeit Attention Is All You Need vorgestellt, revolutionierte der Transformer das Gebiet der künstlichen Intelligenz (AI), indem er die Einschränkungen der sequenziellen Verarbeitung früherer rekurrenter neuronaler Netze (RNNs) beseitigte. Stattdessen analysieren Transformer ganze Datensequenzen gleichzeitig, was eine massive Parallelisierung und deutlich kürzere Trainingszeiten auf moderner Hardware wie GPUs ermöglicht.

Funktionsweise von Transformern#

Die zentrale Innovation des Transformers ist der Mechanismus der Self-Attention. Dadurch kann das Modell die Bedeutung verschiedener Teile der Eingabedaten im Verhältnis zueinander gewichten. In einem Satz kann das Modell beispielsweise anhand des umgebenden Kontexts lernen, dass das Wort „bank“ stärker mit „Geld“ als mit „Fluss“ zusammenhängt.

Diese Architektur besteht im Allgemeinen aus zwei Hauptkomponenten:

  • Encoder: Verarbeitet die Eingabedaten zu einer aussagekräftigen numerischen Darstellung oder Einbettung.
  • Decoder: Verwendet die Ausgabe des Encoders, um das Endergebnis zu erzeugen, beispielsweise einen übersetzten Satz oder einen vorhergesagten Begrenzungsrahmen.

Im Bereich des maschinellen Sehens (CV) verwenden Modelle in der Regel eine Variante namens Vision Transformer (ViT). Statt Text-Token zu verarbeiten, wird das Bild in Patches fester Größe aufgeteilt (z. B. 16 x 16 Pixel). Diese Patches werden abgeflacht und als Sequenz behandelt, sodass das Modell „globalen Kontext“ – also Beziehungen zwischen weit voneinander entfernten Bildteilen – effektiver erfassen kann als ein herkömmliches faltendes neuronales Netz (CNN).

Transformer im Vergleich zu verwandten Konzepten#

Es ist wichtig, die Transformer-Architektur von verwandten Begriffen zu unterscheiden:

  • Attention-Mechanismus: Dabei handelt es sich um das allgemeine Konzept, sich auf bestimmte Teile der Daten zu konzentrieren. Der Transformer ist eine spezifische Architektur, die vollständig auf Attention-Schichten aufbaut, während andere Modelle Attention möglicherweise nur als kleine Ergänzung verwenden.
  • Großes Sprachmodell (LLM): Begriffe wie „GPT“ bezeichnen spezifische Modelle, die mit riesigen Textmengen trainiert wurden. Fast alle modernen LLMs verwenden die Transformer-Architektur als zugrunde liegende Grundlage.

Anwendungen in der Praxis#

Die Vielseitigkeit von Transformern hat zu ihrer Verbreitung in verschiedenen Branchen geführt:

  1. Medizinische Bildgebung: Im Bereich AI im Gesundheitswesen werden Transformer für komplexe Aufgaben wie die Analyse medizinischer Bilder eingesetzt. Ihre Fähigkeit, globale räumliche Beziehungen zu verstehen, hilft dabei, subtile Anomalien in hochauflösenden MRT- oder CT-Aufnahmen zu erkennen, die auf lokale Merkmale fokussierte CNNs möglicherweise übersehen.

  2. Autonome Systeme: Für autonome Fahrzeuge ist es entscheidend, die Bewegungsbahnen von Fußgängern und anderen Fahrzeugen zu verstehen. Transformer eignen sich hervorragend für das Verstehen von Videos, da sie Objekte über mehrere Einzelbilder hinweg verfolgen und zukünftige Bewegungen vorhersagen, um eine sichere Navigation zu gewährleisten.

Objekterkennung mit Transformern#

Während CNNs traditionell die Objekterkennung dominierten, haben sich Transformer-basierte Modelle wie der Echtzeit-Detektionstransformer (RT-DETR) als leistungsstarke Alternativen etabliert. RT-DETR kombiniert die Geschwindigkeit von CNN-Backbones mit der Präzision von Transformer-Decodierungsköpfen.

Reine Transformer-Modelle können jedoch rechenintensiv sein. Für viele Edge-Anwendungen bieten hochoptimierte Hybridmodelle wie YOLO26, die effiziente Attention-Mechanismen mit schneller Faltungsverarbeitung verbinden, ein besseres Gleichgewicht zwischen Geschwindigkeit und Genauigkeit. Du kannst das Training und die Bereitstellung dieser Modelle einfach über die Ultralytics Platform verwalten, die den Arbeitsablauf von der Datensatzannotation bis zum Modelleexport optimiert.

Python-Beispiel: RT-DETR verwenden#

Das folgende Beispiel zeigt, wie du mithilfe eines Transformer-basierten Modells innerhalb des Pakets ultralytics eine Inferenz durchführst. Dieser Code lädt ein vortrainiertes RT-DETR-Modell und erkennt Objekte in einem Bild.

from ultralytics import RTDETR

# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")

# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results with bounding boxes
results[0].show()

Für weiterführende Informationen zu den mathematischen Grundlagen bietet die PyTorch-Dokumentation zu Transformer-Schichten technische Details, während der Leitfaden von IBM zu Transformern eine übergeordnete geschäftliche Perspektive vermittelt.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens