Transformer
Entdecke die Transformer-Architektur und den Self-Attention-Mechanismus. Erfahre, wie sie KI-Modelle wie RT-DETR und Ultralytics YOLO26 für höhere Genauigkeit antreiben.
Ein Transformer ist eine Deep-Learning-Architektur, die auf einem Mechanismus namens Self-Attention basiert, um sequenzielle Eingabedaten wie natürliche Sprache oder visuelle Merkmale zu verarbeiten. Ursprünglich von Forschern bei Google in der wegweisenden Arbeit Attention Is All You Need vorgestellt, revolutionierte der Transformer das Gebiet der künstlichen Intelligenz (AI), indem er die Einschränkungen der sequenziellen Verarbeitung früherer rekurrenter neuronaler Netze (RNNs) beseitigte. Stattdessen analysieren Transformer ganze Datensequenzen gleichzeitig, was eine massive Parallelisierung und deutlich kürzere Trainingszeiten auf moderner Hardware wie GPUs ermöglicht.
Funktionsweise von Transformern#
Die zentrale Innovation des Transformers ist der Mechanismus der Self-Attention. Dadurch kann das Modell die Bedeutung verschiedener Teile der Eingabedaten im Verhältnis zueinander gewichten. In einem Satz kann das Modell beispielsweise anhand des umgebenden Kontexts lernen, dass das Wort „bank“ stärker mit „Geld“ als mit „Fluss“ zusammenhängt.
Diese Architektur besteht im Allgemeinen aus zwei Hauptkomponenten:
- Encoder: Verarbeitet die Eingabedaten zu einer aussagekräftigen numerischen Darstellung oder Einbettung.
- Decoder: Verwendet die Ausgabe des Encoders, um das Endergebnis zu erzeugen, beispielsweise einen übersetzten Satz oder einen vorhergesagten Begrenzungsrahmen.
Im Bereich des maschinellen Sehens (CV) verwenden Modelle in der Regel eine Variante namens Vision Transformer (ViT). Statt Text-Token zu verarbeiten, wird das Bild in Patches fester Größe aufgeteilt (z. B. 16 x 16 Pixel). Diese Patches werden abgeflacht und als Sequenz behandelt, sodass das Modell „globalen Kontext“ – also Beziehungen zwischen weit voneinander entfernten Bildteilen – effektiver erfassen kann als ein herkömmliches faltendes neuronales Netz (CNN).
Transformer im Vergleich zu verwandten Konzepten#
Es ist wichtig, die Transformer-Architektur von verwandten Begriffen zu unterscheiden:
- Attention-Mechanismus: Dabei handelt es sich um das allgemeine Konzept, sich auf bestimmte Teile der Daten zu konzentrieren. Der Transformer ist eine spezifische Architektur, die vollständig auf Attention-Schichten aufbaut, während andere Modelle Attention möglicherweise nur als kleine Ergänzung verwenden.
- Großes Sprachmodell (LLM): Begriffe wie „GPT“ bezeichnen spezifische Modelle, die mit riesigen Textmengen trainiert wurden. Fast alle modernen LLMs verwenden die Transformer-Architektur als zugrunde liegende Grundlage.
Anwendungen in der Praxis#
Die Vielseitigkeit von Transformern hat zu ihrer Verbreitung in verschiedenen Branchen geführt:
-
Medizinische Bildgebung: Im Bereich AI im Gesundheitswesen werden Transformer für komplexe Aufgaben wie die Analyse medizinischer Bilder eingesetzt. Ihre Fähigkeit, globale räumliche Beziehungen zu verstehen, hilft dabei, subtile Anomalien in hochauflösenden MRT- oder CT-Aufnahmen zu erkennen, die auf lokale Merkmale fokussierte CNNs möglicherweise übersehen.
-
Autonome Systeme: Für autonome Fahrzeuge ist es entscheidend, die Bewegungsbahnen von Fußgängern und anderen Fahrzeugen zu verstehen. Transformer eignen sich hervorragend für das Verstehen von Videos, da sie Objekte über mehrere Einzelbilder hinweg verfolgen und zukünftige Bewegungen vorhersagen, um eine sichere Navigation zu gewährleisten.
Objekterkennung mit Transformern#
Während CNNs traditionell die Objekterkennung dominierten, haben sich Transformer-basierte Modelle wie der Echtzeit-Detektionstransformer (RT-DETR) als leistungsstarke Alternativen etabliert. RT-DETR kombiniert die Geschwindigkeit von CNN-Backbones mit der Präzision von Transformer-Decodierungsköpfen.
Reine Transformer-Modelle können jedoch rechenintensiv sein. Für viele Edge-Anwendungen bieten hochoptimierte Hybridmodelle wie YOLO26, die effiziente Attention-Mechanismen mit schneller Faltungsverarbeitung verbinden, ein besseres Gleichgewicht zwischen Geschwindigkeit und Genauigkeit. Du kannst das Training und die Bereitstellung dieser Modelle einfach über die Ultralytics Platform verwalten, die den Arbeitsablauf von der Datensatzannotation bis zum Modelleexport optimiert.
Python-Beispiel: RT-DETR verwenden#
Das folgende Beispiel zeigt, wie du mithilfe eines Transformer-basierten Modells innerhalb des Pakets ultralytics eine Inferenz durchführst. Dieser Code lädt ein vortrainiertes RT-DETR-Modell und erkennt Objekte in einem Bild.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Für weiterführende Informationen zu den mathematischen Grundlagen bietet die PyTorch-Dokumentation zu Transformer-Schichten technische Details, während der Leitfaden von IBM zu Transformern eine übergeordnete geschäftliche Perspektive vermittelt.









