Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Transformer-XL

Entdecke Transformer-XL und seine Rekurrenz auf Segmentebene. Erfahre, wie diese Architektur das Problem eines festen Kontextfensters für weitreichende Abhängigkeiten in KI-Modellen löst.

Transformer-XL (XL) ist eine spezialisierte neuronale Netzwerkarchitektur, die eine zentrale Einschränkung standardmäßiger Transformer-Modelle beheben soll: die Fähigkeit, weitreichende Abhängigkeiten in sequenziellen Daten zu verarbeiten. Die von Forschern bei Google AI eingeführte Architektur ermöglicht es Sprachmodellen, weit über die Kontextfenster mit fester Länge hinauszublicken, die traditionelle Ansätze wie BERT oder den ursprünglichen Transformer beschränken. Durch die Einführung eines Mechanismus für Wiederholungen auf Segmentebene und eines neuartigen Schemas zur Positionskodierung kann Transformer-XL extrem lange Textsequenzen verarbeiten, ohne den Kontext aus den Augen zu verlieren. Dadurch ist die Architektur ein grundlegendes Konzept für moderne große Sprachmodelle (LLMs) und Anwendungen der generativen KI.

Überwindung von Kontextbeschränkungen#

Die wichtigste Motivation hinter Transformer-XL ist das „Problem des festen Kontexts“. Standard-Transformer verarbeiten Daten in Segmenten fester Größe (z. B. 512 Token). Informationen werden normalerweise nicht segmentübergreifend weitergegeben, sodass das Modell vergisst, was im vorherigen Segment passiert ist. Dadurch geht die Kohärenz in langen Dokumenten verloren.

Transformer-XL löst dieses Problem mit zwei zentralen Innovationen:

  1. Wiederholung auf Segmentebene: Im Gegensatz zu einem einfachen Transformer, der jedes Segment unabhängig verarbeitet, legt Transformer-XL die verborgenen Zustände des vorherigen Segments im Speicher ab. Bei der Verarbeitung des aktuellen Segments kann das Modell auf diese zwischengespeicherten Zustände zugreifen. Dadurch werden die Segmente effektiv miteinander verbunden, sodass sich Informationen über deutlich größere Distanzen hinweg ausbreiten können – ähnlich wie bei einem rekurrenten neuronalen Netzwerk (RNN), jedoch mit den Vorteilen der Parallelisierung durch Aufmerksamkeitsmechanismen.

  2. Relative Positionskodierung: Da der Mechanismus für Wiederholungen Zustände aus vorherigen Segmenten wiederverwendet, würden standardmäßige absolute Positionskodierungen, die jeder Position eine eindeutige ID zuweisen, für Verwirrung sorgen. Transformer-XL verwendet eine relative Kodierung, die dem Modell hilft, den Abstand zwischen Token zu verstehen (z. B. „Wort A steht 5 Schritte vor Wort B“), anstatt ihre absolute Position im Dokument zu berücksichtigen.

Diese Architektur verbessert die Perplexitätswerte bei Aufgaben der Sprachmodellierung im Vergleich zu Vorgängern wie RNNs und standardmäßigen Transformern deutlich.

Abgrenzung zu standardmäßigen Transformern#

Es ist hilfreich, Transformer-XL vom standardmäßigen Vision Transformer (ViT) oder von Transformern für Text zu unterscheiden. Während ein standardmäßiger Transformer seinen Zustand nach jedem Segment zurücksetzt und dadurch eine „Kontextfragmentierung“ verursacht, bewahrt Transformer-XL einen Speicher vergangener Aktivierungen. Dadurch kann das Modell Abhängigkeiten abbilden, die Hunderte Male länger sind als bei Modellen mit festem Kontext. Das ist besonders wichtig für Aufgaben, die ein tiefes Verständnis natürlicher Sprache (NLU) erfordern, bei denen die Antwort auf eine Frage mehrere Absätze vom Ausgangstext entfernt liegen kann.

Anwendungen in der Praxis#

Die Fähigkeit, langfristigen Kontext beizubehalten, macht Transformer-XL in mehreren wichtigen Anwendungsbereichen wertvoll:

  • Generierung umfangreicher Texte: Bei Anwendungen zur Textgenerierung, etwa beim Schreiben von Romanen oder Erstellen ausführlicher Berichte, ist es schwierig, die thematische Konsistenz zu wahren. Transformer-XL ermöglicht es der KI, sich an früh im Text eingeführte Namen von Figuren, Handlungspunkte oder technische Definitionen zu erinnern, sodass die Ausgabe durchgehend kohärent bleibt.
  • Analyse von DNA-Sequenzen: Die Architektur ist nicht auf menschliche Sprache beschränkt. In der Bioinformatik verwenden Forschende Varianten von Transformer-XL, um lange DNA-Stränge zu analysieren. Das Verständnis der Beziehungen zwischen weit voneinander entfernten Gensequenzen hilft bei der Identifizierung genetischer Marker und der Vorhersage von Proteinstrukturen – ähnlich wie KI im Gesundheitswesen bei der Analyse medizinischer Bilddaten unterstützt.
  • Chatbots und virtuelle Assistenten: Moderne Chatbots müssen sich an Präferenzen und Details erinnern, die Nutzer zu Beginn eines Gesprächs erwähnt haben. Die Mechanismen von Transformer-XL helfen dabei, das Kontextfenster zu erweitern, und verhindern so die frustrierende Erfahrung, dass ein Assistent das Thema vergisst, über das erst wenige Minuten zuvor gesprochen wurde.

Speicher und Effizienz#

Transformer-XL bietet zwar eine überlegene Leistung bei langen Sequenzen, bringt jedoch besondere Anforderungen an den Speicher mit sich. Das Zwischenspeichern verborgener Zustände erfordert zusätzlichen GPU-Speicher, was sich bei einer mangelhaften Verwaltung auf die Inferenzlatenz auswirken kann. Bei Anwendungen, für die die Genauigkeit über lange Kontexte hinweg entscheidend ist, ist dieser Kompromiss jedoch oft gerechtfertigt.

Moderne Modelle zur Objekterkennung wie YOLO26 konzentrieren sich auf Geschwindigkeit und Effizienz bei visuellen Daten. Im Gegensatz dazu legen Architekturen wie Transformer-XL den Schwerpunkt auf die Speicherung von Informationen in sequenziellen Daten. Interessanterweise entwickelt sich das Fachgebiet in Richtung multimodaler KI, bei der effiziente visuelle Backbones, etwa die von YOLO26, mit Sprachdecodern für lange Kontexte kombiniert werden könnten, um lange Videos zu analysieren und komplexe Fragen zu Ereignissen zu beantworten, die sich über einen längeren Zeitraum erstrecken.

Beispiel: Kontext während der Inferenz verwalten#

Die internen Mechanismen von Transformer-XL sind zwar komplex, doch bei der Verwendung fortschrittlicher Modelle müssen Eingaben häufig so verwaltet werden, dass die Kontextgrenzen eingehalten werden. Das folgende Python-Beispiel mit torch veranschaulicht das Übergeben von „Speicher“ (verborgenen Zuständen) an ein Modell, um den Kontext über mehrere Schritte hinweg beizubehalten und so das rekurrente Verhalten von Architekturen wie Transformer-XL zu simulieren.

import torch
import torch.nn as nn

# Define a simple RNN to demonstrate passing hidden states (memory)
# This mimics the core concept of recurrence used in Transformer-XL
rnn = nn.RNN(input_size=10, hidden_size=20, num_layers=2, batch_first=True)

# Initial input: Batch size 1, sequence length 5, feature size 10
input_seq1 = torch.randn(1, 5, 10)

# Run first segment, receiving output and the hidden state (memory)
output1, memory = rnn(input_seq1)

# Run second segment, PASSING the memory from the previous step
# This connects the two segments, allowing context to flow
input_seq2 = torch.randn(1, 5, 10)
output2, new_memory = rnn(input_seq2, memory)

print(f"Output shape with context: {output2.shape}")

Für Teams, die hochmoderne Modelle effizient trainieren und bereitstellen möchten, bietet die Ultralytics Platform Werkzeuge zur Verwaltung von Datensätzen und zur Optimierung des Modelltrainings – unabhängig davon, ob du mit visuellen Modellen arbeitest oder komplexe sequenzielle Architekturen integrierst.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens