YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Longformer

Erkunde die Longformer-Architektur, um lange Datensequenzen effizient zu verarbeiten. Erfahre, wie Sparse Attention Speicherbegrenzungen für NLP und Computer Vision überwindet.

Der Longformer ist eine spezialisierte Art von Deep Learning-Architektur, die entwickelt wurde, um lange Datensequenzen effizient zu verarbeiten und die Einschränkungen herkömmlicher Modelle zu überwinden. Ursprünglich eingeführt, um die Beschränkungen von Standard-Transformers zu bewältigen, die aufgrund von Speicherbeschränkungen typischerweise mit Sequenzen von mehr als 512 Token zu kämpfen haben, verwendet der Longformer einen modifizierten attention mechanism. Durch die Reduzierung der Rechenkomplexität von quadratisch auf linear ermöglicht diese Architektur KI-Systemen die Analyse kompletter Dokumente, langer Transkripte oder komplexer genetischer Sequenzen in einem einzigen Durchlauf, ohne die Eingabe zu kürzen.

Das Problem des Attention-Flaschenhalses#

Um die Bedeutung des Longformer zu verstehen, ist es unerlässlich, die Grenzen von Vorgängern wie BERT und den frühen GPT-3-Modellen zu betrachten. Standard-Transformer verwenden eine „Self-Attention“-Operation, bei der jedes Token (Wort oder Teil eines Wortes) jedes andere Token in der Sequenz berücksichtigt. Dies erzeugt einen quadratischen Rechenaufwand; eine Verdoppelung der Sequenzlänge vervierfacht den auf der GPU benötigten Speicher. Folglich auferlegen die meisten Standardmodelle der Eingabegröße ein strenges Limit, was Datenwissenschaftler oft dazu zwingt, Dokumente in kleinere, unverbundene Segmente zu zerlegen, was zu einem Verlust des Kontexts führt.

Der Longformer löst dies durch die Einführung von Sparse Attention. Anstatt einer vollständigen Verbindung aller Tokens untereinander nutzt er eine Kombination aus fensterbasierter lokaler Attention und globaler Attention:

  • Sliding Window Attention: Jedes Token berücksichtigt nur seine unmittelbaren Nachbarn. Dies erfasst den lokalen Kontext und die syntaktische Struktur, ähnlich wie ein Convolutional Neural Network (CNN) Bilder verarbeitet.
  • Dilated Sliding Window: Um das receptive field zu vergrößern, ohne den Rechenaufwand zu erhöhen, kann das Fenster Lücken enthalten, wodurch das Modell im Text „weiter“ blicken kann.
  • Global Attention: Bestimmte im Voraus ausgewählte Token (wie das Klassifikationstoken [CLS]) berücksichtigen alle anderen Token in der Sequenz, und alle Token berücksichtigen sie. Dies stellt sicher, dass das Modell für Aufgaben wie die text summarization ein übergeordnetes Verständnis der gesamten Eingabe behält.

Praxisanwendungen#

Die Fähigkeit, Tausende von Token gleichzeitig zu verarbeiten, eröffnet neue Möglichkeiten für Natural Language Processing (NLP) und darüber hinaus.

1. Analyse von juristischen und medizinischen Dokumenten#

In Branchen wie Recht und Gesundheitswesen sind Dokumente selten kurz. Ein juristischer Vertrag oder die Krankengeschichte eines Patienten kann Dutzende von Seiten umfassen. Herkömmliche Large Language Models (LLMs) würden erfordern, dass diese Dokumente fragmentiert werden, wodurch möglicherweise entscheidende Abhängigkeiten zwischen einer Klausel auf Seite 1 und einer Definition auf Seite 30 verloren gehen. Der Longformer ermöglicht Named Entity Recognition (NER) und Klassifizierung über das gesamte Dokument hinweg in einem Arbeitsgang, wodurch sichergestellt wird, dass der globale Kontext die Interpretation bestimmter Begriffe beeinflusst.

2. Langform-Frage-Antwort-Systeme (QA)#

Standard-Question Answering-Systeme haben oft Probleme, wenn die Antwort auf eine Frage die Synthese von Informationen erfordert, die über einen langen Artikel verteilt sind. Indem der vollständige Text im Speicher gehalten wird, können Longformer-basierte Modelle Multi-Hop-Schlussfolgerungen durchführen und Fakten verknüpfen, die in verschiedenen Absätzen zu finden sind, um eine umfassende Antwort zu generieren. Dies ist entscheidend für automatisierte technische Supportsysteme und akademische Forschungswerkzeuge.

Unterscheidung der wichtigsten Begriffe#

  • Longformer vs. Transformer: Der Standard-Transformer verwendet eine vollständige $N^2$-Attention, was ihn präzise, aber für lange Eingaben rechenintensiv macht. Der Longformer verwendet eine spärliche $N$-Attention, wobei er eine vernachlässigbare Menge an theoretischer Kapazität zugunsten massiver Effizienzgewinne opfert, was Eingaben von 4.096 Token oder mehr ermöglicht.
  • Longformer vs. Transformer-XL: Zwar verarbeiten beide lange Sequenzen, aber Transformer-XL stützt sich auf einen Rekurrenzmechanismus (Zwischenspeicherung vorheriger Zustände), um sich an vergangene Segmente zu erinnern. Der Longformer verarbeitet die lange Sequenz nativ in einem Durchgang, was das parallele Training auf Plattformen wie der Ultralytics Platform vereinfacht.
  • Longformer vs. BigBird: Dies sind sehr ähnliche Architekturen, die zur gleichen Zeit entwickelt wurden. Beide verwenden spärliche Attention-Mechanismen, um eine lineare Skalierung zu erreichen. BigBird führt zusätzlich zu Gleitfenstern eine spezifische Komponente für zufällige Attention ein.

Implementierungskonzepte#

Obwohl der Longformer eher eine Architektur als eine spezifische Funktion ist, ist es von entscheidender Bedeutung zu verstehen, wie Daten für Modelle mit langem Kontext vorbereitet werden. In modernen Frameworks wie PyTorch beinhaltet dies oft die Verwaltung von embeddings, die Standardgrenzen überschreiten.

Das folgende Beispiel demonstriert das Erstellen eines Mock-Eingabetensors für ein Szenario mit langem Kontext und stellt diesen der typischen Größe gegenüber, die in Standard-Erkennungsmodellen wie YOLO26 verwendet wird.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Relevanz für Computer Vision#

Obwohl sie ursprünglich für Text entwickelt wurden, haben die Prinzipien hinter dem Longformer das Computer Vision beeinflusst. Das Konzept, die Attention auf eine lokale Nachbarschaft zu beschränken, ist analog zu den lokalisierten Operationen bei visuellen Aufgaben. Vision Transformers (ViT) stehen bei hoch aufgelösten Bildern vor ähnlichen Skalierungsproblemen, da die Anzahl der Pixel (oder Patches) enorm sein kann. Techniken, die von der spärlichen Attention des Longformer abgeleitet sind, werden verwendet, um die Effizienz der image classification und der object detection zu verbessern, wodurch Modelle wie YOLO26 hohe Geschwindigkeiten bei der Verarbeitung detaillierter visueller Daten beibehalten können.

Für weitere Lektüre zu den architektonischen Besonderheiten bietet das original Longformer paper von AllenAI tiefgehende Benchmarks und theoretische Begründungen. Darüber hinaus profitiert das effiziente Training solch großer Modelle oft von Techniken wie mixed precision und fortgeschrittenen optimization algorithms.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens