Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Longformer

Entdecke die Longformer-Architektur zur effizienten Verarbeitung langer Datenfolgen. Erfahre, wie Sparse Attention Speichergrenzen für NLP und Computer Vision überwindet.

Longformer ist eine spezialisierte Architekturvariante des Deep Learning, die darauf ausgelegt ist, lange Datensequenzen effizient zu verarbeiten und die Einschränkungen herkömmlicher Modelle zu überwinden. Longformer wurde ursprünglich entwickelt, um die Beschränkungen standardmäßiger Transformer zu bewältigen, die aufgrund von Speicherbeschränkungen typischerweise Schwierigkeiten mit Sequenzen von mehr als 512 Token haben, und verwendet einen modifizierten Aufmerksamkeitsmechanismus. Durch die Reduzierung der Rechenkomplexität von quadratisch auf linear ermöglicht diese Architektur es KI-Systemen, ganze Dokumente, lange Transkripte oder komplexe genetische Sequenzen in einem einzigen Durchlauf zu analysieren, ohne die Eingabe zu kürzen.

Das Aufmerksamkeitsengpassproblem#

Um die Bedeutung von Longformer zu verstehen, ist es wichtig, die Einschränkungen seiner Vorgänger wie BERT und der frühen GPT-3-Modelle zu betrachten. Standardmäßige Transformer verwenden eine Operation namens „Selbstaufmerksamkeit“, bei der jedes Token (ein Wort oder Wortteil) jedem anderen Token in der Sequenz Beachtung schenkt. Dadurch entstehen quadratische Rechenkosten: Eine Verdopplung der Sequenzlänge vervierfacht den auf der GPU benötigten Speicher. Deshalb legen die meisten Standardmodelle eine strikte Grenze für die Eingabegröße fest und zwingen Datenwissenschaftler häufig dazu, Dokumente in kleinere, voneinander getrennte Abschnitte aufzuteilen, wodurch Kontext verloren geht.

Longformer löst dieses Problem durch die Einführung von Sparse Attention. Statt einer vollständigen Verbindung zwischen allen Token verwendet das Modell eine Kombination aus lokaler Aufmerksamkeit über Fenster und globaler Aufmerksamkeit:

  • Aufmerksamkeit über gleitende Fenster: Jedes Token berücksichtigt nur seine unmittelbaren Nachbarn. Dadurch werden lokaler Kontext und syntaktische Struktur erfasst, ähnlich wie ein Faltungsneuronales Netzwerk (CNN) Bilder verarbeitet.
  • Gleitendes Fenster mit Lücken: Um das Empfangsfeld zu vergrößern, ohne den Rechenaufwand zu erhöhen, kann das Fenster Lücken enthalten, sodass das Modell im Text weiter entfernte Stellen „sehen“ kann.
  • Globale Aufmerksamkeit: Bestimmte vorausgewählte Token (etwa das Klassifikationstoken [CLS]) berücksichtigen alle anderen Token in der Sequenz, und alle Token berücksichtigen diese. Dadurch behält das Modell ein übergeordnetes Verständnis der gesamten Eingabe für Aufgaben wie die Textzusammenfassung.

Anwendungen in der Praxis#

Die Möglichkeit, Tausende von Token gleichzeitig zu verarbeiten, eröffnet neue Anwendungsmöglichkeiten für die Verarbeitung natürlicher Sprache (NLP) und darüber hinaus.

1. Analyse juristischer und medizinischer Dokumente#

In Branchen wie dem Rechtswesen und dem Gesundheitswesen sind Dokumente selten kurz. Ein Vertrag oder die Krankengeschichte eines Patienten kann sich über Dutzende Seiten erstrecken. Herkömmliche große Sprachmodelle (LLMs) müssten diese Dokumente in Abschnitte aufteilen und könnten dabei wichtige Abhängigkeiten zwischen einer Klausel auf Seite 1 und einer Definition auf Seite 30 übersehen. Longformer ermöglicht die Erkennung benannter Entitäten (NER) und die Klassifikation über das gesamte Dokument hinweg, sodass der globale Kontext die Interpretation einzelner Begriffe beeinflusst.

2. Beantwortung von Fragen zu langen Texten (QA)#

Herkömmliche Systeme zur Fragebeantwortung haben häufig Schwierigkeiten, wenn die Antwort auf eine Frage die Zusammenführung von Informationen erfordert, die über einen langen Artikel verteilt sind. Indem sie den vollständigen Text im Speicher behalten, können Longformer-basierte Modelle über mehrere Schritte hinweg schlussfolgern und Fakten aus verschiedenen Absätzen miteinander verknüpfen, um eine umfassende Antwort zu erstellen. Dies ist für automatisierte Systeme zur technischen Unterstützung und Werkzeuge für die akademische Forschung von entscheidender Bedeutung.

Wichtige Begriffe im Vergleich#

  • Longformer im Vergleich zu Transformer: Der standardmäßige Transformer verwendet vollständige $N^2$-Aufmerksamkeit, wodurch er präzise, bei langen Eingaben jedoch rechenintensiv ist. Longformer verwendet Sparse Attention mit $N$-Aufwand und tauscht dafür einen vernachlässigbaren Teil der theoretischen Kapazität gegen erhebliche Effizienzgewinne ein, sodass Eingaben mit 4.096 Token oder mehr verarbeitet werden können.
  • Longformer im Vergleich zu Transformer-XL: Beide verarbeiten lange Sequenzen, aber Transformer-XL stützt sich auf einen Rekurrenzmechanismus (das Zwischenspeichern vorheriger Zustände), um sich an vergangene Abschnitte zu erinnern. Longformer verarbeitet die lange Sequenz nativ in einem Durchlauf, was das parallele Training auf Plattformen wie der Ultralytics Platform vereinfacht.
  • Longformer im Vergleich zu BigBird: Dies sind sehr ähnliche Architekturen, die ungefähr zur selben Zeit entwickelt wurden. Beide verwenden Sparse-Attention-Mechanismen, um eine lineare Skalierung zu erreichen. BigBird fügt zusätzlich zu gleitenden Fenstern eine spezielle Komponente für zufällige Aufmerksamkeit hinzu.

Konzepte zur Implementierung#

Longformer ist zwar eine Architektur und keine spezifische Funktion, doch für das Verständnis ist es entscheidend, wie Daten für Modelle mit langem Kontext vorbereitet werden. In modernen Frameworks wie PyTorch umfasst dies häufig die Verwaltung von Einbettungen, die standardmäßige Grenzen überschreiten.

Das folgende Beispiel zeigt, wie ein künstlicher Eingabetensor für ein Szenario mit langem Kontext erstellt wird, und stellt ihn der typischen Größe gegenüber, die in Standardmodellen zur Objekterkennung wie YOLO26 verwendet wird.

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

Bedeutung für Computer Vision#

Obwohl Longformer ursprünglich für Text entwickelt wurde, haben die dahinterstehenden Prinzipien Computer Vision beeinflusst. Das Konzept, die Aufmerksamkeit auf eine lokale Nachbarschaft zu beschränken, ist vergleichbar mit den lokalisierten Operationen bei visuellen Aufgaben. Vision Transformer (ViT) stehen bei hochauflösenden Bildern vor ähnlichen Skalierungsproblemen, da die Anzahl der Pixel (oder Bildbereiche) enorm groß sein kann. Von Longformers Sparse Attention abgeleitete Techniken werden eingesetzt, um die Effizienz bei der Bildklassifikation und Objekterkennung zu verbessern, sodass Modelle wie YOLO26 bei der Verarbeitung detaillierter visueller Daten hohe Geschwindigkeiten beibehalten.

Für weiterführende Informationen zu den architektonischen Details bietet die ursprüngliche Longformer-Publikation von AllenAI ausführliche Benchmarks und theoretische Begründungen. Darüber hinaus profitiert das effiziente Training derart großer Modelle häufig von Techniken wie Training mit gemischter Präzision und fortgeschrittenen Optimierungsalgorithmen.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens