YOLO Vision 2026:
Zurück zum Ultralytics Glossar

Long Short-Term Memory (LSTM)

Erkunde Long Short-Term Memory (LSTM)-Netzwerke. Erfahre, wie LSTMs das Problem verschwindender Gradienten in RNNs für Zeitreihen, NLP und Videoanalysen lösen.

Long Short-Term Memory (LSTM) ist eine spezialisierte Art von recurrent neural network (RNN)-Architektur, die in der Lage ist, die Reihenfolgeabhängigkeit bei Sequenzvorhersageproblemen zu lernen. Im Gegensatz zu standardmäßigen Feedforward-Neuronalen Netzen verfügen LSTMs über Feedback-Verbindungen, die es ihnen ermöglichen, nicht nur einzelne Datenpunkte (wie Bilder), sondern ganze Datensequenzen (wie Sprache oder Video) zu verarbeiten. Diese Fähigkeit prädestiniert sie für Aufgaben, bei denen der Kontext früherer Eingaben für das Verständnis aktueller Daten entscheidend ist, wodurch die Einschränkungen des „Kurzzeitgedächtnisses“ herkömmlicher RNNs behoben werden.

Das Problem mit Standard-RNNs#

Um die Innovation von LSTMs zu verstehen, hilft ein Blick auf die Herausforderungen, mit denen einfache recurrent neural networks konfrontiert sind. Obwohl RNNs für die Verarbeitung sequenzieller Informationen konzipiert sind, haben sie aufgrund des Problems des vanishing gradient Schwierigkeiten mit langen Datensequenzen. Während das Netzwerk zeitlich rückwärts propagiert (Backpropagation through time), können die Gradienten – die Werte zur Aktualisierung der Netzwerkgewichte – exponentiell kleiner werden, wodurch das Netzwerk effektiv daran gehindert wird, Verbindungen zwischen weit auseinanderliegenden Ereignissen zu lernen. Dies bedeutet, dass sich ein Standard-RNN möglicherweise an ein Wort aus dem vorherigen Satz erinnert, aber den drei Absätze zuvor etablierten Kontext vergisst. LSTMs wurden ausdrücklich entwickelt, um dieses Problem zu lösen, indem sie eine komplexere interne Struktur einführen, die ein context window über viel längere Zeiträume aufrechtrechterhalten kann.

Wie LSTMs funktionieren#

Das Kernkonzept hinter einem LSTM ist der Zellzustand, der oft als Förderband beschrieben wird, das durch die gesamte Kette des Netzwerks läuft. Dieser Zustand ermöglicht es Informationen, unverändert entlang des Bandes zu fließen und langfristige Abhängigkeiten zu bewahren. Das Netzwerk trifft Entscheidungen darüber, was gespeichert, aktualisiert oder aus diesem Zellzustand verworfen werden soll, indem es Strukturen verwendet, die Gates genannt werden.

  • Forget Gate: Dieser Mechanismus entscheidet, welche Informationen nicht mehr relevant sind und aus dem Zellzustand entfernt werden sollten. Wenn ein Sprachmodell beispielsweise auf ein neues Subjekt trifft, könnte es das Geschlecht des vorherigen Subjekts „vergessen“.
  • Input Gate: Dieses Gate bestimmt, welche neuen Informationen signifikant genug sind, um im Zellzustand gespeichert zu werden.
  • Output Gate: Schließlich steuert dieses Gate, welche Teile des internen Zustands an den nächsten verborgenen Zustand ausgegeben und für die unmittelbare Vorhersage verwendet werden sollen.

Durch die Regulierung dieses Informationsflusses können LSTMs Zeitverzögerungen von mehr als 1.000 Schritten überbrücken und herkömmliche RNNs bei Aufgaben, die eine time series analysis erfordern, bei Weitem übertreffen.

Praxisanwendungen#

LSTMs haben viele der wichtigsten Durchbrüche im Bereich des deep learning im letzten Jahrzehnt angetrieben. Hier sind zwei prominente Beispiele für ihre Anwendung:

  • Sequence-to-Sequence-Modellierung in der Übersetzung: LSTMs sind fundamental für machine translation-Systeme. In dieser Architektur verarbeitet ein LSTM (der Encoder) einen Eingangssatz in einer Sprache (z. B. Englisch) und komprimiert ihn in einen Kontextvektor. Ein zweites LSTM (der Decoder) verwendet diesen Vektor dann, um die Übersetzung in einer anderen Sprache (z. B. Französisch) zu generieren. Diese Fähigkeit, Eingangs- und Ausgangssequenzen unterschiedlicher Länge zu verarbeiten, ist entscheidend für natural language processing (NLP).
  • Videoanalyse und Aktivitätserkennung: Während Convolutional Neural Networks (CNNs) wie ResNet-50 sich hervorragend zur Erkennung von Objekten in statischen Bildern eignen, fehlt ihnen ein Zeitgefühl. Durch die Kombination von CNNs mit LSTMs können KI-Systeme action recognition in Videoströmen durchführen. Das CNN extrahiert Merkmale aus jedem Frame, und das LSTM analysiert die Sequenz dieser Merkmale, um festzustellen, ob eine Person geht, läuft oder stürzt.

Integration von LSTMs in Computer Vision#

In der modernen computer vision werden LSTMs häufig zusammen mit leistungsstarken Merkmalsextraktoren verwendet. Sie könnten beispielsweise ein YOLO-Modell verwenden, um Objekte in einzelnen Frames zu erkennen, und ein LSTM, um deren Trajektorien zu verfolgen oder zukünftige Bewegungen vorherzusagen.

Hier ist ein konzeptionelles Beispiel mit torch, um ein einfaches LSTM zu definieren, das eine Sequenz von aus einem Videostrom extrahierten Merkmalsvektoren verarbeiten könnte:

import torch
import torch.nn as nn

# Define an LSTM model for processing sequential video features
# Input size: 512 (e.g., features from a CNN), Hidden size: 128
lstm_model = nn.LSTM(input_size=512, hidden_size=128, num_layers=2, batch_first=True)

# Simulate a batch of video sequences: 8 videos, 10 frames each, 512 features per frame
video_features = torch.randn(8, 10, 512)

# Pass the sequence through the LSTM
output, (hidden_state, cell_state) = lstm_model(video_features)

print(f"Output shape: {output.shape}")  # Shape: [8, 10, 128]
print("LSTM successfully processed the temporal sequence.")

Verwandte Konzepte und Unterscheidungen#

Es ist hilfreich, LSTMs von anderen Sequenzverarbeitungsarchitekturen zu unterscheiden:

  • LSTM vs. GRU: Das Gated Recurrent Unit (GRU) ist eine vereinfachte Variante des LSTM. GRUs kombinieren das Forget- und das Input-Gate zu einem einzigen „Update-Gate“ und führen den Zellzustand und den versteckten Zustand zusammen. Dies macht GRUs recheneffizienter und schneller im Training, obwohl LSTMs bei größeren, komplexeren Datensätzen möglicherweise immer noch besser abschneiden.
  • LSTM vs. Transformers: Die Transformer-Architektur, die auf self-attention-Mechanismen anstelle von Rekurrenz setzt, hat LSTMs bei NLP-Aufgaben wie denen von GPT-4 weitgehend abgelöst. Transformer können ganze Sequenzen parallel statt sequenziell verarbeiten, was ein viel schnelleres Training auf massiven Datensätzen ermöglicht. LSTMs bleiben jedoch in Szenarien mit begrenzten Daten oder spezifischen Zeitreihenbeschränkungen relevant, bei denen der Overhead von Aufmerksamkeitsmechanismen unnötig ist.

Evolution und Zukunft#

Obwohl der attention mechanism in der generative AI in den Mittelpunkt gerückt ist, bleiben LSTMs eine robuste Wahl für leichtere Anwendungen, insbesondere in edge AI-Umgebungen, in denen die Rechenressourcen begrenzt sind. Forscher erforschen weiterhin Hybridarchitekturen, die die Speichereffizienz von LSTMs mit der Repräsentationskraft moderner object detection-Systeme kombinieren.

Für diejenigen, die Datensätze für das Training von Sequenzmodellen oder komplexen Bildverarbeitungsaufgaben verwalten möchten, bietet die Ultralytics Platform umfassende Tools zur Annotation und Datenverwaltung. Darüber hinaus bietet das Verständnis der Funktionsweise von LSTMs eine solide Grundlage, um fortgeschrittenere temporale Modelle zu verstehen, die in autonomous vehicles und der Robotik verwendet werden.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens