Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Sequence-to-Sequence Models

Erfahre, wie Sequenz-zu-Sequenz-Modelle (Seq2Seq) Übersetzung und NLP ermöglichen. Entdecke Encoder-Decoder-Architekturen, Transformer und die Integration mit Ultralytics YOLO26.

Sequenz-zu-Sequenz-Modelle (Seq2Seq) sind eine leistungsstarke Klasse von Architekturen für maschinelles Lernen, die dafür entwickelt wurden, Sequenzen aus einem Anwendungsbereich in Sequenzen eines anderen umzuwandeln. Anders als bei herkömmlichen Aufgaben der Bildklassifizierung, bei denen die Größen von Eingabe und Ausgabe festgelegt sind, können Seq2Seq-Modelle Eingaben und Ausgaben variabler Länge besonders gut verarbeiten. Diese Flexibilität macht sie zum Rückgrat vieler moderner Anwendungen der Verarbeitung natürlicher Sprache (NLP), etwa für Übersetzungen und Zusammenfassungen, bei denen die Länge des Eingabesatzes nicht unbedingt die Länge des Ausgabesatzes vorgibt.

Kernarchitektur und Funktionalität#

Die grundlegende Struktur eines Seq2Seq-Modells basiert auf dem Encoder-Decoder-Modell. Diese Architektur teilt das Modell in zwei zentrale Komponenten auf, die zusammenarbeiten, um sequenzielle Daten zu verarbeiten.

  • Der Encoder: Diese Komponente verarbeitet die Eingabesequenz (z. B. einen englischen Satz oder eine Folge von Audio-Frames) Element für Element. Sie komprimiert die Informationen in einen Kontextvektor fester Länge, der auch als verborgener Zustand bezeichnet wird. In traditionellen Architekturen wird der Encoder häufig mit rekurrenten neuronalen Netzen (RNN) oder Langzeit-Kurzzeitgedächtnis-Netzen (LSTM) aufgebaut, die dafür ausgelegt sind, Informationen über mehrere Zeitschritte hinweg zu bewahren.
  • Der Decoder: Sobald die Eingabe codiert wurde, nimmt der Decoder den Kontextvektor auf und sagt die Ausgabesequenz (z. B. den entsprechenden französischen Satz) Schritt für Schritt voraus. Er verwendet die vorherige Vorhersage, um die nächste zu beeinflussen, und gewährleistet so grammatikalische und kontextuelle Kontinuität.

Während frühe Versionen stark auf RNNs setzten, verwenden moderne Seq2Seq-Modelle überwiegend die Architektur des Transformer. Transformer nutzen den Aufmerksamkeitsmechanismus, durch den das Modell unabhängig von ihrer Entfernung zum aktuellen Schritt gezielt auf bestimmte Teile der Eingabesequenz „achten“ kann. Dadurch wird die Leistung bei langen Sequenzen deutlich verbessert, wie im wegweisenden Paper Attention Is All You Need ausführlich beschrieben.

Anwendungen in der Praxis#

Die Vielseitigkeit von Seq2Seq-Modellen ermöglicht es, die Lücke zwischen Textanalyse und Computer Vision zu schließen und komplexe multimodale Interaktionen zu ermöglichen.

  • Maschinelle Übersetzung: Die vielleicht bekannteste Anwendung: Seq2Seq-Modelle bilden die Grundlage für Werkzeuge wie Google Translate. Das Modell nimmt einen Satz in einer Ausgangssprache auf und gibt einen Satz in einer Zielsprache aus, wobei es Unterschiede in Grammatik und Satzstruktur flüssig verarbeitet.
  • Textzusammenfassung: Diese Modelle können lange Dokumente oder Artikel verarbeiten und prägnante Zusammenfassungen erstellen. Indem der Decoder die zentrale Bedeutung des Eingabetextes erfasst, erzeugt er eine kürzere Sequenz, die die wichtigsten Informationen beibehält – eine für die automatisierte Nachrichtenaggregation unverzichtbare Technik.
  • Bildbeschreibung: Durch die Kombination von Bildverarbeitung und Sprache kann ein Seq2Seq-Modell den Inhalt eines Bildes beschreiben. Ein Faltungsneuronales Netz (CNN) fungiert als Encoder, um visuelle Merkmale zu extrahieren, während ein RNN als Decoder eine beschreibende Aussage erzeugt. Dies ist ein hervorragendes Beispiel für ein multimodales Modell.
  • Spracherkennung: In diesen Systemen ist die Eingabe eine Folge von Audio-Signal-Frames und die Ausgabe eine Folge von Textzeichen oder Wörtern. Diese Technologie bildet die Grundlage für virtuelle Assistenten wie Siri und Alexa.

Codebeispiel: Grundlegender Baustein#

Während übergeordnete Frameworks einen Großteil der Komplexität abstrahieren, ist es hilfreich, den zugrunde liegenden Mechanismus zu verstehen. Der folgende Code zeigt eine grundlegende LSTM-Schicht in PyTorch, die häufig als rekurrente Einheit innerhalb des Encoders oder Decoders eines traditionellen Seq2Seq-Modells dient.

import torch
import torch.nn as nn

# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)

# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)

# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)

print(f"Output shape: {output.shape}")  # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}")  # Shape: [1, 3, 20]

Vergleich mit verwandten Konzepten#

Um den spezifischen Nutzen von Seq2Seq-Modellen zu verstehen, ist es wichtig, sie von anderen Architekturen zu unterscheiden.

  • Im Vergleich zur Standardklassifizierung: Standardklassifizierer, wie sie etwa bei der grundlegenden Bildklassifizierung eingesetzt werden, ordnen eine einzelne Eingabe (z. B. ein Bild) einem einzelnen Klassenlabel zu. Im Gegensatz dazu ordnen Seq2Seq-Modelle Sequenzen anderen Sequenzen zu und ermöglichen dadurch Ausgaben variabler Länge.
  • Im Vergleich zur Objekterkennung: Modelle wie Ultralytics YOLO26 konzentrieren sich auf die räumliche Erkennung innerhalb eines einzelnen Frames und identifizieren Objekte sowie deren Positionen. Während YOLO Bilder strukturell verarbeitet, verarbeiten Seq2Seq-Modelle Daten zeitlich. Die Anwendungsbereiche überschneiden sich jedoch bei Aufgaben wie der Objektverfolgung, bei der die Ermittlung von Objekttrajektorien über Video-Frames eine sequenzielle Datenanalyse erfordert.
  • Im Vergleich zu Transformern: Die Transformer-Architektur ist die moderne Weiterentwicklung von Seq2Seq. Während die ursprünglichen Seq2Seq-Modelle stark auf RNNs und gesteuerten rekurrenten Einheiten (GRU) beruhten, nutzen Transformer Self-Attention, um Sequenzen parallel zu verarbeiten, und bieten dadurch deutliche Verbesserungen bei Geschwindigkeit und Genauigkeit.

Bedeutung im KI-Ökosystem#

Seq2Seq-Modelle haben grundlegend verändert, wie Maschinen mit menschlicher Sprache und zeitlichen Daten umgehen. Ihre Fähigkeit, sequenzabhängige Daten zu verarbeiten, hat die Entwicklung anspruchsvoller Chatbots, automatisierter Übersetzungssysteme und Werkzeuge zur Codegenerierung ermöglicht. Für Entwickler, die mit großen Datensätzen arbeiten, die zum Trainieren dieser Modelle erforderlich sind, kann die Nutzung der Ultralytics Platform die Workflows für Datenverwaltung und Modellbereitstellung vereinfachen. Während die Forschung im Bereich der generativen KI voranschreitet, bleiben die Prinzipien der Sequenzmodellierung zentral für die Entwicklung großer Sprachmodelle (LLMs) und fortschrittlicher Systeme zum Verstehen von Videos.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens