Sequence-to-Sequence Models
Découvre comment les modèles Sequence-to-Sequence (Seq2Seq) alimentent la traduction et le NLP. Explore les architectures encodeur-décodeur, les Transformers et l’intégration avec Ultralytics YOLO26.
Les modèles séquence-à-séquence (Seq2Seq) constituent une catégorie puissante d’architectures de machine learning conçues pour convertir des séquences d’un domaine en séquences d’un autre. Contrairement aux tâches standard de classification d’images, où les tailles des entrées et des sorties sont fixes, les modèles Seq2Seq excellent dans le traitement d’entrées et de sorties de longueurs variables. Cette flexibilité en fait la base de nombreuses applications modernes de traitement automatique du langage naturel (NLP), comme la traduction et le résumé, où la longueur de la phrase d’entrée ne détermine pas nécessairement celle de la phrase de sortie.
Architecture fondamentale et fonctionnalités#
La structure fondamentale d’un modèle Seq2Seq repose sur le framework encodeur-décodeur. Cette architecture sépare le modèle en deux composants principaux qui fonctionnent de concert pour traiter les données séquentielles.
- L’encodeur : ce composant traite la séquence d’entrée (par exemple, une phrase en anglais ou une séquence de trames audio) élément par élément. Il compresse les informations dans un vecteur de contexte de longueur fixe, également appelé état caché. Dans les architectures traditionnelles, l’encodeur est souvent construit à l’aide de réseaux de neurones récurrents (RNN) ou de réseaux de mémoire à long court terme (LSTM), conçus pour conserver les informations au fil des pas temporels.
- Le décodeur : une fois l’entrée encodée, le décodeur utilise le vecteur de contexte et prédit la séquence de sortie (par exemple, la phrase correspondante en français) étape par étape. Il utilise la prédiction précédente pour influencer la suivante, afin d’assurer la continuité grammaticale et contextuelle.
Alors que les premières versions reposaient largement sur les RNN, les modèles Seq2Seq modernes utilisent principalement l’architecture Transformer. Les Transformers utilisent le mécanisme d’attention, qui permet au modèle de « porter son attention » sur des parties spécifiques de la séquence d’entrée, quelle que soit leur distance par rapport à l’étape actuelle, améliorant ainsi considérablement les performances sur les séquences longues, comme l’explique l’article fondateur Attention Is All You Need.
Applications concrètes#
La polyvalence des modèles Seq2Seq leur permet de combler le fossé entre l’analyse de texte et la vision par ordinateur, en permettant des interactions multimodales complexes.
- Traduction automatique : il s’agit peut-être de l’application la plus connue. Les modèles Seq2Seq alimentent des outils comme Google Translate. Le modèle accepte une phrase dans une langue source et produit une phrase dans une langue cible, en gérant avec fluidité les différences de grammaire et de structure syntaxique.
- Résumé automatique : ces modèles peuvent ingérer de longs documents ou articles et générer des résumés concis. En comprenant le sens général du texte d’entrée, le décodeur produit une séquence plus courte qui conserve les informations essentielles, une technique importante pour l’agrégation automatisée d’actualités.
- Génération de légendes d’images : en combinant vision et langage, un modèle Seq2Seq peut décrire le contenu d’une image. Un réseau de neurones convolutionnels (CNN) agit comme encodeur pour extraire les caractéristiques visuelles, tandis qu’un RNN sert de décodeur pour générer une phrase descriptive. Il s’agit d’un excellent exemple de modèle multimodal.
- Reconnaissance vocale : dans ces systèmes, l’entrée est une séquence de trames de signal audio et la sortie est une séquence de caractères ou de mots. Cette technologie est au cœur d’assistants virtuels comme Siri et Alexa.
Exemple de code : bloc de construction de base#
Bien que les frameworks de haut niveau masquent une grande partie de la complexité, il est utile de comprendre le mécanisme sous-jacent. Le code suivant illustre une couche LSTM de base dans PyTorch, qui sert souvent d’unité récurrente au sein de l’encodeur ou du décodeur d’un modèle Seq2Seq traditionnel.
import torch
import torch.nn as nn
# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)
# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)
# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)
print(f"Output shape: {output.shape}") # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}") # Shape: [1, 3, 20]Comparaison avec des concepts associés#
Il est important de distinguer les modèles Seq2Seq des autres architectures pour comprendre leur utilité spécifique.
- Par rapport à la classification standard : les classificateurs standard, comme ceux utilisés pour la classification d’images de base, associent une seule entrée (comme une image) à une seule étiquette de classe. À l’inverse, les modèles Seq2Seq associent des séquences à des séquences, ce qui permet d’obtenir des sorties de longueur variable.
- Par rapport à la détection d’objets : les modèles comme Ultralytics YOLO26 se concentrent sur la détection spatiale au sein d’une seule image, en identifiant les objets et leurs positions. Alors que YOLO traite les images de manière structurelle, les modèles Seq2Seq traitent les données de manière temporelle. Cependant, ces domaines se recoupent dans des tâches comme le suivi d’objets, où l’identification des trajectoires d’objets sur des images vidéo implique l’analyse de données séquentielles.
- Par rapport aux Transformers : l’architecture Transformer représente l’évolution moderne des modèles Seq2Seq. Alors que les modèles Seq2Seq originaux reposaient largement sur les RNN et les unités récurrentes à portes (GRU), les Transformers utilisent l’auto-attention pour traiter les séquences en parallèle, offrant des améliorations significatives en matière de vitesse et de précision.
Importance dans l’écosystème de l’IA#
Les modèles Seq2Seq ont fondamentalement transformé la manière dont les machines interagissent avec le langage humain et les données temporelles. Leur capacité à traiter les données dépendantes de la séquence a permis de créer des chatbots sophistiqués, des traducteurs automatiques et des outils de génération de code. Pour les développeurs qui travaillent avec les grands jeux de données nécessaires à l’entraînement de ces modèles, l’utilisation de l’Ultralytics Platform peut simplifier les workflows de gestion des données et de déploiement des modèles. Alors que les recherches progressent dans le domaine de l’IA générative, les principes de la modélisation séquentielle restent au cœur du développement des grands modèles de langage (LLMs) et des systèmes avancés de compréhension vidéo.









