Ultralytics YOLO27 :
Retour au glossaire Ultralytics

Sequence-to-Sequence Models

Découvre comment les modèles Sequence-to-Sequence (Seq2Seq) alimentent la traduction et le NLP. Explore les architectures encodeur-décodeur, les Transformers et l’intégration avec Ultralytics YOLO26.

Les modèles séquence-à-séquence (Seq2Seq) constituent une catégorie puissante d’architectures de machine learning conçues pour convertir des séquences d’un domaine en séquences d’un autre. Contrairement aux tâches standard de classification d’images, où les tailles des entrées et des sorties sont fixes, les modèles Seq2Seq excellent dans le traitement d’entrées et de sorties de longueurs variables. Cette flexibilité en fait la base de nombreuses applications modernes de traitement automatique du langage naturel (NLP), comme la traduction et le résumé, où la longueur de la phrase d’entrée ne détermine pas nécessairement celle de la phrase de sortie.

Architecture fondamentale et fonctionnalités#

La structure fondamentale d’un modèle Seq2Seq repose sur le framework encodeur-décodeur. Cette architecture sépare le modèle en deux composants principaux qui fonctionnent de concert pour traiter les données séquentielles.

  • L’encodeur : ce composant traite la séquence d’entrée (par exemple, une phrase en anglais ou une séquence de trames audio) élément par élément. Il compresse les informations dans un vecteur de contexte de longueur fixe, également appelé état caché. Dans les architectures traditionnelles, l’encodeur est souvent construit à l’aide de réseaux de neurones récurrents (RNN) ou de réseaux de mémoire à long court terme (LSTM), conçus pour conserver les informations au fil des pas temporels.
  • Le décodeur : une fois l’entrée encodée, le décodeur utilise le vecteur de contexte et prédit la séquence de sortie (par exemple, la phrase correspondante en français) étape par étape. Il utilise la prédiction précédente pour influencer la suivante, afin d’assurer la continuité grammaticale et contextuelle.

Alors que les premières versions reposaient largement sur les RNN, les modèles Seq2Seq modernes utilisent principalement l’architecture Transformer. Les Transformers utilisent le mécanisme d’attention, qui permet au modèle de « porter son attention » sur des parties spécifiques de la séquence d’entrée, quelle que soit leur distance par rapport à l’étape actuelle, améliorant ainsi considérablement les performances sur les séquences longues, comme l’explique l’article fondateur Attention Is All You Need.

Applications concrètes#

La polyvalence des modèles Seq2Seq leur permet de combler le fossé entre l’analyse de texte et la vision par ordinateur, en permettant des interactions multimodales complexes.

  • Traduction automatique : il s’agit peut-être de l’application la plus connue. Les modèles Seq2Seq alimentent des outils comme Google Translate. Le modèle accepte une phrase dans une langue source et produit une phrase dans une langue cible, en gérant avec fluidité les différences de grammaire et de structure syntaxique.
  • Résumé automatique : ces modèles peuvent ingérer de longs documents ou articles et générer des résumés concis. En comprenant le sens général du texte d’entrée, le décodeur produit une séquence plus courte qui conserve les informations essentielles, une technique importante pour l’agrégation automatisée d’actualités.
  • Génération de légendes d’images : en combinant vision et langage, un modèle Seq2Seq peut décrire le contenu d’une image. Un réseau de neurones convolutionnels (CNN) agit comme encodeur pour extraire les caractéristiques visuelles, tandis qu’un RNN sert de décodeur pour générer une phrase descriptive. Il s’agit d’un excellent exemple de modèle multimodal.
  • Reconnaissance vocale : dans ces systèmes, l’entrée est une séquence de trames de signal audio et la sortie est une séquence de caractères ou de mots. Cette technologie est au cœur d’assistants virtuels comme Siri et Alexa.

Exemple de code : bloc de construction de base#

Bien que les frameworks de haut niveau masquent une grande partie de la complexité, il est utile de comprendre le mécanisme sous-jacent. Le code suivant illustre une couche LSTM de base dans PyTorch, qui sert souvent d’unité récurrente au sein de l’encodeur ou du décodeur d’un modèle Seq2Seq traditionnel.

import torch
import torch.nn as nn

# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)

# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)

# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)

print(f"Output shape: {output.shape}")  # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}")  # Shape: [1, 3, 20]

Comparaison avec des concepts associés#

Il est important de distinguer les modèles Seq2Seq des autres architectures pour comprendre leur utilité spécifique.

  • Par rapport à la classification standard : les classificateurs standard, comme ceux utilisés pour la classification d’images de base, associent une seule entrée (comme une image) à une seule étiquette de classe. À l’inverse, les modèles Seq2Seq associent des séquences à des séquences, ce qui permet d’obtenir des sorties de longueur variable.
  • Par rapport à la détection d’objets : les modèles comme Ultralytics YOLO26 se concentrent sur la détection spatiale au sein d’une seule image, en identifiant les objets et leurs positions. Alors que YOLO traite les images de manière structurelle, les modèles Seq2Seq traitent les données de manière temporelle. Cependant, ces domaines se recoupent dans des tâches comme le suivi d’objets, où l’identification des trajectoires d’objets sur des images vidéo implique l’analyse de données séquentielles.
  • Par rapport aux Transformers : l’architecture Transformer représente l’évolution moderne des modèles Seq2Seq. Alors que les modèles Seq2Seq originaux reposaient largement sur les RNN et les unités récurrentes à portes (GRU), les Transformers utilisent l’auto-attention pour traiter les séquences en parallèle, offrant des améliorations significatives en matière de vitesse et de précision.

Importance dans l’écosystème de l’IA#

Les modèles Seq2Seq ont fondamentalement transformé la manière dont les machines interagissent avec le langage humain et les données temporelles. Leur capacité à traiter les données dépendantes de la séquence a permis de créer des chatbots sophistiqués, des traducteurs automatiques et des outils de génération de code. Pour les développeurs qui travaillent avec les grands jeux de données nécessaires à l’entraînement de ces modèles, l’utilisation de l’Ultralytics Platform peut simplifier les workflows de gestion des données et de déploiement des modèles. Alors que les recherches progressent dans le domaine de l’IA générative, les principes de la modélisation séquentielle restent au cœur du développement des grands modèles de langage (LLMs) et des systèmes avancés de compréhension vidéo.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique