YOLO Vision 2026:
Volver al glosario de Ultralytics

Sequence-to-Sequence Models

Aprende cómo los modelos de secuencia a secuencia (Seq2Seq) potencian la traducción y el NLP. Explora arquitecturas codificador-decodificador, Transformers e integración con Ultralytics YOLO26.

Los modelos de secuencia a secuencia (Seq2Seq) son una potente clase de arquitecturas de machine learning diseñadas para convertir secuencias de un dominio en secuencias de otro. A diferencia de las tareas estándar de image classification, donde los tamaños de entrada y salida son fijos, los modelos Seq2Seq destacan en el manejo de entradas y salidas de longitudes variables. Esta flexibilidad los convierte en la columna vertebral de muchas aplicaciones modernas de natural language processing (NLP), como la traducción y el resumen, donde la longitud de la oración de entrada no dicta necesariamente la longitud de la oración de salida.

Arquitectura y funcionalidad básica#

La estructura fundamental de un modelo Seq2Seq se basa en el marco codificador-decodificador. Esta arquitectura divide el modelo en dos componentes principales que trabajan en conjunto para procesar datos secuenciales.

  • El codificador: Este componente procesa la secuencia de entrada (por ejemplo, una oración en inglés o una secuencia de fotogramas de audio) elemento por elemento. Comprime la información en un vector de contexto de longitud fija, también conocido como estado oculto. En las arquitecturas tradicionales, el codificador suele construirse utilizando redes Recurrent Neural Networks (RNN) o Long Short-Term Memory (LSTM), que están diseñadas para retener información a lo largo de los pasos de tiempo.
  • El decodificador: Una vez codificada la entrada, el decodificador toma el vector de contexto y predice la secuencia de salida (por ejemplo, la oración correspondiente en francés) paso a paso. Utiliza la predicción anterior para influir en la siguiente, garantizando la continuidad gramatical y contextual.

Aunque las primeras versiones dependían en gran medida de las RNN, los modelos Seq2Seq modernos utilizan predominantemente la arquitectura Transformer. Los Transformers emplean el attention mechanism, que permite al modelo "prestar atención" a partes específicas de la secuencia de entrada independientemente de su distancia desde el paso actual, lo que mejora significativamente el rendimiento en secuencias largas, tal como se detalla en el influyente artículo Attention Is All You Need.

Aplicaciones en el mundo real#

La versatilidad de los modelos Seq2Seq les permite tender un puente entre el análisis de texto y la computer vision, facilitando interacciones multimodales complejas.

  • Machine Translation: Quizás la aplicación más famosa, los modelos Seq2Seq impulsan herramientas como Google Translate. El modelo acepta una oración en un idioma de origen y genera una oración en un idioma de destino, manejando con fluidez las diferencias en gramática y estructura de las oraciones.
  • Text Summarization: Estos modelos pueden ingerir documentos o artículos largos y generar resúmenes concisos. Al comprender el significado principal del texto de entrada, el decodificador produce una secuencia más corta que retiene la información clave, una técnica vital para la agregación automatizada de noticias.
  • Subtitulado de imágenes: Al combinar visión y lenguaje, un modelo Seq2Seq puede describir el contenido de una imagen. Una Red Neuronal Convolucional (CNN) actúa como codificador para extraer características visuales, mientras que una RNN actúa como decodificador para generar una oración descriptiva. Este es un claro ejemplo de un multi-modal model.
  • Speech Recognition: En estos sistemas, la entrada es una secuencia de fotogramas de señales de audio y la salida es una secuencia de caracteres de texto o palabras. Esta tecnología sustenta a los virtual assistants como Siri y Alexa.

Ejemplo de código: bloque de construcción básico#

Aunque los marcos de alto nivel abstraen gran parte de la complejidad, comprender el mecanismo subyacente es útil. El siguiente código demuestra una capa LSTM básica en PyTorch, que a menudo sirve como la unidad recurrente dentro del codificador o decodificador de un modelo Seq2Seq tradicional.

import torch
import torch.nn as nn

# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)

# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)

# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)

print(f"Output shape: {output.shape}")  # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}")  # Shape: [1, 3, 20]

Comparación con conceptos relacionados#

Es importante distinguir los modelos Seq2Seq de otras arquitecturas para comprender su utilidad específica.

  • Frente a la clasificación estándar: Los clasificadores estándar, como los utilizados en la image classification básica, asignan una sola entrada (como una imagen) a una sola etiqueta de clase. En contraste, los modelos Seq2Seq asignan secuencias a secuencias, lo que permite longitudes de salida variables.
  • Frente a la detección de objetos: Modelos como Ultralytics YOLO26 se centran en la detección espacial dentro de un solo fotograma, identificando objetos y sus ubicaciones. Mientras que YOLO procesa imágenes de forma estructural, los modelos Seq2Seq procesan datos de forma temporal. Sin embargo, los dominios se solapan en tareas como el object tracking, donde la identificación de las trayectorias de los objetos a lo largo de los fotogramas de video implica un análisis de datos secuenciales.
  • Frente a los Transformers: La arquitectura Transformer es la evolución moderna de Seq2Seq. Mientras que los modelos Seq2Seq originales dependían en gran medida de las RNN y las Gated Recurrent Units (GRU), los Transformers utilizan la autoatención para procesar secuencias en paralelo, ofreciendo mejoras significativas en velocidad y precisión.

Importancia en el ecosistema de IA#

Los modelos Seq2Seq han cambiado fundamentalmente la forma en que las máquinas interactúan con el lenguaje humano y los datos temporales. Su capacidad para manejar sequence-dependent data ha permitido la creación de chatbots sofisticados, traductores automáticos y herramientas de generación de código. Para los desarrolladores que trabajan con grandes conjuntos de datos necesarios para entrenar estos modelos, el uso de la Ultralytics Platform puede agilizar la gestión de datos y los flujos de trabajo de implementación de modelos. A medida que la investigación avanza hacia la Generative AI, los principios del modelado de secuencias siguen siendo fundamentales para el desarrollo de Large Language Models (LLMs) y sistemas avanzados de video understanding.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático