Ultralytics YOLO27:
Volver al glosario de Ultralytics

Sequence-to-Sequence Models

Descubre cómo los modelos de secuencia a secuencia (Seq2Seq) impulsan la traducción y el NLP. Explora las arquitecturas de codificador-decodificador, los Transformers y la integración con Ultralytics YOLO26.

Los modelos de secuencia a secuencia (Seq2Seq) son una potente clase de arquitecturas de aprendizaje automático diseñadas para convertir secuencias de un dominio en secuencias de otro. A diferencia de las tareas estándar de clasificación de imágenes, en las que los tamaños de entrada y salida son fijos, los modelos Seq2Seq destacan por gestionar entradas y salidas de longitud variable. Esta flexibilidad los convierte en la base de muchas aplicaciones modernas de procesamiento del lenguaje natural (NLP), como la traducción y la generación de resúmenes, en las que la longitud de la oración de entrada no determina necesariamente la longitud de la oración de salida.

Arquitectura y funcionalidad principales#

La estructura fundamental de un modelo Seq2Seq se basa en el marco de codificador-decodificador. Esta arquitectura divide el modelo en dos componentes principales que trabajan conjuntamente para procesar datos secuenciales.

  • El codificador: Este componente procesa la secuencia de entrada (por ejemplo, una oración en inglés o una secuencia de tramas de audio) elemento a elemento. Comprime la información en un vector de contexto de longitud fija, también conocido como estado oculto. En las arquitecturas tradicionales, el codificador suele construirse mediante redes neuronales recurrentes (RNN) o redes de memoria a corto y largo plazo (LSTM), diseñadas para conservar información a lo largo de los pasos temporales.
  • El decodificador: Una vez codificada la entrada, el decodificador toma el vector de contexto y predice la secuencia de salida (por ejemplo, la oración correspondiente en francés) paso a paso. Utiliza la predicción anterior para influir en la siguiente, garantizando la continuidad gramatical y contextual.

Aunque las primeras versiones dependían en gran medida de las RNN, los modelos Seq2Seq modernos utilizan principalmente la arquitectura Transformer. Los Transformer emplean el mecanismo de atención, que permite al modelo «prestar atención» a partes específicas de la secuencia de entrada independientemente de su distancia respecto al paso actual, lo que mejora significativamente el rendimiento en secuencias largas, como se detalla en el artículo fundamental La atención es todo lo que necesitas.

Aplicaciones en el mundo real#

La versatilidad de los modelos Seq2Seq les permite salvar la distancia entre el análisis de texto y la visión artificial, posibilitando interacciones multimodales complejas.

  • Traducción automática: Probablemente la aplicación más conocida, los modelos Seq2Seq impulsan herramientas como Google Translate. El modelo acepta una oración en un idioma de origen y genera una oración en un idioma de destino, gestionando con fluidez las diferencias gramaticales y estructurales.
  • Generación de resúmenes de texto: Estos modelos pueden procesar documentos o artículos extensos y generar resúmenes concisos. Al comprender el significado esencial del texto de entrada, el decodificador produce una secuencia más corta que conserva la información clave, una técnica fundamental para la agregación automatizada de noticias.
  • Generación de descripciones de imágenes: Al combinar visión y lenguaje, un modelo Seq2Seq puede describir el contenido de una imagen. Una red neuronal convolucional (CNN) actúa como codificador para extraer características visuales, mientras que una RNN actúa como decodificador para generar una oración descriptiva. Este es un ejemplo destacado de modelo multimodal.
  • Reconocimiento de voz: En estos sistemas, la entrada es una secuencia de tramas de señales de audio y la salida es una secuencia de caracteres o palabras de texto. Esta tecnología sustenta asistentes virtuales como Siri y Alexa.

Ejemplo de código: componente básico#

Aunque los marcos de alto nivel abstraen gran parte de la complejidad, es útil comprender el mecanismo subyacente. El código siguiente muestra una capa LSTM básica en PyTorch, que suele actuar como unidad recurrente dentro del codificador o decodificador de un modelo Seq2Seq tradicional.

import torch
import torch.nn as nn

# Initialize an LSTM layer (common in Seq2Seq encoders)
# input_size: number of features per time step (e.g., word embedding size)
# hidden_size: size of the context vector/hidden state
lstm_layer = nn.LSTM(input_size=10, hidden_size=20, batch_first=True)

# Create a dummy input sequence: Batch size 3, Sequence length 5, Features 10
input_seq = torch.randn(3, 5, 10)

# Pass the sequence through the LSTM
# output contains features for each time step; hn is the final hidden state
output, (hn, cn) = lstm_layer(input_seq)

print(f"Output shape: {output.shape}")  # Shape: [3, 5, 20]
print(f"Final Hidden State shape: {hn.shape}")  # Shape: [1, 3, 20]

Comparación con conceptos relacionados#

Es importante distinguir los modelos Seq2Seq de otras arquitecturas para comprender su utilidad específica.

  • Frente a la clasificación estándar: Los clasificadores estándar, como los utilizados en la clasificación de imágenes básica, asignan una única entrada (como una imagen) a una única etiqueta de clase. En cambio, los modelos Seq2Seq asignan secuencias a secuencias, lo que permite longitudes de salida variables.
  • Frente a la detección de objetos: Los modelos como Ultralytics YOLO26 se centran en la detección espacial dentro de un único fotograma, identificando los objetos y sus ubicaciones. Mientras que YOLO procesa las imágenes de forma estructural, los modelos Seq2Seq procesan los datos temporalmente. Sin embargo, ambos ámbitos se solapan en tareas como el seguimiento de objetos, en las que identificar las trayectorias de los objetos a lo largo de los fotogramas de un vídeo implica analizar datos secuenciales.
  • Frente a los Transformer: La arquitectura Transformer es la evolución moderna de Seq2Seq. Mientras que los modelos Seq2Seq originales dependían en gran medida de las RNN y las unidades recurrentes con compuertas (GRU), los Transformer utilizan la autoatención para procesar secuencias en paralelo, ofreciendo mejoras significativas en velocidad y precisión.

Importancia en el ecosistema de la IA#

Los modelos Seq2Seq han cambiado fundamentalmente la forma en que las máquinas interactúan con el lenguaje humano y los datos temporales. Su capacidad para gestionar datos dependientes de secuencias ha permitido crear chatbots sofisticados, traductores automatizados y herramientas de generación de código. Para los desarrolladores que trabajan con los grandes conjuntos de datos necesarios para entrenar estos modelos, utilizar la Ultralytics Platform puede agilizar los flujos de trabajo de gestión de datos y despliegue de modelos. A medida que avanza la investigación en IA generativa, los principios del modelado de secuencias siguen siendo fundamentales para desarrollar grandes modelos de lenguaje (LLMs) y sistemas avanzados de comprensión de vídeos.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático