Transformer
Explora la arquitectura Transformer y el mecanismo de autoatención. Descubre cómo impulsan modelos de IA como RT-DETR y Ultralytics YOLO26 para lograr una precisión superior.
Un Transformer es una arquitectura de aprendizaje profundo que se basa en un mecanismo denominado atención propia para procesar datos de entrada secuenciales, como el lenguaje natural o las características visuales. Presentado originalmente por investigadores de Google en el artículo de referencia Attention Is All You Need, el Transformer revolucionó el campo de la inteligencia artificial (AI) al eliminar las limitaciones del procesamiento secuencial de las anteriores redes neuronales recurrentes (RNNs). En su lugar, los Transformers analizan secuencias de datos completas simultáneamente, lo que permite una paralelización masiva y tiempos de entrenamiento considerablemente más rápidos en hardware moderno, como las GPUs.
Cómo funcionan los Transformers#
La innovación principal del Transformer es el mecanismo de atención propia. Esto permite al modelo ponderar la importancia de las distintas partes de los datos de entrada entre sí. Por ejemplo, en una frase, el modelo puede aprender que la palabra "banco" está más relacionada con "dinero" que con "río" según el contexto circundante.
Por lo general, esta arquitectura consta de dos componentes principales:
- Codificador: procesa los datos de entrada en una representación numérica enriquecida o embedding.
- Decodificador: utiliza la salida del codificador para generar el resultado final, como una frase traducida o un cuadro delimitador predicho.
En el ámbito de la visión artificial (CV), los modelos suelen emplear una variante denominada Vision Transformer (ViT). En lugar de procesar tokens de texto, la imagen se divide en parches de tamaño fijo (por ejemplo, de 16x16 píxeles). Estos parches se aplanan y se tratan como una secuencia, lo que permite al modelo captar el "contexto global" —es decir, comprender las relaciones entre partes distantes de una imagen— de forma más eficaz que una red neuronal convolucional (CNN) estándar.
Transformers frente a conceptos relacionados#
Es importante distinguir la arquitectura Transformer de los términos relacionados:
- Mecanismo de atención: es el concepto general de centrarse en partes específicas de los datos. El Transformer es una arquitectura específica construida íntegramente en torno a capas de atención, mientras que otros modelos pueden utilizar la atención únicamente como un pequeño complemento.
- Modelo de lenguaje grande (LLM): términos como "GPT" hacen referencia a modelos específicos entrenados con enormes cantidades de texto. Casi todos los LLM modernos utilizan la arquitectura Transformer como motor subyacente.
Aplicaciones en el mundo real#
La versatilidad de los Transformers ha propiciado su adopción en diversos sectores:
-
Diagnóstico por imagen: en la IA en sanidad, los Transformers se utilizan para tareas complejas, como el análisis de imágenes médicas. Su capacidad para comprender las relaciones espaciales globales ayuda a detectar anomalías sutiles en exploraciones de MRI o CT de alta resolución que las CNN centradas en características locales podrían pasar por alto.
-
Sistemas autónomos: en los vehículos autónomos, es fundamental comprender la trayectoria de los peatones y de otros vehículos. Los Transformers destacan en la comprensión de vídeo al realizar el seguimiento de objetos a lo largo de distintos fotogramas y predecir movimientos futuros para garantizar una navegación segura.
Detección de objetos con Transformers#
Aunque las CNN han dominado tradicionalmente la detección de objetos, los modelos basados en Transformers, como el Transformer de detección en tiempo real (RT-DETR), han surgido como alternativas potentes. RT-DETR combina la velocidad de los backbones CNN con la precisión de los cabezales de decodificación de Transformer.
Sin embargo, los modelos Transformer puros pueden ser exigentes en cuanto a recursos computacionales. Para muchas aplicaciones en el edge, los modelos híbridos altamente optimizados, como YOLO26 —que integran mecanismos de atención eficientes con un procesamiento convolucional rápido—, ofrecen un equilibrio superior entre velocidad y precisión. Puedes gestionar fácilmente el entrenamiento y el despliegue de estos modelos mediante la Ultralytics Platform, que agiliza el flujo de trabajo desde la anotación del conjunto de datos hasta la exportación del modelo.
Ejemplo en Python: uso de RT-DETR#
El siguiente ejemplo muestra cómo realizar inferencias utilizando un modelo basado en Transformer dentro del paquete ultralytics. Este código carga un modelo RT-DETR preentrenado y detecta objetos en una imagen.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Para profundizar en los fundamentos matemáticos, la documentación de PyTorch sobre las capas Transformer ofrece información técnica detallada, mientras que la guía de IBM sobre Transformers proporciona una perspectiva empresarial de alto nivel.









