Ultralytics YOLO27:
Volver al glosario de Ultralytics

Vision Transformer (ViT)

Explora el potencial de los Vision Transformers (ViT). Aprende cómo la autoatención y la tokenización en parches revolucionan la visión artificial más allá de las CNNs con Ultralytics.

Un Transformador de visión (ViT) es una arquitectura de aprendizaje profundo que adapta los mecanismos de autoatención diseñados originalmente para el Procesamiento del lenguaje natural (NLP) con el fin de resolver tareas visuales. A diferencia de una Red neuronal convolucional (CNN) tradicional, que procesa las imágenes mediante una jerarquía de cuadrículas de píxeles locales, un ViT trata una imagen como una secuencia de fragmentos discretos. Este enfoque se popularizó gracias al influyente artículo de investigación «Una imagen vale 16x16 palabras», que demostró que las arquitecturas basadas exclusivamente en Transformer podían alcanzar un rendimiento de vanguardia en visión por computador (CV) sin depender de capas convolucionales. Al aprovechar la atención global, los ViT pueden captar dependencias de largo alcance en toda una imagen desde la primera capa.

Cómo funcionan los Transformadores de visión#

La innovación fundamental del ViT reside en la forma en que estructura los datos de entrada. Para hacer que una imagen sea compatible con un Transformer estándar, el modelo descompone la información visual en una secuencia de vectores, imitando la forma en que un modelo de lenguaje procesa una frase formada por palabras.

  1. Tokenización de fragmentos: La imagen de entrada se divide en una cuadrícula de cuadrados de tamaño fijo, normalmente de 16x16 píxeles. Cada cuadrado se aplana para formar un vector y se convierte, en la práctica, en un token visual.

  2. Proyección lineal: Estos fragmentos aplanados pasan por una capa lineal entrenable para crear embeddings densos. Este paso asigna los valores de píxel sin procesar a un espacio de alta dimensionalidad que el modelo puede procesar.

  3. Codificación posicional: Como la arquitectura procesa las secuencias en paralelo y carece de una comprensión inherente del orden o del espacio, se añaden codificaciones posicionales aprendibles a los embeddings de los fragmentos. Esto permite al modelo conservar información espacial sobre la ubicación de cada fragmento en la imagen original.

  4. Mecanismo de autoatención: La secuencia entra en el codificador Transformer, donde la autoatención permite que cada fragmento interactúe simultáneamente con todos los demás. Esto permite a la red aprender el contexto global y comprender cómo se relaciona un píxel de la esquina superior izquierda con otro de la esquina inferior derecha.

  5. Cabezal de clasificación: Para tareas como la clasificación de imágenes, a menudo se antepone a la secuencia un «token de clase» especial. El estado de salida final de este token sirve como representación agregada de la imagen y se introduce después en un clasificador, como un perceptrón multicapa (MLP).

Transformadores de visión frente a CNN#

Aunque ambas arquitecturas tienen como objetivo comprender los datos visuales, difieren significativamente en su filosofía operativa. Las CNN poseen un fuerte «sesgo inductivo» conocido como invariancia ante traslaciones, lo que significa que asumen de forma inherente que las características locales, como los bordes y las texturas, son importantes independientemente de su posición. Esto hace que las CNN sean muy eficientes en cuanto a datos y eficaces con conjuntos de datos más pequeños.

Por el contrario, los Transformadores de visión tienen un sesgo menos específico de las imágenes. Deben aprender las relaciones espaciales desde cero utilizando grandes cantidades de datos de entrenamiento, como los conjuntos de datos JFT-300M o ImageNet completo. Aunque esto hace que el entrenamiento sea más intensivo desde el punto de vista computacional, permite que los ViT escalen extraordinariamente bien; con suficientes datos y potencia de cálculo, pueden superar a las CNN al captar estructuras globales complejas que las convoluciones locales podrían pasar por alto.

Aplicaciones en el mundo real#

La capacidad de comprender el contexto global hace que los ViT sean especialmente útiles en entornos complejos y de alto riesgo.

  • Análisis de imágenes médicas: En la IA sanitaria, los ViT se utilizan para analizar exploraciones de alta resolución, como RM o cortes histopatológicos. Por ejemplo, en la detección de tumores, un ViT puede relacionar sutiles anomalías texturales del tejido con cambios estructurales más amplios en todo el corte, identificando patrones malignos que el procesamiento local podría pasar por alto.
  • Imágenes por satélite y teledetección: Los ViT destacan en el análisis de imágenes por satélite, donde las relaciones entre objetos abarcan grandes distancias. Por ejemplo, relacionar una zona deforestada con una carretera maderera distante requiere comprender el «panorama general» de un paisaje, una tarea en la que la atención global de un ViT supera al campo receptivo limitado de las CNN estándar.

Uso de Transformers con Ultralytics#

La biblioteca ultralytics admite arquitecturas basadas en Transformer, especialmente RT-DETR (Transformador de detección en tiempo real). Aunque el YOLO26 insignia suele ser la opción preferida por su equilibrio entre velocidad y precisión en dispositivos periféricos, RT-DETR ofrece una alternativa potente para situaciones en las que se prioriza el contexto global.

El siguiente ejemplo de Python muestra cómo cargar un modelo basado en Transformer previamente entrenado y ejecutar inferencia:

from ultralytics import RTDETR

# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")

# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Perspectivas de futuro#

La investigación evoluciona rápidamente para abordar el elevado coste computacional de los ViT. Técnicas como FlashAttention están haciendo que estos modelos sean más rápidos y eficientes en cuanto al uso de memoria. Además, cada vez son más habituales las arquitecturas híbridas que combinan la eficiencia de las CNN con la atención de los Transformers. Para los equipos que buscan gestionar estos flujos de trabajo avanzados, la Plataforma de Ultralytics ofrece un entorno unificado para anotar datos, entrenar modelos complejos en la nube y desplegarlos en diversos endpoints.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático