La IA generativa está cambiando el rumbo de la visión artificial
Descubre las ideas más interesantes de una mesa redonda de YOLO Vision 2024. Explora cómo la IA generativa está marcando el rumbo de los modelos de IA visual en tiempo real.

La IA generativa es una rama de la inteligencia artificial (AI) que crea contenido nuevo, como imágenes, texto o audio, aprendiendo patrones a partir de datos existentes. Gracias a los avances recientes, ahora puede utilizarse para producir contenido muy realista que a menudo imita la creatividad humana.
Sin embargo, el impacto de la IA generativa va más allá de la simple creación de contenido. A medida que los modelos de visión artificial en tiempo real, como los modelos Ultralytics YOLO, siguen evolucionando, la IA generativa también está redefiniendo cómo se procesan y aumentan los datos visuales, allanando el camino para aplicaciones innovadoras en situaciones reales.
Este nuevo cambio tecnológico fue un tema de conversación interesante en YOLO Vision 2024 (YV24),, un evento híbrido anual organizado por Ultralytics. En YV24, entusiastas de la IA y líderes del sector se reunieron para hablar de los últimos avances en visión artificial. El evento se centró en la innovación, la eficiencia y el futuro de las soluciones de IA en tiempo real.
Uno de los momentos más destacados del evento fue un debate sobre YOLO en la era de la IA generativa. En el debate participaron Glenn Jocher, fundador y CEO de Ultralytics; Jing Qiu, ingeniero sénior de aprendizaje automático en Ultralytics; y Ao Wang, de la Universidad de Tsinghua. Analizaron cómo influye la IA generativa en la visión artificial y los retos que plantea crear modelos de IA prácticos.
En este artículo, repasaremos las principales ideas de su conversación y veremos más de cerca cómo la IA generativa está transformando la IA visual.
Desarrollo de los modelos Ultralytics YOLO#
Junto a Glenn Jocher, muchos ingenieros cualificados han desempeñado un papel fundamental en el desarrollo de los modelos Ultralytics YOLO. Uno de ellos, Jing Qiu, contó cómo empezó inesperadamente a trabajar con YOLO. Explicó que su pasión por la IA comenzó durante sus años universitarios. Dedicó mucho tiempo a explorar y aprender sobre este campo. Jing Qiu recordó cómo contactó con Glenn Jocher en GitHub y se implicó en varios proyectos de IA.
En relación con lo que comentó Jing Qiu, Glenn Jocher describió GitHub como «una forma increíble de compartir: personas que nunca se han conocido se unen para ayudarse mutuamente y contribuir al trabajo de los demás. Es una comunidad estupenda y una forma realmente excelente de iniciarse en la IA».

Fig. 1. Glenn Jocher y Jing Qiu hablan sobre el escenario en YV24.
El interés de Jing Qiu por la IA y su trabajo en Ultralytics YOLOv5 ayudaron a perfeccionar el modelo. Más adelante, desempeñó un papel fundamental en el desarrollo de Ultralytics YOLOv8, que introdujo nuevas mejoras. Lo describió como un viaje increíble. Hoy, Jing Qiu sigue mejorando y trabajando en modelos como Ultralytics YOLO11.
YOLOv10: optimizado para el rendimiento en el mundo real#
Ao Wang se unió al debate de forma remota desde China y se presentó como estudiante de doctorado. Al principio estudió ingeniería de software, pero su pasión por la IA le llevó a orientarse hacia la visión artificial y el aprendizaje profundo.
Su primer contacto con el famoso modelo YOLO se produjo mientras experimentaba con distintas técnicas y modelos de IA. Le impresionaron su velocidad y precisión, lo que le animó a profundizar en tareas de visión artificial, como la detección de objetos. Hace poco, Ao Wang contribuyó a YOLOv10, una versión reciente del modelo YOLO. Su investigación se centró en optimizar el modelo para que fuera más rápido y preciso.
La diferencia principal entre la IA generativa y la IA visual#
A continuación, el panel empezó a hablar de IA generativa, y Jing Qiu señaló que la IA generativa y la IA visual tienen objetivos muy distintos. La IA generativa crea cosas como texto, imágenes y vídeos, mientras que la IA visual analiza lo que ya existe, principalmente imágenes.
Glenn Jocher destacó que el tamaño también es una gran diferencia. Los modelos de IA generativa son enormes y a menudo contienen miles de millones de parámetros, es decir, ajustes internos que ayudan al modelo a aprender de los datos. Los modelos de visión artificial son mucho más pequeños. Dijo: «El modelo YOLO más pequeño que tenemos es unas mil veces más pequeño que el modelo de lenguaje grande más pequeño \[Modelo de lenguaje grande]. Es decir, 3 millones de parámetros frente a tres mil millones».

Fig. 2. El debate sobre IA generativa e IA visual en YV24.
Jing Qiu añadió que los procesos de entrenamiento y despliegue de la IA generativa y la visión artificial también son muy distintos. La IA generativa necesita servidores potentes y de gran capacidad para funcionar. En cambio, los modelos como YOLO están diseñados para ser eficientes y pueden entrenarse y desplegarse en hardware estándar. Por eso, los modelos Ultralytics YOLO son más prácticos para usos reales.
Aunque son diferentes, estos dos campos empiezan a entrelazarse. Glenn Jocher explicó que la IA generativa está impulsando nuevos avances en la IA visual, haciendo que los modelos sean más inteligentes y eficientes.
El impacto de la IA generativa en la visión artificial#
La IA generativa ha avanzado rápidamente, y estos avances están influyendo en muchas otras áreas de la inteligencia artificial, incluida la visión artificial. A continuación, repasemos algunas ideas interesantes que compartió el panel al respecto.
Los avances en hardware impulsan la innovación en IA#
Al principio del debate, Glenn Jocher explicó que las ideas de aprendizaje automático existen desde hace mucho tiempo, pero los ordenadores no tenían suficiente potencia para hacerlas realidad. Las ideas de IA necesitaban un hardware más potente para poder llevarse a la práctica.
La expansión de las GPU (unidades de procesamiento gráfico) durante los últimos 20 años, gracias a su capacidad de procesamiento paralelo, lo cambió todo. Permitieron entrenar modelos de IA de forma mucho más rápida y eficiente, lo que hizo posible que el aprendizaje profundo avanzara a gran velocidad.
Hoy en día, los chips de IA como las TPU (unidades de procesamiento tensorial) y las GPU optimizadas consumen menos energía y, al mismo tiempo, permiten procesar modelos más grandes y complejos. Esto ha hecho que la IA sea más accesible y útil en aplicaciones del mundo real.
Con cada mejora del hardware, las aplicaciones de IA generativa y visión artificial ganan potencia. Estos avances hacen que la IA en tiempo real sea más rápida y eficiente, y esté lista para usarse en más sectores.
Cómo está dando forma la IA generativa a los modelos de detección de objetos#
Cuando le preguntaron cómo influye la IA generativa en la visión artificial, Jing Qiu explicó que los transformadores —modelos que ayudan a la IA a centrarse en las partes más importantes de una imagen— han cambiado la forma en que la IA entiende y procesa las imágenes. El primer gran paso fue DETR (Detection Transformer), que aplicó este nuevo enfoque a la detección de objetos. Mejoró la precisión, pero presentaba problemas de rendimiento que, en algunos casos, lo hacían más lento.
Para resolver este problema, los investigadores crearon modelos híbridos como RT-DETR. Estos modelos combinan redes neuronales convolucionales (CNN, modelos de aprendizaje profundo que aprenden y extraen características de las imágenes automáticamente) y transformadores, equilibrando velocidad y precisión. Este enfoque aprovecha las ventajas de los transformadores y, al mismo tiempo, acelera la detección de objetos.
Curiosamente, YOLOv10 utiliza capas de atención basadas en transformadores —partes del modelo que actúan como un foco para destacar las zonas más importantes de una imagen e ignorar los detalles menos relevantes— para mejorar su rendimiento.
Ao Wang también mencionó cómo la IA generativa está cambiando la forma de entrenar los modelos. Técnicas como el modelado de imágenes enmascaradas ayudan a la IA a aprender de las imágenes con mayor eficiencia y reducen la necesidad de grandes conjuntos de datos etiquetados manualmente. Esto hace que el entrenamiento de visión artificial sea más rápido y requiera menos recursos.
El futuro de la IA generativa y la IA visual#
Otra idea clave que debatió el panel fue cómo podrían unirse la IA generativa y la IA visual para crear modelos más capaces. Glenn Jocher explicó que, aunque estos dos enfoques tienen puntos fuertes distintos, combinarlos podría abrir nuevas posibilidades.
Por ejemplo, los modelos de IA visual como YOLO suelen dividir una imagen en una cuadrícula para identificar objetos. Este método basado en cuadrículas podría ayudar a los modelos de lenguaje a mejorar su capacidad para localizar detalles y describirlos, un reto al que se enfrentan muchos modelos de lenguaje hoy en día. En esencia, combinar estas técnicas podría dar lugar a sistemas capaces de detectar con precisión y explicar con claridad lo que ven.

Fig. 3. El futuro de la IA generativa y la IA visual. Imagen del autor.
Conclusiones clave#
La IA generativa y la visión artificial avanzan juntas. La IA generativa crea imágenes y vídeos, pero también mejora el análisis de imágenes y vídeos al aportar nuevas ideas innovadoras que podrían hacer que los modelos de IA visual sean más precisos y eficientes.
En este interesante debate de YV24, Glenn Jocher, Jing Qiu y Ao Wang compartieron sus ideas sobre cómo estas tecnologías están dando forma al futuro. Gracias a un hardware de IA mejor, la IA generativa y la IA visual seguirán evolucionando y darán lugar a innovaciones aún mayores. Estos dos campos colaboran para crear una IA más inteligente, rápida y útil en el día a día.
Únete a nuestra comunidad y explora nuestro repositorio de GitHub para aprender más sobre la IA visual. Echa un vistazo a nuestras opciones de licencia para poner en marcha tus proyectos de visión artificial. ¿Te interesan innovaciones como la IA en la fabricación o la visión artificial en la conducción autónoma? Visita nuestras páginas de soluciones para descubrir más.









