¡Momentos clave de Ultralytics en YOLO Vision 2025 Shenzhen!
Repasa los momentos clave de YOLO Vision 2025 Shenzhen, donde Ultralytics reunió a innovadores, partners y a la comunidad de AI en una jornada inspiradora.

El 26 de octubre, YOLO Vision 2025 (YV25) debutó en China en el edificio B10 del parque cultural creativo OCT de Shenzhen. El evento híbrido de IA para visión de Ultralytics reunió a más de 200 asistentes presencialmente, mientras que muchos más se conectaron online a través de YouTube y Bilibili.
La emisión en directo de YV25 Shenzhen ya ha superado las 3.500 visualizaciones en YouTube y sigue ganando atención a medida que la comunidad comparte los momentos destacados del evento. Fue un día lleno de ideas, conversaciones y exploración práctica del rumbo que está tomando la IA para visión.
El día comenzó con una cálida bienvenida de nuestra anfitriona, Huang Xueying, que invitó a todos a conectar, aprender y participar en los debates durante todo el evento. Explicó que esta era la segunda edición de YOLO Vision del año, después de la edición de Londres en septiembre, y compartió lo emocionante que era volver a reunir a la comunidad de IA para visión aquí, en Shenzhen.
En este artículo repasaremos los momentos destacados del día, incluidas las novedades de los modelos, las sesiones de los ponentes, las demostraciones en directo y los momentos de comunidad que reunieron a todos. ¡Empecemos!
La trayectoria de los modelos Ultralytics YOLO hasta ahora#
La primera ponencia del día estuvo a cargo del fundador y director ejecutivo de Ultralytics, Glenn Jocher, que compartió cómo los modelos Ultralytics YOLO han pasado de ser un avance de investigación a convertirse en algunos de los modelos de IA para visión más utilizados del mundo. Glenn explicó que sus primeros trabajos se centraron en hacer que YOLO fuera más fácil de usar.
Portó los modelos a PyTorch, mejoró la documentación y lo compartió todo abiertamente para que desarrolladores de todo el mundo pudieran construir sobre ello. Como recordó: «Me lancé de cabeza en 2018. Decidí que este era mi futuro». Lo que comenzó como un esfuerzo personal se convirtió rápidamente en un movimiento global de código abierto.

Fig. 1. Glenn Jocher hablando en el escenario de YOLO Vision 2025 Shenzhen.
Hoy, los modelos Ultralytics YOLO generan miles de millones de inferencias cada día, y Glenn destacó que esta escala solo fue posible gracias a las personas que ayudaron a crearlos. Investigadores, ingenieros, estudiantes, aficionados y colaboradores de código abierto de todo el mundo han dado forma a YOLO hasta convertirlo en lo que es hoy.
Como dijo Glenn: «Hay casi mil [colaboradores] ahí fuera y estamos enormemente agradecidos por ello. No estaríamos donde estamos hoy sin estas personas».
Novedades de Ultralytics YOLO26#
La primera presentación de Ultralytics YOLO26 tuvo lugar a principios de este año en el evento YOLO Vision 2025 London, donde se presentó como el siguiente gran paso adelante de la familia de modelos Ultralytics YOLO. En YV25 Shenzhen, Glenn actualizó la información sobre los avances realizados desde aquel anuncio y ofreció a la comunidad de IA una visión más detallada de la evolución del modelo.
Ultralytics YOLO26 está diseñado para ser más pequeño, rápido y preciso, sin dejar de ser práctico para su uso en el mundo real. Glenn explicó que el equipo ha dedicado el último año a perfeccionar la arquitectura, comparar el rendimiento en distintos dispositivos e incorporar conocimientos procedentes de la investigación y los comentarios de la comunidad. El objetivo es ofrecer un rendimiento de vanguardia sin dificultar la implementación de los modelos.
Qué puedes esperar de Ultralytics YOLO26#
Una de las principales novedades que destacó Glenn es que Ultralytics YOLO26 se combina con una campaña específica de ajuste de hiperparámetros, pasando de entrenar completamente desde cero a realizar un ajuste fino con conjuntos de datos más grandes. Explicó que este enfoque se ajusta mucho mejor a los casos de uso reales.
Estas son algunas de las otras mejoras importantes presentadas en el evento:
- Arquitectura simplificada: Se ha eliminado la capa de pérdida focal distributiva (DFL). Esto hace que los modelos sean más sencillos y rápidos de ejecutar, manteniendo el mismo nivel de precisión.
- Compatibilidad con inferencia de extremo a extremo: Ultralytics YOLO26 es nativo de extremo a extremo, lo que significa que puede ejecutarse sin una capa NMS independiente. Esto facilita mucho la exportación a formatos como ONNX y TensorRT y la implementación en hardware periférico.
- Mejor rendimiento con objetos pequeños: Las estrategias de pérdida actualizadas ayudan al modelo a detectar objetos diminutos con mayor fiabilidad, un desafío al que la visión por ordenador se enfrenta desde hace mucho tiempo.
- Un nuevo optimizador híbrido: YOLO26 incluye un nuevo optimizador inspirado en investigaciones recientes sobre el entrenamiento de modelos de lenguaje de gran tamaño, que mejora la precisión del modelo y ahora está integrado directamente en el paquete de Ultralytics para Python.
Ultralytics YOLO26 es el siguiente paso hacia una IA para visión práctica#
En conjunto, estas actualizaciones dan como resultado modelos hasta un 43 % más rápidos en CPU y también más precisos que Ultralytics YOLO11, lo que hace que YOLO26 sea especialmente relevante para dispositivos integrados, robótica y sistemas periféricos.
Ultralytics YOLO26 será compatible con todas las tareas y tamaños de modelo disponibles actualmente en YOLO11, lo que dará lugar a 25 variantes de modelo en toda la familia. Esto incluye modelos para detección, segmentación, estimación de poses, cajas delimitadoras orientadas y clasificación, desde nano hasta extragrande.
El equipo también está trabajando en cinco variantes que admiten prompts. Son modelos capaces de recibir un prompt de texto y devolver directamente cajas delimitadoras, sin necesidad de entrenamiento.
Es un primer paso hacia flujos de trabajo de visión más flexibles y basados en instrucciones, que resultan más fáciles de adaptar a distintos casos de uso. Los modelos Ultralytics YOLO26 todavía están en desarrollo activo, pero los primeros resultados de rendimiento son sólidos y el equipo trabaja para publicarlos pronto.
Una mirada a Ultralytics Platform#
Después de la actualización de YOLO26, Glenn dio la bienvenida a Prateek Bhatnagar, nuestro responsable de ingeniería de producto, para realizar una demostración en directo de Ultralytics Platform. Esta plataforma se está desarrollando para reunir partes clave del flujo de trabajo de visión por ordenador, como explorar conjuntos de datos, anotar imágenes, entrenar modelos y comparar resultados.

Fig. 2. Prateek Bhatnagar presentando Ultralytics Platform.
Prateek señaló que la plataforma mantiene las raíces de código abierto de Ultralytics e introduce dos espacios comunitarios: una comunidad de conjuntos de datos y una comunidad de proyectos, donde los desarrolladores pueden contribuir, reutilizar y mejorar el trabajo de los demás. Durante la demostración, presentó la anotación asistida por IA, el entrenamiento en la nube de forma sencilla y la posibilidad de ajustar modelos directamente desde la comunidad, sin necesidad de recursos de GPU locales.
La plataforma se encuentra actualmente en desarrollo. Prateek animó al público a estar atento a los anuncios y señaló que el equipo está creciendo en China para apoyar el lanzamiento.
Las voces detrás de YOLO: el panel de autores#
A medida que crecía el entusiasmo, el evento pasó a un debate en panel con varios de los investigadores que están detrás de distintos modelos YOLO. En el panel participaron Glenn Jocher, junto con Jing Qiu, nuestra ingeniera sénior de aprendizaje automático; Chen Hui, ingeniero de aprendizaje automático en Meta y uno de los autores de YOLOv10; y Bo Zhang, estratega de algoritmos en Meituan y uno de los autores de YOLOv6.

Fig. 3. Un panel sobre el desarrollo de modelos YOLO con Huang Xueying, Chen Hui, Bo Zhang, Jing Qiu y Glenn Jocher.
El debate se centró en cómo YOLO continúa evolucionando mediante el uso en el mundo real. Los ponentes hablaron de cómo el progreso suele estar impulsado por desafíos prácticos de implementación, como ejecutar los modelos de forma eficiente en dispositivos periféricos, mejorar la detección de objetos pequeños y simplificar la exportación de modelos.
En lugar de perseguir únicamente la precisión, el panel destacó la importancia de equilibrar la velocidad, la facilidad de uso y la fiabilidad en entornos de producción. Otra conclusión compartida fue el valor de iterar y recibir comentarios de la comunidad.
Estas son otras ideas interesantes que surgieron durante la conversación:
- La detección de vocabulario abierto gana impulso en el ecosistema YOLO: Los modelos más recientes muestran cómo la alineación entre visión y lenguaje y los flujos de trabajo basados en prompts pueden detectar objetos más allá de categorías fijas.
- La atención ligera está en auge: El panel debatió cómo utilizar mecanismos de atención eficientes, en lugar de aplicar atención completa en todas partes, puede aumentar la precisión y mantener una inferencia lo bastante ligera para los dispositivos periféricos.
- Itera pronto y a menudo con la comunidad: Los participantes del panel reafirmaron una mentalidad de crear–probar–mejorar, en la que publicar los modelos antes y aprender de los usuarios genera mejores resultados que los largos ciclos de desarrollo privado.
Líderes de opinión que definen el futuro de la IA y la visión#
A continuación, veremos más de cerca algunas de las ponencias principales de YV25 Shenzhen, en las que líderes de la comunidad de IA compartieron cómo está evolucionando la IA para visión: desde los humanos digitales y la robótica hasta el razonamiento multimodal y la implementación eficiente en dispositivos periféricos.
Enseñar a la IA a comprender la experiencia humana#
En una sesión reveladora, el Dr. Peng Zhang, de Alibaba Qwen Lab, compartió cómo su equipo está desarrollando modelos de vídeo de gran tamaño capaces de generar humanos digitales expresivos con movimientos y control más naturales. Presentó Wan S2V y Wan Animate, que utilizan referencias de audio o movimiento para producir habla, gestos y animaciones realistas, abordando las limitaciones de la generación basada exclusivamente en texto.

Fig. 4. Peng Zhang explicando cómo los modelos de vídeo de gran tamaño pueden impulsar a los humanos digitales.
El Dr. Zhang también habló de los avances hacia avatares interactivos en tiempo real, incluida la clonación zero-shot de la apariencia y el movimiento, así como de modelos ligeros capaces de animar un rostro directamente desde la señal de una cámara en directo, acercando los humanos digitales fotorrealistas a una ejecución fluida en dispositivos cotidianos.
De la percepción a la acción: la era de la inteligencia incorporada#
Uno de los temas principales de YV25 Shenzhen fue el cambio de modelos de visión que simplemente ven el mundo a sistemas capaces de actuar en él. En otras palabras, la percepción ya no es el final del flujo de trabajo, sino que se está convirtiendo en el inicio de la acción.
Por ejemplo, en su ponencia, Hu Chunxu, de D-Robotics, describió cómo sus kits de desarrollo y soluciones SoC (sistema en chip) integran la percepción, el control del movimiento en tiempo real y la toma de decisiones en una pila unificada de hardware y software. Al tratar la percepción y la acción como un bucle continuo de retroalimentación, en lugar de como etapas separadas, su enfoque permite crear robots que se mueven, se adaptan e interactúan con mayor fiabilidad en entornos reales.

Fig. 5. Demostración de D-Robotics en YOLO Vision 2025 en Shenzhen, China.
Alex Zhang, de Baidu Paddle, se hizo eco de esta idea en su charla y explicó cómo YOLO y PaddleOCR colaboran para detectar objetos y, a continuación, interpretar el texto y la estructura que los rodean. Esto permite a los sistemas convertir imágenes y documentos en información útil y estructurada para tareas como la logística, las inspecciones y el procesamiento automatizado.
Inteligencia en el perímetro: IA eficiente para cualquier dispositivo#
Otro tema interesante de YV25 Shenzhen fue cómo la IA para visión está volviéndose más eficiente y capaz en los dispositivos periféricos.
Paul Jung, de DEEPX, habló sobre la implementación de modelos YOLO directamente en hardware integrado, reduciendo la dependencia de la nube. Al centrarse en un bajo consumo energético, una inferencia optimizada y un ajuste de modelos adaptado al hardware, DEEPX permite la percepción en tiempo real para drones, robots móviles y sistemas industriales que operan en entornos dinámicos.
Del mismo modo, Liu Lingfei, de Moore Threads, compartió cómo la plataforma Moore Threads E300 integra el procesamiento de la unidad central (CPU), la unidad de procesamiento gráfico (GPU) y la unidad de procesamiento neuronal (NPU) para ofrecer inferencia de visión de alta velocidad en dispositivos compactos.
La plataforma puede ejecutar varios flujos de YOLO con altas frecuencias de fotogramas, y su cadena de herramientas simplifica tareas como la cuantización, la compilación estática y el ajuste del rendimiento. Moore Threads también ha publicado como código abierto un amplio conjunto de modelos de visión por ordenador y ejemplos de implementación para reducir las barreras de entrada de los desarrolladores.
Fusionar visión y lenguaje para sistemas de IA más inteligentes#
Hasta hace poco, crear un único modelo capaz de comprender imágenes e interpretar el lenguaje requería grandes arquitecturas de transformer costosas de ejecutar. En YV25 Shenzhen, Yue Ziyin, de Yuanshi Intelligence, presentó RWKV, una arquitectura que combina las capacidades de razonamiento con contexto largo de los transformers con la eficiencia de los modelos recurrentes.
Explicó cómo Vision-RWKV aplica este diseño a la visión por ordenador procesando las imágenes de una forma que escala linealmente con la resolución. Esto lo hace adecuado para entradas de alta resolución y para dispositivos periféricos con recursos de computación limitados.
Yue también mostró cómo se utiliza RWKV en sistemas de visión y lenguaje, donde las características de las imágenes se combinan con la comprensión del texto para ir más allá de la detección de objetos e interpretar escenas, documentos y el contexto del mundo real.

Fig. 6. Yue Ziyin hablando sobre las aplicaciones de RWKV.
Stands y demostraciones en directo que dieron vida a la IA para visión#
Mientras que las charlas del escenario miraban hacia el futuro de la IA para visión, los stands del recinto mostraban cómo ya se utiliza hoy. Los asistentes pudieron ver modelos ejecutándose en directo, comparar opciones de hardware y hablar directamente con los equipos que desarrollan estos sistemas.
Este es un vistazo a la tecnología expuesta:
- Plataformas de desarrollo y prototipado: Seeed, M5Stack e Infermove presentaron placas de desarrollo compactas y kits de iniciación que facilitan la experimentación con aplicaciones basadas en YOLO y permiten pasar rápidamente de las ideas a demostraciones funcionales.
- Hardware periférico de alto rendimiento: Hailo, DEEPX, Intel y Moore Threads demostraron chips y módulos diseñados para una inferencia rápida y eficiente.
- Flujos de trabajo de visión y lenguaje: Baidu Paddle y RWKV destacaron pilas de software capaces de detectar objetos y también leer, interpretar y razonar sobre lo que aparece en una imagen o un documento.
- Herramientas de código abierto y de la comunidad: Ultralytics y Datawhale conectaron con los desarrolladores mediante demostraciones de modelos en directo, consejos de entrenamiento y orientación práctica, reforzando la idea de que el conocimiento compartido acelera la innovación.

Fig. 7. Un vistazo al stand de M5Stack en YV25 Shenzhen.
Conectar con la comunidad de IA para visión#
Además de toda la emocionante tecnología, una de las mejores partes de YV25 Shenzhen fue volver a reunir presencialmente a la comunidad de visión por ordenador y al equipo de Ultralytics. Durante todo el día, la gente se reunió alrededor de las demostraciones, compartió ideas durante las pausas para el café y continuó las conversaciones mucho después de que terminaran las charlas.
Investigadores, ingenieros, estudiantes y creadores intercambiaron impresiones, hicieron preguntas y compartieron experiencias del mundo real, desde la implementación hasta el entrenamiento de modelos. Y gracias a Cinco Jotas, de Grupo Osborne, incluso llevamos un toque de la cultura española al evento con jamón recién cortado, creando un momento de conexión muy especial. Un lugar precioso, un público entusiasta y una sensación compartida de impulso hicieron que el día fuera realmente especial.
Conclusiones clave#
Desde ponencias inspiradoras hasta demostraciones prácticas, YOLO Vision 2025 Shenzhen capturó el espíritu de innovación que define a la comunidad de Ultralytics. Durante todo el día, ponentes y asistentes intercambiaron ideas, exploraron nuevas tecnologías y conectaron en torno a una visión compartida del futuro de la IA. Juntos, se marcharon llenos de energía y preparados para lo que viene con Ultralytics YOLO.
Reimagina lo que es posible con la IA y la visión por ordenador. Únete a nuestra comunidad y explora nuestro repositorio de GitHub para descubrir más. Obtén más información sobre aplicaciones como la visión por ordenador en la agricultura y la IA en el comercio minorista. Explora nuestras opciones de licencia y empieza hoy mismo con la visión por ordenador.









