Comparativa de Ultralytics YOLO11 con modelos YOLO anteriores
Compara Ultralytics YOLOv8, YOLOv9, YOLOv10 y Ultralytics YOLO11 para entender cómo han evolucionado y mejorado estos modelos entre 2023 y 2025.

Desde automatizar tareas cotidianas hasta ayudar a tomar decisiones fundamentadas en tiempo real, la inteligencia artificial (AI) está transformando el futuro de diversos sectores. Un área especialmente fascinante de la AI es la visión por ordenador, también conocida como vision AI. Se centra en permitir que las máquinas analicen e interpreten datos visuales como lo hacen las personas.
En concreto, los modelos de visión por ordenador impulsan innovaciones que mejoran tanto la seguridad como la eficiencia. Por ejemplo, estos modelos se utilizan en vehículos autónomos para detectar peatones y en cámaras de seguridad para vigilar instalaciones las 24 horas del día.
Algunos de los modelos de visión por ordenador más conocidos son los modelos YOLO (You Only Look Once), famosos por sus capacidades de detección de objetos en tiempo real. Con el tiempo, los modelos YOLO han mejorado y cada nueva versión ofrece un rendimiento y una flexibilidad superiores.
Las versiones más recientes, como Ultralytics YOLO11, pueden realizar diversas tareas, como segmentación de instancias, clasificación de imágenes, estimación de poses y seguimiento de múltiples objetos, con más precisión, velocidad y exactitud que nunca.
En este artículo compararemos Ultralytics YOLOv8, YOLOv9, YOLOv10 y Ultralytics YOLO11 para comprender mejor cómo han evolucionado estos modelos. Analizaremos sus características principales, los resultados de las pruebas comparativas y las diferencias de rendimiento. ¡Empecemos!
Una visión general de Ultralytics YOLOv8#
YOLOv8, lanzado por Ultralytics el 10 de enero de 2023, supuso un importante avance con respecto a los modelos YOLO anteriores. Está optimizado para realizar detecciones precisas en tiempo real y combina enfoques probados con actualizaciones innovadoras para ofrecer mejores resultados.
Además de la detección de objetos, también admite las siguientes tareas de visión por ordenador: segmentación de instancias, estimación de poses, detección de objetos con cajas delimitadoras orientadas (OBB) y clasificación de imágenes. Otra característica importante de Ultralytics YOLOv8 es que está disponible en cinco variantes de modelo diferentes —Nano, Small, Medium, Large y X—, para que puedas elegir el equilibrio adecuado entre velocidad y precisión según tus necesidades.
Gracias a su versatilidad y sólido rendimiento, Ultralytics YOLOv8 puede utilizarse en muchas aplicaciones del mundo real, como sistemas de seguridad, ciudades inteligentes, sanidad y automatización industrial.

Fig. 1. Gestión del aparcamiento en ciudades inteligentes con YOLOv8.
Características principales de Ultralytics YOLOv8#
Estas son algunas de las otras características principales de Ultralytics YOLOv8:
- Arquitectura de detección mejorada: Ultralytics YOLOv8 utiliza un backbone CSPDarknet mejorado. Este backbone está optimizado para la extracción de características, el proceso de identificar y capturar patrones o detalles importantes de las imágenes de entrada que ayudan al modelo a realizar predicciones precisas.
- Cabeza de detección: Utiliza un diseño sin anclajes y desacoplado, lo que significa que no depende de formas predefinidas de cajas delimitadoras (anclajes), sino que aprende a predecir directamente la ubicación de los objetos. Gracias a la configuración desacoplada, las tareas de clasificar qué es el objeto y predecir dónde se encuentra (regresión) se gestionan por separado, lo que ayuda a mejorar la precisión y acelera el entrenamiento.
- Equilibra precisión y velocidad: Este modelo logra una precisión impresionante mientras mantiene tiempos de inferencia rápidos, por lo que resulta adecuado tanto para entornos cloud como edge.
- Fácil de usar: YOLOv8 está diseñado para que puedas empezar fácilmente: puedes comenzar a realizar predicciones y ver resultados en tan solo unos minutos usando el paquete de Python de Ultralytics.
YOLOv9 se centra en la eficiencia computacional#
YOLOv9 fue lanzado el 21 de febrero de 2024 por Chien-Yao Wang y Hong-Yuan Mark Liao, del Institute of Information Science de Academia Sinica, Taiwán. Admite tareas como la detección de objetos y la segmentación de instancias.
Este modelo se basa en Ultralytics YOLOv5 e introduce dos innovaciones principales: Información de gradiente programable (PGI) y Red de agregación de capas eficiente generalizada (GELAN).
PGI ayuda a YOLOv9 a conservar información importante mientras procesa los datos a través de sus capas, lo que se traduce en resultados más precisos. Por su parte, GELAN mejora la forma en que el modelo utiliza sus capas, aumentando el rendimiento y la eficiencia computacional. Gracias a estas mejoras, YOLOv9 puede gestionar tareas en tiempo real en dispositivos edge y aplicaciones móviles, donde los recursos informáticos suelen ser limitados.

Fig. 2. Comprender cómo GELAN mejora la precisión de YOLOv9.
Características principales de YOLOv9#
Estas son algunas de las otras características principales de YOLOv9:
- Alta precisión con eficiencia: YOLOv9 ofrece una gran precisión de detección sin consumir demasiada potencia de cálculo, por lo que es una excelente opción cuando los recursos son limitados.
- Modelos ligeros: Las variantes de modelo ligeras de YOLOv9 están optimizadas para implementaciones edge y móviles.
- Fácil de usar: YOLOv9 es compatible con el paquete de Python de Ultralytics, por lo que es sencillo configurarlo y ejecutarlo en distintos entornos, tanto si utilizas código como la línea de comandos.
YOLOv10 permite detectar objetos sin NMS#
YOLOv10 fue presentado el 23 de mayo de 2024 por investigadores de la Universidad de Tsinghua y se centra en la detección de objetos en tiempo real. Aborda las limitaciones de las versiones anteriores de YOLO eliminando la necesidad de la supresión de no máximos (NMS), una fase de posprocesamiento utilizada para eliminar detecciones duplicadas, y perfeccionando el diseño general del modelo. El resultado es una detección de objetos más rápida y eficiente, manteniendo al mismo tiempo una precisión de vanguardia.
Una parte fundamental de lo que hace posible este proceso es un enfoque de entrenamiento conocido como asignaciones coherentes de etiquetas duales. Combina dos estrategias: una que permite que varias predicciones aprendan del mismo objeto (de uno a muchos) y otra que se centra en elegir la mejor predicción individual (de uno a uno). Como ambas estrategias siguen las mismas reglas de correspondencia, el modelo aprende a evitar los duplicados por sí solo, por lo que no se necesita NMS.

Fig. 3. YOLOv10 utiliza asignaciones coherentes de etiquetas duales para el entrenamiento sin NMS.
La arquitectura de YOLOv10 también utiliza un backbone CSPNet mejorado para aprender características de forma más eficaz y un neck PAN (Red de agregación de rutas) que combina información de distintas capas, lo que le permite detectar mejor tanto objetos pequeños como grandes. Estas mejoras hacen posible utilizar YOLOv10 en aplicaciones del mundo real de los sectores de la fabricación, el comercio minorista y la conducción autónoma.
Características principales de YOLOv10#
Estas son algunas de las otras características destacadas de YOLOv10:
-
Convoluciones con kernels grandes: El modelo utiliza convoluciones con kernels grandes para capturar más contexto de áreas más amplias de la imagen, lo que le ayuda a comprender mejor la escena general.
-
Módulos de autoatención parcial: El modelo incorpora módulos de autoatención parcial para centrarse en las partes más importantes de la imagen sin utilizar demasiada potencia de cálculo, aumentando así el rendimiento de forma eficiente.
-
Variante de modelo única: Además de los tamaños habituales de YOLOv10 —Nano, Small, Medium, Large y X—, también existe una versión especial llamada YOLOv10b (Balanced). Es un modelo más ancho, lo que significa que procesa más características en cada capa; esto ayuda a mejorar la precisión manteniendo el equilibrio entre velocidad y tamaño.
-
Fácil de usar: YOLOv10 es compatible con el paquete de Python de Ultralytics, por lo que es fácil de utilizar.
Ultralytics YOLO11: mayor velocidad y precisión#
Este año, el 30 de septiembre, Ultralytics presentó oficialmente YOLO11 —uno de los modelos más recientes de la serie YOLO— en su evento híbrido anual, YOLO Vision 2024 (YV24).
Este lanzamiento introdujo mejoras significativas con respecto a las versiones anteriores. Ultralytics YOLO11 es más rápido, preciso y eficiente. Admite toda la gama de tareas de visión por ordenador con las que están familiarizados los usuarios de YOLOv8, incluida la detección de objetos, la segmentación de instancias y la clasificación de imágenes. También mantiene la compatibilidad con los flujos de trabajo de YOLOv8, lo que facilita una transición fluida a la nueva versión.
Además, Ultralytics YOLO11 está diseñado para satisfacer una amplia variedad de necesidades informáticas, desde dispositivos edge ligeros hasta potentes sistemas cloud. El modelo está disponible tanto en versiones de código abierto como empresariales, por lo que se adapta a distintos casos de uso.
Es una excelente opción para tareas de precisión, como el análisis de imágenes médicas y la detección por satélite, así como para aplicaciones más amplias en vehículos autónomos, agricultura y sanidad.

Fig. 4. Uso de Ultralytics YOLO11 para detectar, contar y seguir el tráfico.
Características principales de Ultralytics YOLO11#
Estas son algunas de las otras características exclusivas de Ultralytics YOLO11:
- Detección rápida y eficiente: Ultralytics YOLO11 incorpora una cabeza de detección diseñada para ofrecer una latencia mínima, centrada en la velocidad de las capas de predicción finales sin comprometer el rendimiento.
- Extracción de características mejorada: Una arquitectura optimizada de backbone y neck mejora la extracción de características, lo que da lugar a predicciones más precisas.
- Implementación fluida en distintas plataformas: Ultralytics YOLO11 está optimizado para ejecutarse de forma eficiente en dispositivos edge, plataformas cloud y GPU NVIDIA, lo que garantiza su adaptabilidad en distintos entornos.
Evaluación comparativa de los modelos YOLO en el conjunto de datos COCO#
Al explorar distintos modelos, no siempre es fácil compararlos simplemente observando sus características. Ahí es donde entran en juego las pruebas comparativas. Al ejecutar todos los modelos con el mismo conjunto de datos, podemos medir y comparar objetivamente su rendimiento. Veamos cómo funciona cada modelo en el conjunto de datos COCO.
Al comparar modelos YOLO, cada nueva versión aporta mejoras notables en precisión, velocidad y flexibilidad. En particular, YOLO11m da un gran salto, ya que utiliza un 22 % menos de parámetros que YOLOv8m, lo que significa que es más ligero y rápido de ejecutar. Además, a pesar de su menor tamaño, logra una precisión media promedio (mAP) superior en el conjunto de datos COCO. Esta métrica mide la eficacia con la que el modelo detecta y localiza objetos, por lo que un mAP más alto indica predicciones más precisas.

Fig. 5. Evaluación comparativa de YOLO11 y otros modelos YOLO en el conjunto de datos COCO.
Pruebas y comparación de modelos YOLO en un vídeo#
Veamos cómo funcionan estos modelos en una situación del mundo real.
Para comparar YOLOv8, YOLOv9, YOLOv10 y YOLO11, los cuatro se ejecutaron con el mismo vídeo de tráfico utilizando un umbral de confianza de 0,3 (el modelo solo muestra detecciones cuando tiene al menos un 30 % de confianza en que ha identificado correctamente un objeto) y un tamaño de imagen de 640 para realizar una evaluación justa. Los resultados de detección y seguimiento de objetos destacaron diferencias clave en precisión de detección, velocidad y exactitud.
Desde el primer fotograma, YOLO11 detectó vehículos grandes, como camiones, que YOLOv10 no detectó. YOLOv8 y YOLOv9 mostraron un rendimiento aceptable, pero variaba en función de las condiciones de iluminación y del tamaño de los objetos. Los vehículos más pequeños y lejanos siguieron siendo un reto para todos los modelos, aunque YOLO11 también mostró mejoras apreciables en esas detecciones.

Fig. 6. Comparación de YOLOv8, YOLOv9, YOLOv10 y YOLO11.
En cuanto a la velocidad, todos los modelos funcionaron entre 10 y 20 milisegundos por fotograma, suficiente para gestionar tareas en tiempo real a más de 50 FPS. Por un lado, Ultralytics YOLOv8 y YOLOv9 proporcionaron detecciones constantes y fiables durante todo el vídeo. Curiosamente, YOLOv10, diseñado para ofrecer una latencia menor, fue más rápido, pero mostró algunas inconsistencias al detectar determinados tipos de objetos.
Ultralytics YOLO11, por su parte, destacó por su precisión y ofreció un sólido equilibrio entre velocidad y exactitud. Aunque ninguno de los modelos funcionó perfectamente en todos los fotogramas, la comparación en paralelo demostró claramente que YOLO11 ofrecía el mejor rendimiento general.
¿Qué modelo YOLO es el mejor para las tareas de visión por ordenador?#
La selección de un modelo para un proyecto depende de sus requisitos específicos. Por ejemplo, algunas aplicaciones pueden dar prioridad a la velocidad, mientras que otras pueden requerir una mayor precisión o estar sujetas a limitaciones de implementación que influyan en la decisión.
Otro factor importante es el tipo de tareas de visión por ordenador que necesitas abordar. Si buscas una mayor flexibilidad para distintas tareas, YOLOv8 y YOLO11 son buenas opciones.
Elegir YOLOv8 o YOLO11 depende realmente de tus necesidades. YOLOv8 es una opción sólida si estás empezando en la visión por ordenador y valoras una comunidad más amplia, más tutoriales y numerosas integraciones de terceros.
Por otro lado, si buscas un rendimiento de vanguardia con mayor precisión y velocidad, Ultralytics YOLO11 es la mejor opción, aunque cuenta con una comunidad más pequeña y menos integraciones porque es un lanzamiento más reciente.
Conclusiones clave#
Desde Ultralytics YOLOv8 hasta Ultralytics YOLO11, la evolución de la serie de modelos YOLO refleja un impulso constante hacia modelos de visión por ordenador más inteligentes. Cada versión de YOLO aporta mejoras significativas en velocidad, precisión y exactitud.
A medida que la visión por ordenador continúa avanzando, estos modelos ofrecen soluciones fiables para retos del mundo real, desde la detección de objetos hasta los sistemas autónomos. El desarrollo continuo de los modelos YOLO demuestra cuánto ha progresado este campo y cuánto más podemos esperar en el futuro.
Para obtener más información sobre AI, visita nuestro repositorio de GitHub y participa en nuestra comunidad. Descubre los avances en distintos sectores, desde la vision AI en la fabricación hasta la visión por ordenador en la sanidad. Consulta nuestras opciones de licencia para empezar hoy mismo tus proyectos de vision AI.






