La evolución de la detección de objetos y los modelos YOLO de Ultralytics
Acompáñanos a echar la vista atrás a la evolución de la detección de objetos. Nos centraremos en cómo han avanzado los modelos YOLO (You Only Look Once) en los últimos años.

Computer vision es una subdisciplina de la inteligencia artificial (IA) que se centra en enseñar a las máquinas a ver y comprender imágenes y vídeos, de manera similar a como los humanos perciben el mundo real. Si bien recognizing objects o identifying actions es algo natural para los humanos, estas tareas requieren computer vision techniques específicas y especializadas cuando se trata de máquinas. Por ejemplo, una tarea clave en la visión por ordenador es la object detection, que consiste en identificar y localizar objetos dentro de imágenes o vídeos.
Desde la década de 1960, los investigadores han estado trabajando en la mejora de la capacidad de los ordenadores para detect objects. Los primeros métodos, como la template matching, consistían en deslizar una plantilla predefinida por una imagen para encontrar coincidencias. Aunque innovadores, estos enfoques tenían dificultades con los cambios en el object size, orientation y la iluminación. Hoy en día, contamos con advanced models como Ultralytics YOLO11, capaces de detectar objetos incluso pequeños y parcialmente ocultos, conocidos como objetos ocluidos, con una precisión impresionante.
A medida que la computer vision sigue evolucionando, resulta importante echar la vista atrás para comprobar cómo se han desarrollado estas tecnologías. En este artículo, exploraremos la evolución de la object detection y arrojaremos luz sobre la transformación de los YOLO (You Only Look Once) models. ¡Empecemos!
Los orígenes de la visión artificial#
Antes de sumergirnos en la object detection, echemos un vistazo a cómo comenzó la computer vision. Los origins of computer vision se remontan a finales de los años 50 y principios de los 60, cuando los científicos empezaron a investigar cómo procesa el cerebro la información visual. En experimentos con gatos, los investigadores David Hubel y Torsten Wiesel descubrieron que el cerebro reacciona ante patrones sencillos como bordes y líneas. Esto sentó las bases de la idea detrás de la feature extraction, el concepto de que los sistemas visuales detectan y reconocen características básicas en las imágenes, como los bordes, antes de pasar a patrones más complejos.

Fig 1. Comprender cómo reacciona el cerebro de un gato ante barras de luz ayudó a desarrollar la extracción de características en la visión por ordenador.
Por la misma época, surgió nueva tecnología capaz de convertir imágenes físicas en formatos digitales, lo que despertó el interés por la forma en que las máquinas podían procesar la información visual. En 1966, el proyecto de verano de visión del Instituto Tecnológico de Massachusetts (MIT) dio un paso más allá. Aunque el proyecto no tuvo un éxito rotundo, su objetivo era crear un sistema capaz de separar el primer plano del fondo en las images. Para muchos en la vision AI community, este proyecto marca el inicio oficial de la computer vision como campo científico.
Entender la historia de la detección de objetos#
A medida que la computer vision avanzaba a finales de los 90 y principios de los 2000, los métodos de object detection pasaron de técnicas básicas como la coincidencia de plantillas a enfoques más avanzados. Uno de los métodos más populares fue Haar Cascade, que se generalizó para tareas como la face detection. Funcionaba escaneando imágenes con una ventana deslizante, comprobando características específicas como bordes o texturas en cada sección de la imagen y combinando después estas características para detect objects como rostros. Haar Cascade era mucho más rápido que los métodos anteriores.

Fig 2. Uso de Haar Cascade para la detección de rostros.
Junto con estos, también se introdujeron métodos como el histograma de gradientes orientados (HOG) y las máquinas de vectores soporte (SVM). HOG utilizaba la técnica de la ventana deslizante para analizar cómo cambiaban la luz y las sombras en pequeñas secciones de una imagen, ayudando a identify objects en función de sus formas. A continuación, las SVM clasificaban estas características para determinar la identidad del objeto. Estos métodos mejoraron la precisión, pero seguían teniendo dificultades en entornos reales y eran más lentos en comparación con las técnicas actuales.
La necesidad de una detección de objetos en tiempo real#
En la década de 2010, el auge del deep learning y de las Convolutional Neural Networks (CNNs) trajo consigo un cambio radical en la object detection. Las CNN permitieron a los ordenadores aprender automáticamente características importantes a partir de grandes cantidades de data, lo que hizo que la detección fuera mucho más precisa.
Los primeros modelos como R-CNN (Region-based Convolutional Neural Networks) supusieron una gran mejora en la precision, ayudando a identificar objetos con mayor precisión que los métodos anteriores.
Sin embargo, estos modelos eran lentos porque procesaban las imágenes en múltiples fases, lo que los hacía poco prácticos para aplicaciones en tiempo real en ámbitos como los self-driving cars o la video surveillance.
Con el objetivo de ganar velocidad, se desarrollaron modelos más eficientes. Modelos como Fast R-CNN y Faster R-CNN ayudaron a perfeccionar la selección de las regiones de interés y a reducir el número de pasos necesarios para la detección. Aunque esto hizo que la detección de objetos fuera más rápida, seguía sin ser suficiente para muchas real-world applications que requerían resultados instantáneos. La creciente demanda de detección en tiempo real impulsó el desarrollo de soluciones aún más rápidas y eficientes que pudieran equilibrar tanto la velocidad como la precisión.

Fig 3. Comparación de las velocidades de R-CNN, Fast R-CNN y Faster R-CNN.
Modelos YOLO (You Only Look Once): Un hito importante#
YOLO es un modelo de object detection que redefinió la visión por ordenador al permitir la detección en tiempo real de multiple objects en imágenes y vídeos, lo que lo hace bastante único frente a los métodos de detección anteriores. En lugar de analizar cada objeto detectado de forma individual, YOLO’s architecture trata la detección de objetos como una única tarea, prediciendo tanto la ubicación como la clase de los objetos de una sola vez mediante el uso de CNN.
El modelo funciona dividiendo una imagen en una cuadrícula, donde cada parte se encarga de detectar objetos en su área correspondiente. Realiza múltiples predictions para cada sección y filtra los resultados con menor confianza, conservando únicamente los precisos.

Fig 4. Resumen del funcionamiento de YOLO.
La introducción de YOLO en las computer vision applications hizo que la detección de objetos fuera mucho más rápida y eficiente que en los modelos anteriores. Gracias a su velocidad y precisión, YOLO se convirtió rápidamente en una opción muy popular para soluciones en tiempo real en industrias como la fabricación, la sanidad y la robótica.
Otro punto importante a destacar es que, como YOLO era de código abierto, los desarrolladores e investigadores pudieron mejorarlo continuamente, lo que dio lugar a versiones aún más avanzadas.
El camino desde YOLO hasta Ultralytics YOLO11#
Los modelos YOLO han mejorado constantemente con el paso del tiempo, basándose en los avances de cada versión. Junto con un mejor rendimiento, estas mejoras han hecho que los modelos sean más fáciles de usar para personas con diferentes niveles de experiencia técnica.
Por ejemplo, cuando se introdujo Ultralytics YOLOv5, el deploying models se simplificó con PyTorch, lo que permitió que un abanico más amplio de usuarios pudiera trabajar con IA avanzada. Combinó precisión y facilidad de uso, dando a más personas la capacidad de implementar la detección de objetos sin necesidad de ser expertas en programación.

Fig 5. La evolución de los modelos YOLO.
Ultralytics YOLOv8 continuó con este progreso al añadir compatibilidad con tareas como la segmentación de instancias y dotar a los modelos de una mayor flexibilidad. Resultó más sencillo utilizar YOLO tanto para aplicaciones básicas como complejas, haciéndolo útil en una gran variedad de escenarios.
Con el modelo más reciente, Ultralytics YOLO11, se han introducido nuevas optimizaciones. Al reducir el número de parameters y mejorar al mismo tiempo la precisión, ahora resulta más eficiente para tareas en tiempo real. Tanto si eres un desarrollador experimentado como si te estás iniciando en la IA, YOLO11 ofrece un enfoque avanzado de la detección de objetos que resulta fácilmente accesible.
Conociendo Ultralytics YOLO11: Nuevas funciones y mejoras#
YOLO11, presentado en el evento híbrido anual de Ultralytics, YOLO Vision 2024 (YV24), es compatible con las mismas computer vision tasks que YOLOv8, como la detección de objetos, la segmentación de instancias, la clasificación de imágenes y la pose estimation. Así pues, los usuarios pueden cambiar fácilmente a este nuevo modelo sin necesidad de ajustar sus flujos de trabajo. Además, la arquitectura mejorada de YOLO11 hace que las predicciones sean aún más precisas. De hecho, YOLO11m alcanza una precisión media superior (mAP) en el COCO dataset con un 22% menos de parámetros que YOLOv8m.
YOLO11 también está diseñado para ejecutarse de forma eficiente en una range of platforms, desde smartphones y otros dispositivos de borde hasta sistemas en la nube más potentes. Esta flexibilidad garantiza un rendimiento fluido en diferentes hardware setups para aplicaciones en tiempo real. Además, YOLO11 es más rápido y eficiente, lo que reduce los costes computacionales y acelera los tiempos de inferencia. Tanto si utilizas el Ultralytics Python package como la no-code Ultralytics HUB, integrar YOLO11 en tus flujos de trabajo actuales es muy sencillo.
El futuro de los modelos YOLO y la detección de objetos#
El impacto de la detección de objetos avanzada en aplicaciones en tiempo real y edge AI ya se nota en todos los sectores. A medida que sectores como el petróleo y el gas, la sanidad y el retail dependen cada vez más de la IA, la demanda de una detección de objetos rápida y precisa sigue aumentando. Ultralytics YOLO11 pretende responder a esta demanda permitiendo una detección de alto rendimiento incluso en dispositivos con potencia de cálculo limitada.
A medida que crece la edge AI, es probable que los modelos de detección de objetos como Ultralytics YOLO11 se vuelvan aún más esenciales para la toma de decisiones en tiempo real en entornos donde la velocidad y la precisión son críticas. Con las continuas mejoras en diseño y adaptabilidad, el futuro de la detección de objetos apunta a traer aún más innovaciones en una variedad de aplicaciones.
Conclusiones clave#
La detección de objetos ha recorrido un largo camino, evolucionando desde métodos sencillos hasta las técnicas avanzadas de aprendizaje profundo que vemos hoy en día. Los modelos YOLO han estado en el centro de este progreso, ofreciendo una detección en tiempo real más rápida y precisa en diferentes industrias. Ultralytics YOLO11 se basa en este legado, mejorando la eficiencia, reduciendo los costes computacionales y mejorando la precisión, lo que lo convierte en una opción fiable para una variedad de aplicaciones en tiempo real. Con los continuos avances en IA y visión por ordenador, el futuro de la detección de objetos parece brillante, con margen para aún más mejoras en velocidad, precisión y adaptabilidad.
¿Tienes curiosidad por la IA? ¡Mantente en contacto con nuestra comunidad para seguir aprendiendo! Echa un vistazo a nuestro repositorio de GitHub para descubrir cómo estamos utilizando la IA para crear soluciones innovadoras en sectores como la fabricación y la atención médica. 🚀






