Ultralytics YOLO27:
IA visual

Historia de los modelos de visión

Explora la historia, los logros, los desafíos y las futuras direcciones de los modelos de visión.

MOMostafa Ibrahim5 min read
Historia de los modelos de visión

Qué es la visión por ordenador#

Imagina entrar en una tienda donde una cámara identifica tu rostro, analiza tu estado de ánimo y sugiere productos adaptados a tus preferencias, todo en tiempo real. Esto no es ciencia ficción, sino una realidad posible gracias a los modelos de visión modernos. Según un informe de Fortune Business Insight, el tamaño del mercado mundial de la visión por ordenador estaba valorado en 20,31 mil millones de USD en 2023 y se prevé que crezca de 25,41 mil millones de USD en 2024 a 175,72 mil millones de USD en 2032, lo que refleja los rápidos avances y la creciente adopción de esta tecnología en diversos sectores.

El campo de la visión por ordenador permite a los ordenadores detectar, identificar y analizar objetos dentro de imágenes. Al igual que otros campos relacionados con la IA, la visión por ordenador ha evolucionado rápidamente durante las últimas décadas y ha logrado avances extraordinarios.

La historia de la visión por ordenador es extensa. En sus primeros años, los modelos de visión por ordenador podían detectar formas y bordes sencillos, y a menudo se limitaban a tareas básicas como reconocer patrones geométricos o diferenciar entre zonas claras y oscuras. Sin embargo, los modelos actuales pueden realizar tareas complejas, como la detección de objetos en tiempo real, el reconocimiento facial e incluso la interpretación de emociones a partir de las expresiones faciales, con una precisión y eficiencia excepcionales. Esta espectacular progresión pone de relieve los enormes avances logrados en potencia computacional, sofisticación algorítmica y disponibilidad de grandes cantidades de datos para el entrenamiento.

En este artículo, exploraremos los hitos clave de la evolución de la visión por ordenador. Recorreremos sus inicios, profundizaremos en el impacto transformador de las redes neuronales convolucionales (CNNs) y examinaremos los importantes avances posteriores.

Los inicios de la visión por ordenador#

Al igual que en otros campos de la IA, el desarrollo inicial de la visión por ordenador comenzó con investigaciones fundamentales y trabajos teóricos. Un hito importante fue el trabajo pionero de Lawrence G. Roberts sobre el reconocimiento de objetos en 3D, documentado en su tesis «Machine Perception of Three-Dimensional Solids» a principios de la década de 1960. Sus contribuciones sentaron las bases para futuros avances en este campo.

Los primeros algoritmos: detección de bordes#

Las primeras investigaciones sobre visión por ordenador se centraron en técnicas de procesamiento de imágenes, como la detección de bordes y la extracción de características. Algoritmos como el operador de Sobel, desarrollado a finales de la década de 1960, estuvieron entre los primeros en detectar bordes mediante el cálculo del gradiente de intensidad de la imagen.

Una imagen que muestra la detección de bordes

Fig. 1. Una imagen que muestra la detección de bordes; el lado izquierdo muestra el objeto original y el derecho, la versión con los bordes detectados.

Técnicas como los detectores de bordes de Sobel y Canny desempeñaron un papel fundamental en la identificación de límites dentro de las imágenes, algo esencial para reconocer objetos y comprender escenas.

Aprendizaje automático y visión por ordenador#

Reconocimiento de patrones#

En la década de 1970, el reconocimiento de patrones surgió como un área clave de la visión por ordenador. Los investigadores desarrollaron métodos para reconocer formas, texturas y objetos en imágenes, lo que allanó el camino para tareas de visión más complejas.

Reconocimiento de patrones

Fig. 2. Reconocimiento de patrones.

Uno de los primeros métodos de reconocimiento de patrones consistía en la comparación con plantillas, en la que una imagen se compara con un conjunto de plantillas para encontrar la coincidencia más adecuada. Este enfoque estaba limitado por su sensibilidad a las variaciones de escala, rotación y ruido.

Comparación con una plantilla dentro de una imagen

Fig. 3. Una plantilla del lado izquierdo encontrada dentro de la imagen derecha.

Los primeros sistemas de visión por ordenador estaban condicionados por la limitada potencia computacional de la época. Los ordenadores de las décadas de 1960 y 1970 eran voluminosos, caros y tenían capacidades de procesamiento limitadas.

El aprendizaje profundo cambia las reglas del juego#

Aprendizaje profundo y redes neuronales convolucionales#

El aprendizaje profundo y las redes neuronales convolucionales (CNNs) marcaron un momento decisivo en el campo de la visión por ordenador. Estos avances han transformado drásticamente la forma en que los ordenadores interpretan y analizan los datos visuales, y han permitido una amplia variedad de aplicaciones que antes se consideraban imposibles.

¿Cómo funcionan las CNNs?#

Arquitectura de una red neuronal convolucional (CNN)

Fig. 4. Arquitectura de una red neuronal convolucional (CNN).

  1. Capas convolucionales: las CNNs utilizan capas convolucionales, un tipo de modelo de aprendizaje profundo diseñado para procesar datos estructurados en forma de cuadrícula, como imágenes o secuencias, mediante el aprendizaje automático de patrones jerárquicos, para explorar una imagen utilizando filtros o kernels. Estos filtros detectan diversas características, como bordes, texturas y colores, al deslizarse por la imagen y calcular productos escalares. Cada filtro activa patrones específicos de la imagen, lo que permite al modelo aprender características jerárquicas.
  2. Funciones de activación: después de la convolución, las funciones de activación como ReLU (Unidad lineal rectificada), una función de activación popular en el aprendizaje profundo que devuelve directamente la entrada si es positiva y, en caso contrario, cero, ayudan a las redes neuronales a aprender relaciones no lineales en los datos de forma eficiente. Esto ayuda a la red a aprender patrones y representaciones complejos.
  3. Capas de pooling: las capas de pooling proporcionan una operación de submuestreo que reduce la dimensionalidad del mapa de características, lo que ayuda a extraer las características más relevantes y a reducir el coste computacional y el sobreajuste.
  4. Capas totalmente conectadas: las capas finales de una CNN son capas totalmente conectadas que interpretan las características extraídas por las capas convolucionales y de pooling para realizar predicciones. Estas capas son similares a las de las redes neuronales tradicionales.

Evolución de los modelos de visión basados en CNN#

El recorrido de los modelos de visión ha sido extenso y ha incluido algunos de los más destacados:

  • LeNet (1989): LeNet fue una de las primeras arquitecturas CNN, utilizada principalmente para reconocer dígitos en cheques manuscritos. Su éxito sentó las bases para CNNs más complejas y demostró el potencial del aprendizaje profundo en el procesamiento de imágenes.

  • AlexNet (2012): AlexNet superó ampliamente a los modelos existentes en la competición ImageNet, demostrando el poder del aprendizaje profundo. Este modelo utilizó activaciones ReLU, dropout y aumento de datos, estableciendo nuevos referentes en clasificación de imágenes y despertando un interés generalizado por las CNNs.

  • VGGNet (2014): mediante el uso de filtros convolucionales más pequeños (3x3), VGGNet logró resultados impresionantes en tareas de clasificación de imágenes, reforzando la importancia de la profundidad de la red para alcanzar una mayor precisión.

  • ResNet (2015): ResNet abordó el problema de degradación de las redes profundas mediante la introducción del aprendizaje residual. Esta innovación permitió entrenar redes mucho más profundas, lo que condujo a un rendimiento puntero en diversas tareas de visión por ordenador.

  • YOLO (You Only Look Once): YOLO revolucionó la detección de objetos al plantearla como un único problema de regresión, prediciendo directamente las cajas delimitadoras y las probabilidades de clase a partir de imágenes completas en una sola evaluación. Este enfoque permitió detectar objetos en tiempo real con una velocidad y precisión sin precedentes, por lo que resultó adecuado para aplicaciones que requieren un procesamiento instantáneo, como la conducción autónoma y la videovigilancia.

Aplicaciones de la visión por ordenador#

Sanidad#

Los usos de la visión por ordenador son numerosos. Por ejemplo, los modelos de visión como Ultralytics YOLOv8 se utilizan en imagen médica para detectar enfermedades como el cáncer y la retinopatía diabética. Analizan radiografías, resonancias magnéticas y tomografías computarizadas con gran precisión, e identifican anomalías en una fase temprana. Esta capacidad de detección temprana permite intervenir a tiempo y mejorar los resultados de los pacientes.

Detección de tumores cerebrales mediante Ultralytics YOLOv8

Fig. 5. Detección de tumores cerebrales mediante Ultralytics YOLOv8.

Conservación del medio ambiente#

Los modelos de visión por ordenador ayudan a supervisar y proteger especies en peligro de extinción mediante el análisis de imágenes y vídeos de hábitats naturales. Identifican y siguen el comportamiento de los animales, proporcionando datos sobre sus poblaciones y movimientos. Esta tecnología orienta las estrategias de conservación y las decisiones políticas para proteger especies como los tigres y los elefantes.

Con la ayuda de la IA de visión, también pueden supervisarse otras amenazas medioambientales, como los incendios forestales y la deforestación, lo que garantiza una respuesta rápida por parte de las autoridades locales.

Una imagen por satélite de un incendio forestal

Fig. 6. Una imagen por satélite de un incendio forestal.

Retos y futuras direcciones#

Aunque ya han logrado avances importantes, los modelos de visión se enfrentan a numerosos retos que requieren investigación continua y futuros avances debido a su extrema complejidad y a la exigente naturaleza de su desarrollo.

Interpretabilidad y explicabilidad#

Los modelos de visión, especialmente los de aprendizaje profundo, suelen considerarse «cajas negras» con una transparencia limitada. Esto se debe a que son increíblemente complejos. La falta de interpretabilidad dificulta la confianza y la rendición de cuentas, especialmente en aplicaciones críticas como la sanidad.

Requisitos computacionales#

Entrenar y desplegar modelos de IA punteros exige recursos computacionales considerables. Esto es especialmente cierto en el caso de los modelos de visión, que a menudo requieren procesar grandes cantidades de datos de imágenes y vídeos. Las imágenes y vídeos de alta definición, que se encuentran entre las entradas de entrenamiento que más datos requieren, aumentan la carga computacional. Por ejemplo, una sola imagen HD puede ocupar varios megabytes de almacenamiento, lo que hace que el proceso de entrenamiento consuma muchos recursos y tiempo.

Esto requiere hardware potente y algoritmos de visión por ordenador optimizados para gestionar los grandes volúmenes de datos y los complejos cálculos implicados en el desarrollo de modelos de visión eficaces. La investigación sobre arquitecturas más eficientes, compresión de modelos y aceleradores de hardware como las GPUs y TPUs son áreas clave que impulsarán el futuro de los modelos de visión.

Estas mejoras pretenden reducir las exigencias computacionales y aumentar la eficiencia del procesamiento. Además, aprovechar modelos preentrenados avanzados como Ultralytics YOLOv8 puede reducir significativamente la necesidad de realizar un entrenamiento exhaustivo, agilizando el proceso de desarrollo y mejorando la eficiencia.

Un panorama en constante evolución#

Hoy en día, las aplicaciones de los modelos de visión están muy extendidas, desde la sanidad, por ejemplo para detectar tumores, hasta usos cotidianos como la supervisión del tráfico. Estos modelos avanzados han aportado innovación a innumerables sectores al ofrecer una precisión, eficiencia y capacidades mejoradas que antes eran inimaginables.

A medida que la tecnología sigue avanzando, el potencial de los modelos de visión para innovar y mejorar distintos aspectos de la vida y la industria continúa siendo ilimitado. Esta evolución constante subraya la importancia de mantener la investigación y el desarrollo en el campo de la visión por ordenador.

¿Te interesa el futuro de la IA de visión? Para obtener más información sobre los últimos avances, consulta la documentación de Ultralytics y echa un vistazo a sus proyectos en Ultralytics GitHub y YOLOv8 GitHub. Además, para conocer las aplicaciones de la IA en distintos sectores, las páginas de soluciones sobre coches autónomos y fabricación ofrecen información especialmente útil.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático