Todo lo que necesitas saber sobre la visión artificial en 2025
Descubre cómo la visión artificial está transformando los sectores con tareas impulsadas por IA, como la detección de objetos, la clasificación de imágenes y la estimación de poses.

Hace veinte años, la idea de que las máquinas y los ordenadores pudieran ver y comprender el mundo era pura ciencia ficción. Hoy, gracias a los avances en inteligencia artificial (AI), ese concepto se ha convertido en una realidad. En particular, la visión por ordenador (CV), una rama de la AI, permite a las máquinas comprender y analizar imágenes y vídeos. Ya sea para identificar objetos en tiempo real, mejorar los sistemas de seguridad o automatizar tareas complejas, su potencial está ampliando los límites de lo posible.
La visión por ordenador está dando forma rápidamente al futuro de la tecnología, ya que diversos sectores exploran distintas formas de adoptar sus capacidades únicas. El tamaño del mercado mundial de la visión por ordenador alcanzó los 19,83 mil millones de dólares en 2024 y se prevé que crezca un 19,8 % anual en los próximos años.

Fig. 1. Tamaño del mercado mundial de la visión por ordenador.
En este artículo analizaremos más de cerca la visión por ordenador, explicando qué es, cómo ha evolucionado y cómo funciona hoy en día. También exploraremos algunas de sus aplicaciones más interesantes. ¡Empecemos!
¿Qué es la visión por ordenador?#
La visión por ordenador es un subcampo de la AI que utiliza el aprendizaje automático y las redes neuronales para enseñar a los ordenadores a comprender el contenido de datos visuales, como imágenes o archivos de vídeo. La información obtenida de las imágenes procesadas puede utilizarse para tomar mejores decisiones. Por ejemplo, la visión por ordenador puede emplearse en el comercio minorista para realizar un seguimiento de los niveles de inventario mediante el análisis de imágenes de estanterías o para mejorar la experiencia de compra con sistemas de pago automatizados. Muchas empresas ya utilizan esta tecnología para distintas aplicaciones, desde tareas como añadir filtros a las fotos de los smartphones hasta el control de calidad en la fabricación.
Quizá te preguntes por qué existe tanta necesidad de soluciones de visión por ordenador. Las tareas que requieren una atención constante, como detectar defectos o reconocer patrones, pueden resultar difíciles para las personas. La vista puede cansarse y algunos detalles pueden pasar desapercibidos, especialmente en entornos rápidos o complejos.
Aunque las personas son buenas reconociendo objetos con distintos tamaños, colores, condiciones de iluminación o ángulos, a menudo tienen dificultades para mantener la coherencia bajo presión. En cambio, las soluciones de visión por ordenador funcionan sin parar y procesan grandes cantidades de datos visuales con rapidez y precisión. Por ejemplo, pueden analizar el tráfico en tiempo real para detectar atascos, optimizar la temporización de los semáforos o incluso identificar accidentes más rápido que un observador humano.
Conociendo la historia de la visión por ordenador#
Con el paso de los años, la visión por ordenador ha evolucionado de un concepto teórico a una tecnología fiable que impulsa la innovación en distintos sectores. Veamos algunos de los principales hitos que han definido su desarrollo:
-
Décadas de 1950 y 1960: Los investigadores comenzaron a desarrollar algoritmos para procesar y analizar datos visuales, pero el progreso fue lento debido a la limitada potencia computacional.
-
Década de 1970: Esta década trajo importantes mejoras en los algoritmos, como la transformada de Hough, que mejoró la detección de líneas y formas geométricas en imágenes. También surgió el reconocimiento óptico de caracteres (OCR), haciendo posible que las máquinas leyeran texto impreso.
-
Décadas de 1980 y 1990: El aprendizaje automático empezó a desempeñar un papel en la visión por ordenador, allanando el camino para capacidades más avanzadas y futuros avances.
-
Décadas de 2000 y 2010: El aprendizaje profundo aportó una nueva dimensión a la visión por ordenador, dotando a las máquinas de una mayor capacidad para interpretar datos visuales. Mejoró capacidades como la identificación de objetos, el análisis del movimiento y la ejecución de tareas complejas.
Hoy en día, la visión por ordenador avanza rápidamente y está transformando la forma de resolver problemas en ámbitos como la sanidad, los vehículos autónomos y las ciudades inteligentes. Los modelos Ultralytics YOLO (You Only Look Once), diseñados para tareas de visión por ordenador en tiempo real, facilitan la implementación eficaz y precisa de la AI de visión en diversos sectores. A medida que mejoran la AI y el hardware, estos modelos ayudan a las empresas a tomar decisiones más inteligentes y a optimizar sus operaciones mediante el análisis avanzado de datos visuales.
Cómo funciona la visión por ordenador#
Los sistemas de visión por ordenador utilizan redes neuronales, algoritmos inspirados en el funcionamiento del cerebro humano, para analizar imágenes. Un tipo concreto, denominado redes neuronales convolucionales (CNN), es especialmente eficaz para reconocer patrones, como bordes y formas en las imágenes.
Para simplificar los datos visuales, técnicas como el pooling se centran en las partes más importantes de una imagen, mientras que las capas adicionales procesan esta información para realizar tareas como identificar características o detectar objetos. Los modelos avanzados, como Ultralytics YOLO11, diseñados para ofrecer velocidad y precisión, hacen posible el procesamiento de imágenes en tiempo real.

Fig. 2. Ejemplo del uso de Ultralytics YOLO11 para la detección de objetos.
Una aplicación típica de visión por ordenador consta de varios pasos para transformar imágenes sin procesar en información útil. Estas son las cuatro etapas principales:
-
Adquisición de imágenes: Los datos visuales se recopilan mediante cámaras o sensores, y la calidad de las imágenes depende del tipo de sensor utilizado.
-
Procesamiento de imágenes: A continuación, los datos recopilados se mejoran mediante técnicas de preprocesamiento, como la reducción del ruido y el realce de los bordes, para facilitar su análisis.
-
Extracción de características: Se seleccionan detalles importantes, como formas y texturas, centrándose en las partes de la imagen que más importan.
-
Reconocimiento de patrones: Las características identificadas se analizan mediante aprendizaje automático para realizar tareas como detectar objetos, seguir movimientos o reconocer patrones.
Exploración de las tareas de visión por ordenador#
Puede que hayas observado que, al hablar de cómo funciona la visión por ordenador, hemos mencionado las tareas de visión por ordenador. Los modelos como Ultralytics YOLO11 están diseñados para admitir estas tareas y ofrecen soluciones rápidas y precisas para aplicaciones del mundo real. Desde detectar objetos hasta seguir sus movimientos, YOLO11 gestiona estas tareas de forma eficiente. Exploremos algunas de las principales tareas que admite y cómo funcionan.
Detección de objetos#
La detección de objetos es una tarea clave de visión por ordenador y se utiliza para identificar objetos de interés en una imagen. El resultado de una tarea de detección de objetos es un conjunto de cuadros delimitadores (rectángulos dibujados alrededor de los objetos detectados en una imagen), junto con etiquetas de clase (la categoría o el tipo de cada objeto, como «coche» o «persona») y puntuaciones de confianza (un valor numérico que indica hasta qué punto el modelo está seguro de cada detección). Por ejemplo, la detección de objetos puede utilizarse para identificar y localizar a un peatón en una calle o un coche en el tráfico.

Fig. 3. Uso de Ultralytics YOLO11 para detectar objetos.
Clasificación de imágenes#
El objetivo principal de la clasificación de imágenes es asignar una etiqueta o categoría predefinida a una imagen de entrada basándose en su contenido general. Esta tarea suele consistir en identificar el objeto o la característica predominante de la imagen. Por ejemplo, la clasificación de imágenes puede utilizarse para determinar si una imagen contiene un gato o un perro. Los modelos de visión por ordenador como YOLO11 incluso pueden entrenarse a medida para clasificar razas concretas de gatos o perros, como se muestra a continuación.

Fig. 4. Clasificación de distintas razas de gatos con YOLO11.
Segmentación de instancias#
La segmentación de instancias es otra tarea fundamental de visión por ordenador que se utiliza en diversas aplicaciones. Consiste en dividir una imagen en segmentos e identificar cada objeto individual, aunque haya varios objetos del mismo tipo. A diferencia de la detección de objetos, la segmentación de instancias va un paso más allá al delimitar los contornos precisos de cada objeto. Por ejemplo, en la fabricación y reparación de automóviles, puede ayudar a identificar y etiquetar por separado cada pieza del coche, haciendo que el proceso sea más preciso y eficiente.

Fig. 5 Segmentación de piezas de automóviles con YOLO11.
Estimación de pose#
El objetivo de la estimación de pose es determinar la posición y orientación de una persona o un objeto prediciendo la ubicación de puntos clave, como las manos, la cabeza y los codos. Esto resulta especialmente útil en aplicaciones en las que es importante comprender acciones físicas en tiempo real. La estimación de la pose humana se utiliza habitualmente en ámbitos como el análisis deportivo, la supervisión del comportamiento animal y la robótica.

Fig. 6 YOLO11 puede ayudar con la estimación de la pose humana.
Para explorar las demás tareas de visión por ordenador compatibles con YOLO11, consulta la documentación oficial de Ultralytics. En ella encontrarás información detallada sobre cómo YOLO11 gestiona tareas como el seguimiento de objetos y la detección de objetos con cuadros delimitadores orientados (OBB).
Modelos de visión por ordenador populares en la actualidad#
Aunque existen muchos modelos de visión por ordenador, la serie Ultralytics YOLO destaca por su sólido rendimiento y versatilidad. Con el tiempo, los modelos Ultralytics YOLO han mejorado y se han vuelto más rápidos, precisos y capaces de gestionar más tareas. Cuando se presentó Ultralytics YOLOv5, la implementación de modelos resultó más sencilla gracias a frameworks de AI de visión como PyTorch. Esto permitió a un mayor número de usuarios trabajar con AI de visión avanzada, combinando una gran precisión con facilidad de uso.
Después, Ultralytics YOLOv8 fue un paso más allá al añadir nuevas capacidades, como la segmentación de instancias, la estimación de pose y la clasificación de imágenes. Mientras tanto, la versión más reciente, YOLO11, ofrece un rendimiento superior en múltiples tareas de visión por ordenador. Con un 22 % menos de parámetros que YOLOv8m, YOLO11m alcanza una mayor precisión media promedio (mAP) en el conjunto de datos COCO, lo que significa que puede detectar objetos con mayor precisión y eficiencia. Tanto si eres un desarrollador experimentado como si acabas de iniciarte en la AI, YOLO11 ofrece una solución potente para tus necesidades de visión por ordenador.
El papel de la visión por ordenador en la vida cotidiana#
Antes hemos hablado de cómo los modelos de visión por ordenador, como Ultralytics YOLO11, pueden aplicarse en una amplia variedad de sectores. Ahora exploremos más casos de uso que están cambiando nuestra vida diaria.
La AI de visión en la sanidad#
Existe una amplia variedad de aplicaciones para la visión por ordenador en la sanidad. Tareas como la detección y clasificación de objetos se utilizan en el diagnóstico por imagen para detectar enfermedades de forma más rápida y precisa. En el análisis de radiografías, la visión por ordenador puede identificar patrones que podrían ser demasiado sutiles para el ojo humano.
También se utiliza para detectar el cáncer comparando células cancerosas con células sanas. Del mismo modo, en el caso de las tomografías computarizadas y las resonancias magnéticas, la visión por ordenador puede analizar imágenes con una precisión casi humana. Ayuda a los médicos a tomar mejores decisiones y, en última instancia, permite salvar más vidas.

Fig. 7. Uso de YOLO11 para analizar exploraciones médicas.
La AI en el sector de la automoción#
La visión por ordenador es fundamental para los coches autónomos, ya que les ayuda a detectar objetos como señales de tráfico y semáforos. Técnicas como el reconocimiento óptico de caracteres (OCR) permiten al coche leer el texto de las señales de tráfico. También se utiliza para detectar peatones, mediante tareas de detección de objetos que identifican a las personas en tiempo real.
Además, la visión por ordenador puede detectar grietas y baches en las superficies de las carreteras, lo que permite supervisar mejor las condiciones cambiantes de la vía. En general, la tecnología de visión por ordenador puede desempeñar un papel clave en la mejora de la gestión del tráfico, el aumento de la seguridad del transporte y la planificación de ciudades inteligentes.

Fig. 8 Comprensión del tráfico con YOLO11.
Visión artificial en agricultura#
Imaginemos que los agricultores pudieran sembrar, regar y cosechar automáticamente sus cultivos a tiempo y sin preocupaciones. Eso es exactamente lo que la visión por ordenador aporta a la agricultura. Facilita la supervisión de los cultivos en tiempo real, de modo que los agricultores pueden detectar problemas como enfermedades o deficiencias de nutrientes con mayor precisión que las personas.
Además de la supervisión, las máquinas de desherbado automático impulsadas por AI e integradas con visión por ordenador pueden identificar y eliminar las malas hierbas, reduciendo los costes laborales y aumentando el rendimiento de los cultivos. Esta combinación de tecnologías ayuda a los agricultores a optimizar sus recursos, mejorar la eficiencia y proteger sus cultivos.

Fig. 9. Ejemplo del uso de Ultralytics YOLO11 en la agricultura.
Automatización de los procesos de fabricación con AI#
En la fabricación, la visión por ordenador ayuda a supervisar la producción, comprobar la calidad de los productos y realizar un seguimiento automático de los trabajadores. La AI de visión agiliza el proceso y lo hace más preciso, al tiempo que reduce los errores y los costes.
En concreto, la detección de objetos y la segmentación de instancias se utilizan habitualmente para garantizar la calidad. Los sistemas de detección de defectos realizan una comprobación final de los productos terminados para garantizar que solo los mejores lleguen a los clientes. Cualquier producto con abolladuras o grietas se identifica y rechaza automáticamente. Estos sistemas también siguen y cuentan los productos en tiempo real, proporcionando una supervisión continua de la cadena de montaje.

Fig. 10 Supervisión de una cadena de montaje mediante visión por ordenador.
Una educación más eficaz con la visión por ordenador#
Una de las formas en que se utiliza la visión por ordenador en el aula es mediante el reconocimiento de gestos, que personaliza el aprendizaje al detectar los movimientos de los alumnos. Los modelos como Ultralytics YOLO11 son excelentes para esta tarea. Pueden identificar con precisión gestos como levantar la mano o expresiones de confusión en tiempo real.
Cuando se detectan estos gestos, una clase en curso puede adaptarse proporcionando ayuda adicional o modificando el contenido para ajustarlo mejor a las necesidades del alumno. Esto crea un entorno de aprendizaje más dinámico y adaptable, ayudando a los profesores a centrarse en la enseñanza mientras el sistema apoya la experiencia de aprendizaje de cada alumno.
Tendencias recientes en visión por ordenador#
Ahora que hemos explorado algunas de las aplicaciones de la visión por ordenador en diversos sectores, profundicemos en las principales tendencias que impulsan su progreso.
Una de las principales tendencias es la computación en el borde, un marco de computación distribuida que procesa los datos más cerca de su origen. Por ejemplo, la computación en el borde permite que dispositivos como cámaras y sensores procesen los datos visuales directamente, lo que se traduce en tiempos de respuesta más rápidos, menores retrasos y una mayor privacidad.
Otra tendencia clave en la visión por ordenador es el uso de la realidad fusionada. Esta combina el mundo físico con elementos digitales y utiliza la visión por ordenador para integrar objetos virtuales de forma fluida en el mundo real. Puede utilizarse para mejorar las experiencias en ámbitos como los videojuegos, la educación y la formación.
Ventajas e inconvenientes de la visión por ordenador#
Estas son algunas de las principales ventajas que la visión por ordenador puede aportar a distintos sectores:
-
Ahorro de costes: Automatizar tareas con visión por ordenador ayuda a reducir los costes operativos, mejorar la productividad y minimizar los errores.
-
Escalabilidad: Una vez implementados, los sistemas de visión por ordenador pueden escalar fácilmente para gestionar grandes cantidades de datos, por lo que resultan adecuados para empresas en crecimiento u operaciones a gran escala.
-
Personalización específica para cada aplicación: Los modelos de visión por ordenador pueden ajustarse con tu conjunto de datos, proporcionándote soluciones altamente especializadas que cumplen los requisitos de tu aplicación.
Aunque estas ventajas ponen de relieve cómo la visión por ordenador puede influir en distintos sectores, también es importante tener en cuenta las dificultades que implica su implementación. Estas son algunas de las principales:
-
Problemas de privacidad de los datos: El uso de datos visuales, especialmente en ámbitos sensibles como la vigilancia o la sanidad, puede plantear problemas de privacidad y seguridad.
-
Limitaciones ambientales: Los sistemas de visión por ordenador pueden tener dificultades para funcionar correctamente en entornos exigentes, como aquellos con poca iluminación, imágenes de baja calidad o fondos complejos.
-
Alto coste inicial: Desarrollar e implementar sistemas de visión por ordenador puede resultar caro debido a la necesidad de hardware, software y conocimientos especializados.
Conclusiones clave#
La visión por ordenador está reinventando la forma en que las máquinas interactúan con el mundo, al permitirles verlo y comprenderlo como lo hacen las personas. Ya se utiliza en muchos ámbitos, como la mejora de la seguridad de los coches autónomos, la ayuda a los médicos para diagnosticar enfermedades más rápido, la personalización de las compras e incluso la asistencia a los agricultores en la supervisión de los cultivos.
A medida que la tecnología sigue mejorando, nuevas tendencias como la computación en el borde y la realidad fusionada están abriendo aún más posibilidades. Aunque existen algunos desafíos, como los sesgos y los costes elevados, la visión por ordenador tiene el potencial de generar un impacto muy positivo en muchos sectores en el futuro.
Para obtener más información, visita nuestro repositorio de GitHub y participa en nuestra comunidad. Explora innovaciones en sectores como la AI en coches autónomos y la visión por ordenador en la agricultura en nuestras páginas de soluciones. 🚀









