Todo lo que necesitas saber sobre las tareas de visión artificial
Aprende cómo funcionan tareas de visión artificial como el seguimiento de objetos, la segmentación de instancias y la clasificación de imágenes, y cómo Ultralytics YOLO11 las admite.

Gracias a las cámaras y a los avances en inteligencia artificial (AI), los ordenadores y las máquinas ahora pueden ver el mundo de una forma similar a como lo hacemos los humanos. Por ejemplo, pueden reconocer personas, seguir objetos e incluso entender el contexto de lo que ocurre en un vídeo.
En concreto, la visión artificial es la rama de la AI que permite a las máquinas comprender e interpretar la información visual del mundo que las rodea. La visión artificial incluye diversas tareas, cada una diseñada para extraer un tipo específico de información de imágenes o vídeos. Por ejemplo, la detección de objetos ayuda a identificar y localizar distintos elementos en una imagen, mientras que otras tareas, como el seguimiento, la segmentación y la estimación de poses, ayudan a las máquinas a comprender con mayor precisión el movimiento, las formas y las posiciones.
La tarea de visión artificial que se utiliza en una aplicación concreta depende del tipo de información que necesites. Los modelos de visión artificial, como Ultralytics YOLO11, admiten diversas tareas de visión artificial, lo que los convierte en una opción fiable para crear sistemas de IA de visión para aplicaciones reales.
En esta guía, analizaremos más detenidamente las tareas de visión artificial compatibles con modelos como YOLO11. Veremos cómo funciona cada tarea y cómo se utiliza en distintos sectores. ¡Empecemos!
¿Qué son las tareas de visión artificial?#
Las tareas de visión artificial tienen como objetivo reproducir las capacidades de la visión humana de distintas formas. Estas tareas pueden ayudar a las máquinas a detectar objetos, seguir sus movimientos, estimar poses e incluso delimitar elementos individuales en imágenes y vídeos. Normalmente, las tareas de visión artificial se habilitan mediante modelos que dividen los datos visuales en partes más pequeñas para interpretar con mayor claridad lo que está ocurriendo.
Los modelos de IA de visión, como los modelos Ultralytics YOLO, admiten varias tareas, como detección, seguimiento y segmentación, dentro de un mismo framework. Gracias a esta versatilidad, los modelos YOLO11 se adoptan fácilmente en una amplia variedad de casos de uso.

Fig. 1. Tareas de visión artificial compatibles con Ultralytics YOLO11.
Un buen ejemplo lo encontramos en el análisis deportivo. YOLO11 puede utilizarse para detectar a cada jugador del campo mediante la detección de objetos y, después, seguirlo durante todo el partido mediante el seguimiento de objetos. Entretanto, las capacidades de estimación de poses de YOLO11 pueden ayudar a analizar los movimientos y las técnicas de los jugadores, mientras que la segmentación de instancias puede separar a cada jugador del fondo, lo que aporta mayor precisión al análisis.
En conjunto, estas tareas de visión artificial habilitadas por YOLO11 ofrecen una visión completa de lo que ocurre durante el partido y proporcionan a los equipos información más detallada sobre el rendimiento de los jugadores, las tácticas y la estrategia general.
Resumen de las tareas de visión artificial compatibles con Ultralytics YOLO11#
Ahora que hemos visto qué son las tareas de visión artificial, vamos a analizar con más detalle cada una de las compatibles con YOLO11 mediante ejemplos del mundo real.
Compatibilidad de Ultralytics YOLO11 con la clasificación de imágenes#
Cuando miras una foto, la mayoría de las personas puede identificar fácilmente si muestra un perro, una montaña o una señal de tráfico, porque todos hemos aprendido el aspecto habitual de estas cosas. La clasificación de imágenes ayuda a las máquinas a hacer lo mismo, enseñándoles a clasificar y etiquetar una imagen según su objeto principal, ya sea un «coche», un «plátano» o una «radiografía con fractura». Esta etiqueta ayuda a los sistemas de visión artificial a comprender el contenido visual para poder responder o tomar decisiones en consecuencia.
Una aplicación interesante de esta tarea de visión artificial es la monitorización de la fauna. La clasificación de imágenes puede utilizarse para identificar distintas especies animales a partir de fotografías tomadas en la naturaleza. Al etiquetar las imágenes automáticamente, los investigadores pueden hacer un seguimiento de las poblaciones, monitorizar los patrones migratorios e identificar con mayor facilidad las especies en peligro para apoyar los esfuerzos de conservación.

Fig. 2. Ejemplo del uso de YOLO11 para la clasificación de imágenes.
Capacidades de detección de objetos de Ultralytics YOLO11#
Aunque la clasificación de imágenes resulta útil para obtener una idea general del contenido de una imagen, solo asigna una etiqueta a la imagen completa. En situaciones en las que se necesita información detallada, como la ubicación exacta y la identidad de varios objetos, la detección de objetos resulta esencial.
La detección de objetos es el proceso de identificar y localizar objetos individuales dentro de una imagen, a menudo dibujando cuadros delimitadores a su alrededor. Ultralytics YOLO11 ofrece un rendimiento especialmente bueno en la detección de objetos en tiempo real, por lo que resulta ideal para una amplia variedad de aplicaciones.
Por ejemplo, piensa en las soluciones de visión artificial que se utilizan en las tiendas para reponer las estanterías. La detección de objetos puede ayudar a contar frutas, verduras y otros artículos, garantizando un inventario preciso. En los campos agrícolas, la misma tecnología puede monitorizar la madurez de los cultivos para ayudar a los agricultores a determinar el mejor momento para cosechar, diferenciando incluso entre productos maduros e inmaduros.
Fig. 3. Detección de frutas mediante Ultralytics YOLO11.
Uso de YOLO11 para la segmentación de instancias#
La detección de objetos utiliza cuadros delimitadores para identificar y localizar objetos en una imagen, pero no captura sus formas exactas. Ahí es donde entra en juego la segmentación de instancias. En lugar de dibujar un cuadro alrededor de un objeto, la segmentación de instancias traza su contorno preciso.
Puedes imaginarlo así: en lugar de limitarse a indicar que «hay una manzana en esta zona», delimita y rellena cuidadosamente la forma exacta de la manzana. Este proceso detallado ayuda a los sistemas de AI a comprender claramente los límites de un objeto, especialmente cuando hay varios objetos juntos.
La segmentación de instancias puede aplicarse a muchas áreas, desde inspecciones de infraestructuras hasta estudios geológicos. Por ejemplo, los datos de estudios geológicos pueden analizarse con YOLO11 para segmentar grietas o anomalías superficiales tanto grandes como pequeñas. Al dibujar límites precisos alrededor de estas anomalías, los ingenieros pueden localizar los problemas y resolverlos antes de que comience un proyecto.

Fig. 4. Segmentación de grietas habilitada por YOLO11.
Seguimiento de objetos: seguimiento de objetos entre fotogramas con YOLO11#
Hasta ahora, las tareas de visión artificial que hemos visto se centran en lo que aparece en una sola imagen. Sin embargo, cuando se trata de vídeos, necesitamos información que vaya más allá de un único fotograma. La tarea de seguimiento de objetos puede utilizarse para ello.
La capacidad de seguimiento de objetos de YOLO11 puede seguir un objeto concreto, como una persona o un coche, mientras se desplaza por una serie de fotogramas de vídeo. Aunque cambie el ángulo de la cámara o aparezcan otros objetos, el sistema sigue al mismo objetivo.
Esto es fundamental para las aplicaciones que requieren monitorización a lo largo del tiempo, como el seguimiento de coches en el tráfico. De hecho, YOLO11 puede seguir vehículos con precisión, siguiendo cada coche para ayudar a estimar su velocidad en tiempo real. Por eso, el seguimiento de objetos es un componente clave de sistemas como los de monitorización del tráfico.

Fig. 5. La compatibilidad de YOLO11 con el seguimiento de objetos puede utilizarse para estimar la velocidad.
Detección de cuadros delimitadores orientados (OBB) mediante YOLO11#
Los objetos del mundo real no siempre están perfectamente alineados: pueden estar inclinados, de lado o colocados en ángulos inusuales. Por ejemplo, en las imágenes de satélite, los barcos y los edificios suelen aparecer girados.
Los métodos tradicionales de detección de objetos utilizan cuadros rectangulares fijos que no se ajustan a la orientación de un objeto, lo que dificulta capturar con precisión estas formas giradas. La detección de cuadros delimitadores orientados (OBB) resuelve este problema mediante cuadros que giran para ajustarse al contorno de un objeto y alinearse con su ángulo, lo que permite una detección más precisa.
En la monitorización portuaria, la compatibilidad de YOLO11 con la detección OBB puede ayudar a identificar y seguir embarcaciones con precisión, independientemente de su orientación, garantizando que todos los barcos que entren o salgan del puerto se monitoricen correctamente. Esta detección precisa proporciona información en tiempo real sobre las posiciones y los movimientos de las embarcaciones, algo fundamental para gestionar puertos con mucho tráfico y evitar colisiones.

Fig. 6. Detección de barcos mediante detección OBB y YOLO11.
Estimación de poses y YOLO11: seguimiento de puntos clave#
La estimación de poses es una técnica de visión artificial que sigue puntos clave, como articulaciones, extremidades u otras referencias, para comprender cómo se mueve un objeto. En lugar de tratar un objeto o un cuerpo entero como una unidad completa, este método lo divide en sus partes clave. Esto permite analizar detalladamente los movimientos, los gestos y las interacciones.
Una aplicación habitual de esta tecnología es la estimación de la pose humana. Al seguir en tiempo real las posiciones de distintas partes del cuerpo, ofrece una imagen clara de cómo se mueve una persona. Esta información puede utilizarse para diversos fines, desde el reconocimiento de gestos y la monitorización de actividades hasta el análisis del rendimiento deportivo.
Del mismo modo, en la rehabilitación física, los terapeutas pueden utilizar la estimación de la pose humana y YOLO11 para monitorizar los movimientos de los pacientes durante los ejercicios. Esto ayuda a garantizar que cada movimiento se realiza correctamente y permite seguir el progreso a lo largo del tiempo.

Fig. 7. YOLO11 puede monitorizar un entrenamiento mediante la estimación de poses.
Exploración de la compatibilidad de YOLO11 con distintas tareas de visión artificial#
Ahora que hemos explorado en detalle todas las tareas de visión artificial compatibles con YOLO11, vamos a ver cómo las admite YOLO11.
YOLO11 no es un único modelo: es un conjunto de variantes de modelos especializados, cada una diseñada para una tarea de visión artificial concreta. Esto convierte a YOLO11 en una herramienta versátil que puede adaptarse a una amplia variedad de aplicaciones. También puedes ajustar estos modelos con tus propios datasets para abordar los retos específicos de tus proyectos.
Estas son las variantes de modelos YOLO11 preentrenadas para tareas de visión específicas:
- YOLO11: este modelo detecta y etiqueta varios objetos en tiempo real, por lo que resulta ideal para el reconocimiento visual de alta velocidad.
- YOLO11-seg: esta variante se centra en la segmentación mediante máscaras detalladas para separar los objetos de sus fondos.
- YOLO11-obb: este modelo está diseñado para detectar objetos girados dibujando cuadros delimitadores que se alinean con la orientación de cada objeto.
- YOLO11-cls: esta variante clasifica imágenes asignando una única etiqueta de categoría según el contenido general.
- YOLO11-pose: este modelo estima puntos clave del cuerpo para seguir la postura, la posición de las extremidades y el movimiento.
Cada variante está disponible en distintos tamaños, lo que permite elegir el equilibrio adecuado entre velocidad y precisión según tus necesidades específicas.
Conclusiones clave#
Las tareas de visión artificial están cambiando la forma en que las máquinas comprenden e interactúan con el mundo. Al descomponer las imágenes y los vídeos en elementos clave, estas tecnologías facilitan el análisis detallado de objetos, movimientos e interacciones.
Desde mejorar la seguridad vial y el rendimiento deportivo hasta agilizar los procesos industriales, los modelos como YOLO11 pueden proporcionar información en tiempo real que impulsa la innovación. A medida que la IA de visión siga evolucionando, probablemente desempeñará un papel cada vez más importante en la forma en que interpretamos y utilizamos los datos visuales en nuestro día a día.
Únete a nuestra comunidad y visita nuestro repositorio de GitHub para ver la IA en acción. Explora nuestras opciones de licencia y descubre más sobre la IA en la agricultura y la visión por ordenador en la fabricación en nuestras páginas de soluciones.









