La IA de visión permite la tecnología de reconocimiento de gestos sin contacto
Explora cómo los modelos de visión por ordenador impulsan la tecnología de reconocimiento de gestos para detectar, seguir y comprender gestos de las manos en diversas aplicaciones.

A medida que evoluciona la tecnología, también evoluciona nuestra forma de interactuar con ella. Las primeras máquinas dependían del esfuerzo físico y de controles mecánicos, mientras que la informática moderna introdujo las pantallas táctiles y la entrada de voz.
Ahora, el reconocimiento de gestos forma parte del siguiente paso: utilizar movimientos naturales como interfaz de usuario. Un simple saludo con la mano, un pellizco o una señal rápida con la mano ya pueden controlar aplicaciones, pantallas y máquinas.
Esta interacción sin contacto puede funcionar mediante la visión artificial, una rama de la AI que ayuda a las máquinas a ver e interpretar lo que captura una cámara. Los sistemas de visión con AI pueden integrarse en smartphones, visores de realidad virtual (VR) y realidad aumentada (AR), coches y dispositivos domésticos inteligentes, donde los gestos pueden sustituir a los toques, clics y botones para ofrecer una experiencia de usuario más fluida.
El control sin contacto es cada vez más habitual en la vida cotidiana. En lugares de trabajo y espacios compartidos, evitar el contacto físico puede mejorar la higiene y la seguridad. Muchos productos digitales también están adoptando la interacción manos libres, y los gestos ofrecen una forma sencilla e intuitiva de controlar dispositivos sin tocarlos.
En este artículo, veremos qué es el reconocimiento de gestos, cómo la visión artificial lo hace más preciso y dónde se utiliza en aplicaciones del mundo real. ¡Empecemos!
¿Qué es el reconocimiento de gestos?#
El reconocimiento de gestos es una tecnología de detección que permite a las máquinas comprender gestos humanos, como señales con las manos o movimientos corporales, y convertirlos en acciones digitales. En lugar de tocar una pantalla o pulsar botones, los usuarios pueden controlar dispositivos mediante movimientos sencillos y naturales.
Esto hace que las interacciones resulten más intuitivas y explica por qué la entrada basada en gestos se está adoptando en muchos sistemas de control basados en machine learning y AI. En particular, el reconocimiento de gestos de las manos es una de las formas de reconocimiento de gestos más utilizadas y suele basarse en la visión artificial.
En pocas palabras, una solución de visión con AI puede detectar manos en una transmisión de cámara, seguir cómo se mueven o cambian de forma y asociar esos patrones a un gesto conocido para activar una acción en pantalla.
Una parte clave de estas soluciones es un modelo de visión artificial, entrenado con datasets de imágenes o vídeos etiquetados que muestran distintos gestos de las manos. Con datos de entrenamiento variados y una evaluación rigurosa, el modelo puede generalizar mejor entre distintos usuarios, condiciones de iluminación y fondos, lo que le ayuda a reconocer gestos con mayor fiabilidad en situaciones reales.

Fig. 1. Datos utilizados para entrenar un modelo de visión artificial que detecte puntos clave de gestos (Fuente)
Exploración de distintos tipos de gestos e interacción persona-ordenador#
Antes de examinar más detenidamente el papel de la visión artificial en el reconocimiento de gestos, demos un paso atrás y analicemos los tipos de gestos que estos sistemas suelen reconocer.
En la mayoría de los casos, los gestos se dividen en dos categorías: estáticos y dinámicos. Los gestos estáticos son posturas fijas de la mano, como levantar el pulgar, hacer una señal de stop o mostrar una señal de paz. Como no implican movimiento, a menudo pueden reconocerse a partir de un único fotograma.
Por su parte, los gestos dinámicos implican movimiento a lo largo del tiempo, como saludar o deslizar la mano en el aire. Para reconocerlos, un sistema de visión con AI debe analizar varios fotogramas para seguir cómo se mueve la mano y comprender la dirección y el momento del gesto.
El papel de los algoritmos de visión artificial en el reconocimiento de gestos#
Los sistemas de reconocimiento de gestos pueden desarrollarse de distintas formas. Algunos sistemas de entrada utilizan sensores ponibles, como guantes o dispositivos de seguimiento montados en la muñeca, para capturar el movimiento de la mano.
Estas configuraciones pueden ser precisas, pero no siempre resultan prácticas. Los dispositivos ponibles deben llevarse puestos, configurarse, cargarse y mantenerse, y pueden resultar limitantes en espacios compartidos o cuando se utilizan a diario.
Por eso, muchos sistemas de vanguardia se basan en la visión artificial. Con cámaras RGB estándar y sensores de profundidad o de tiempo de vuelo, los dispositivos pueden capturar los movimientos de las manos y del cuerpo en tiempo real sin que los usuarios tengan que llevar dispositivos adicionales. Esto hace que el reconocimiento de gestos basado en visión sea ideal para smartphones, coches, Smart TV y visores de AR y VR.
Por ejemplo, los modelos de visión artificial como Ultralytics YOLO11 y el próximo Ultralytics YOLO26 permiten realizar tareas como la detección de objetos, el seguimiento de objetos y la estimación de la pose. Estas capacidades pueden utilizarse para detectar manos en cada fotograma, seguir su movimiento a lo largo del tiempo y asignar puntos clave, como las puntas de los dedos y las articulaciones. Esto permite reconocer gestos como levantar la palma para pausar, hacer un pellizco para ampliar, deslizar la mano para navegar por los menús o señalar para seleccionar un elemento en AR y VR.
Tareas de visión artificial utilizadas para reconocer la interacción persona-máquina#
Este es un resumen de algunas de las principales tareas de visión artificial utilizadas en el reconocimiento de gestos:
- Detección de objetos: Esta tarea se utiliza para localizar manos en una imagen o fotograma de vídeo, normalmente dibujando BBox a su alrededor. Ayuda al sistema a centrarse en la zona del gesto e ignorar los detalles innecesarios del fondo.
- Seguimiento de objetos: Esta tarea, basada en la detección de objetos, sigue las manos detectadas en varios fotogramas y mantiene su identidad a lo largo del tiempo. Resulta especialmente útil para los gestos dinámicos, en los que el movimiento y la dirección son fundamentales.
- Estimación de la pose: En lugar de centrarse en los BBox, la estimación de la pose identifica puntos clave de la mano, como las puntas de los dedos, los nudillos y la muñeca. Estos puntos de referencia crean un esqueleto sencillo de la mano que captura la posición de los dedos y los movimientos sutiles, lo que permite clasificar los gestos con mayor detalle.
- Segmentación de instancias: Esta tarea pretende separar cada mano del fondo a nivel de píxel generando una máscara para cada mano visible. Es útil en escenas con mucho desorden, cuando las manos se solapan o cuando aparecen varias manos en el fotograma.
Muchas soluciones de visión con AI utilizan estas tareas conjuntamente como parte de un único pipeline. Por ejemplo, un sistema podría empezar con la detección de objetos para encontrar las manos y utilizar después el seguimiento para seguirlas a través de los fotogramas en el caso de los gestos dinámicos.
Si el gesto depende de la colocación de los dedos, la estimación de la pose puede añadir puntos clave para obtener un mayor nivel de detalle, mientras que la segmentación de instancias puede ayudar a aislar cada mano con mayor precisión en escenas con mucho desorden o cuando varias manos se solapan. Juntos, estos pasos proporcionan información sobre la ubicación y el movimiento, lo que hace que el reconocimiento de gestos sea más preciso y fiable.
Cómo funciona el reconocimiento de gestos basado en visión#
Ahora que entendemos mejor las tareas de visión artificial que intervienen en el reconocimiento de gestos, veamos paso a paso cómo funciona un sistema basado en visión.
Un sistema típico empieza capturando vídeo con una cámara, a veces junto con datos de profundidad si el dispositivo los admite. A continuación, los fotogramas se preprocesan mediante procesamiento de imágenes para que el modelo pueda gestionarlos de forma más uniforme, por ejemplo, cambiando su tamaño, estabilizándolos o reduciendo el ruido y el desenfoque de movimiento.
Después, el sistema identifica las manos en el fotograma mediante detección o segmentación y las sigue a lo largo del tiempo mediante tracking. Si la aplicación necesita más detalle, también puede ejecutar la estimación de la pose para extraer puntos clave, como las puntas de los dedos y las articulaciones. Con esta información, el modelo clasifica el gesto, ya sea una pose de un único fotograma, como levantar el pulgar, o un patrón de movimiento, como deslizar la mano.
Por último, el gesto reconocido se asigna a una acción en la interfaz, como desplazarse, ampliar, seleccionar un elemento, ajustar el volumen o controlar interacciones de AR y VR. El pipeline exacto puede variar: las aplicaciones más sencillas utilizan menos pasos y las más complejas combinan detección, seguimiento y estimación de la pose para mejorar la precisión.
Aplicaciones del reconocimiento de gestos basado en visión#
A continuación, veremos cómo se utiliza el reconocimiento de gestos en aplicaciones del mundo real para comprender las posiciones de las manos.
Interacción basada en gestos con sistemas de infoentretenimiento de coches#
El reconocimiento de gestos empieza a aparecer en las interfaces de los vehículos inteligentes, especialmente en los sistemas de infoentretenimiento. Es una forma práctica de controlar determinadas funciones con simples movimientos de la mano, lo que puede reducir la frecuencia con la que los conductores tienen que alcanzar las pantallas táctiles o los botones físicos. Por ejemplo, un gesto rápido puede utilizarse para ajustar el volumen, gestionar llamadas o navegar por los menús en pantalla.

Fig. 2. Un conductor realizando gestos con las manos dentro del rango de detección de un sistema de infoentretenimiento (Fuente)
Interacciones basadas en gestos en los videojuegos#
En los videojuegos y las experiencias inmersivas, el control basado en gestos está cambiando la forma en que las personas interactúan con los mundos virtuales. En lugar de depender únicamente de mandos o joysticks, los jugadores pueden utilizar movimientos naturales de las manos para navegar por los menús, recoger objetos virtuales, controlar personajes o activar acciones en un juego.

Fig. 3. Jugar a videojuegos mediante gestos con las manos (Fuente).
Este tipo de interacción sin contacto puede resultar más fluida, especialmente en AR y VR. Como resultado, el seguimiento de las manos y el control mediante gestos se están convirtiendo en funciones habituales de los visores de VR y realidad mixta.
Control gestual fluido para dispositivos domésticos inteligentes#
Los dispositivos domésticos inteligentes, como Smart TV, altavoces y luces conectadas, empiezan a admitir el control basado en gestos para realizar acciones rápidas sin contacto. Con un simple movimiento de la mano, los usuarios pueden encender las luces, ajustar el volumen o activar comandos básicos sin tener que buscar interruptores o mandos a distancia.
Por ejemplo, en los sistemas de entretenimiento doméstico, las cámaras de profundidad integradas o conectadas pueden reconocer gestos como deslizar la mano, señalar o levantarla. Esto puede facilitar la navegación por los menús, el cambio de ajustes o la confirmación de selecciones desde el otro lado de la habitación. Entre bastidores, los modelos de visión artificial procesan la transmisión de la cámara en tiempo real para detectar e interpretar estos gestos.
Control gestual en robótica habilitado por la inteligencia artificial#
Imagina una situación en una fábrica en la que un trabajador necesita guiar a un robot mientras transporta piezas, lleva guantes o se encuentra a una distancia segura de equipos en movimiento. En estos entornos, alcanzar botones o un panel de control puede ser lento o incluso peligroso.
En cambio, los sistemas de control basados en gestos pueden ofrecer una forma más práctica y manos libres de interactuar con estas máquinas. Esto resulta especialmente útil para los robots colaborativos, o cobots, diseñados para trabajar junto a las personas.
En lugar de acercarse a un panel de control, los operarios pueden utilizar simples señales con las manos para iniciar, detener o guiar un robot desde la distancia. Esto reduce la dependencia de los controles físicos y puede contribuir a crear flujos de trabajo más seguros en la planta.
Los sistemas avanzados de control basados en visión, habilitados por modelos de deep learning o algoritmos de aprendizaje, también pueden ir más allá de los comandos básicos. Pueden interpretar movimientos más sutiles de la mano y responder con fluidez a pequeños cambios de dirección, así como ofrecer una guía y una automatización más precisas.

Fig. 4. Una mano robótica analizando el gesto de un usuario (Fuente)
Ventajas e inconvenientes de la tecnología de reconocimiento de gestos#
Estas son algunas de las principales ventajas de utilizar tecnología de reconocimiento de gestos:
- Mayor accesibilidad: Los gestos pueden ofrecer una alternativa a los usuarios que tienen dificultades para utilizar teclados, pantallas táctiles o mandos.
- Funciona a distancia: Los gestos pueden reconocerse desde el otro lado de una habitación, lo que resulta útil para Smart TV, quioscos y dispositivos domésticos.
- Versatilidad entre dispositivos: Los mismos conjuntos de gestos pueden funcionar en teléfonos, coches, pantallas inteligentes y visores de AR o VR, lo que hace que la interacción sea coherente.
Al mismo tiempo, existen algunos retos del mundo real que pueden afectar a la precisión y la coherencia. Estos son algunos factores que conviene tener en cuenta:
- Problemas de iluminación y calidad de la cámara: La poca luz, los reflejos, las sombras o las cámaras de baja resolución pueden reducir el rendimiento del reconocimiento. Esto, a su vez, puede afectar al control del movimiento.
- Variación entre usuarios: Las personas realizan los gestos de forma naturalmente distinta, y las diferencias en el tamaño de la mano, la flexibilidad de los dedos o los accesorios pueden afectar a la precisión.
- Limitaciones con movimientos rápidos: Los gestos rápidos pueden introducir desenfoque de movimiento o hacer que el modelo pierda fotogramas clave, especialmente con cámaras de baja frecuencia de fotogramas.
Conclusiones clave#
La tecnología de reconocimiento de gestos ha salido de los laboratorios de investigación y ahora forma parte de dispositivos e innovaciones de uso cotidiano. En concreto, la visión artificial permite controlar dispositivos sin contacto en videojuegos, robótica, hogares inteligentes y sistemas de automoción. A medida que mejoren los modelos de visión, estas interfaces sin contacto probablemente serán más fáciles de desarrollar y se utilizarán de forma más generalizada.
Descubre nuestra comunidad y nuestro repositorio de GitHub para obtener más información sobre los modelos de visión artificial. Explora nuestras páginas de soluciones para informarte sobre aplicaciones como la AI en la agricultura y la visión artificial en la logística. Consulta nuestras opciones de licencia y empieza a crear tu propio modelo de visión con AI.









