La guía definitiva de herramientas de estimación de poses
Descubre cómo se pueden utilizar las herramientas de estimación de poses para detectar puntos clave del cuerpo en imágenes y vídeos, estimar poses 2D y 3D e impulsar diversas aplicaciones de IA de visión.

Los seres humanos interpretamos el movimiento de forma instintiva. Cuando alguien se inclina hacia delante, gira la cabeza o levanta un brazo, puedes deducir inmediatamente qué está haciendo. Es una habilidad silenciosa y casi subconsciente que determina cómo interactuamos con las personas y exploramos el mundo.
A medida que la tecnología adquiere un papel más importante en la vida cotidiana, es natural querer que nuestros dispositivos entiendan el movimiento con la misma fluidez que nosotros. Los avances recientes en inteligencia artificial, especialmente los basados en aprendizaje profundo, lo están haciendo posible. En particular, la visión artificial ayuda a las máquinas a extraer significado de imágenes y vídeos y está impulsando este progreso.
Por ejemplo, la estimación de pose es una tarea habitual de visión artificial que predice la ubicación de puntos clave corporales predefinidos (como los hombros, los codos, las caderas y las rodillas) en una imagen o fotograma de vídeo. Estos puntos clave pueden conectarse mediante una definición fija del esqueleto para formar una representación simplificada de la pose.
Los modelos de visión artificial, como Ultralytics YOLO11 y el próximo Ultralytics YOLO26, admiten tareas como la estimación de pose y pueden utilizarse para impulsar aplicaciones en tiempo real, como la evaluación de la técnica en fitness y deportes, la supervisión de la seguridad y las experiencias interactivas de realidad aumentada.

Fig. 1. Una muestra del uso de Ultralytics YOLO11 para la estimación de pose (Fuente)
En este artículo analizaremos en profundidad las herramientas de estimación de pose y veremos cómo funciona la estimación de pose, dónde se utiliza y cuáles son algunos de los principales modelos y bibliotecas disponibles actualmente. ¡Empecemos!
¿Qué es la estimación de poses?#
La estimación de pose es una técnica de visión artificial que ayuda a un sistema a comprender cómo está colocado una persona o un objeto en una imagen o vídeo. En lugar de analizar todos los píxeles por igual, predice un conjunto de puntos de referencia coherentes, como la cabeza, los hombros, los codos, las caderas, las rodillas y los tobillos.
La mayoría de los modelos generan las coordenadas de estos puntos clave y una puntuación que refleja la probabilidad de que cada predicción sea correcta. A continuación, estos puntos clave pueden conectarse mediante una disposición predefinida del esqueleto para formar una representación sencilla de la pose.
Cuando se aplican fotograma a fotograma en vídeos, los puntos clave resultantes pueden asociarse a lo largo del tiempo para estimar el movimiento. Esto permite aplicaciones como la evaluación de la técnica, el análisis del movimiento y la interacción basada en gestos.

Fig. 2. Un ejemplo de estimación de pose (Fuente)
La necesidad de herramientas de estimación de pose#
El movimiento humano contiene mucha información. La forma en que alguien se agacha, alcanza algo o cambia el peso de un lado a otro puede revelar intención, esfuerzo, fatiga o incluso riesgo de lesión. Hasta hace poco, capturar ese nivel de detalle normalmente requería sensores especializados, trajes de captura de movimiento o entornos de laboratorio controlados.
La estimación de pose cambia esta situación. Extraer puntos de referencia corporales clave de imágenes y vídeos normales permite a los ordenadores analizar el movimiento utilizando cámaras estándar. Esto hace que el análisis del movimiento sea más accesible, escalable y práctico en entornos reales.
Estas son algunas formas en las que la estimación de pose puede generar un impacto:
- Entornos de trabajo más seguros: los sistemas basados en visión pueden utilizarse para detectar posturas de riesgo, sobreesfuerzos repetitivos o técnicas inseguras de levantamiento antes de que se produzcan lesiones.
- Mejor entrenamiento físico y deportivo: las soluciones de IA basada en visión pueden evaluar la técnica, el equilibrio y la ejecución en tiempo real, proporcionando información inmediata a los usuarios sin dispositivos ponibles.
- Asistencia sanitaria y rehabilitación: los profesionales clínicos pueden realizar un seguimiento remoto de la recuperación, la postura y la amplitud de movimiento mediante sencillas grabaciones de vídeo.
- Experiencias interactivas: la estimación de pose facilita que los avatares digitales y los entornos inmersivos sigan y reflejen con precisión el movimiento humano.
La evolución de los algoritmos de estimación de pose#
La idea de estimar poses existe desde hace muchos años. Los primeros enfoques utilizaban modelos geométricos sencillos y reglas diseñadas manualmente, y normalmente solo funcionaban en condiciones controladas.
Por ejemplo, un sistema podía funcionar bien cuando una persona permanecía quieta en una posición fija, pero fallar cuando empezaba a caminar, girarse o interactuar con objetos en escenas reales. Estos métodos solían tener dificultades con el movimiento natural, los cambios de ángulo de la cámara, los fondos recargados y la oclusión parcial.
La estimación de pose moderna se basa en el aprendizaje profundo para afrontar estos retos. Al entrenar redes neuronales convolucionales con grandes conjuntos de datos etiquetados, los modelos aprenden patrones visuales que les ayudan a detectar puntos clave con mayor fiabilidad en distintas poses, personas y entornos.
Con más ejemplos, el modelo mejora sus predicciones y generaliza mejor a nuevas escenas. Gracias a este progreso, la estimación de pose admite ahora una amplia variedad de casos de uso prácticos, incluida la supervisión y la ergonomía en el lugar de trabajo, así como el análisis deportivo, donde entrenadores y analistas estudian cómo se mueven los atletas.
Tipos de técnicas de estimación de pose#
La estimación de pose puede adoptar distintas formas, según el entorno y lo que necesites medir. Estos son los principales tipos que encontrarás:
- Estimación de pose 2D: este enfoque detecta puntos clave corporales en una imagen bidimensional o un fotograma de vídeo. Funciona bien con cámaras estándar y es eficiente desde el punto de vista computacional, por lo que resulta adecuado para tareas como el seguimiento básico del movimiento, el análisis de la postura y la evaluación de la técnica en tiempo real.
- Estimación de pose 3D: al estimar la profundidad además de las coordenadas de la imagen, la estimación de pose 3D proporciona una comprensión espacial del movimiento corporal. Es especialmente útil cuando importa el movimiento hacia delante y hacia atrás, como en el análisis deportivo, la rehabilitación, la biomecánica y la animación. En concreto, la estimación de la pose humana 3D captura las posiciones y el movimiento de las articulaciones en el espacio 3D, reduciendo la ambigüedad que puede producirse con las proyecciones 2D.
- Estimación de pose de una sola persona: estos sistemas están diseñados para seguir a una persona cada vez. Suelen rendir mejor en entornos controlados o semicontrolados donde el sujeto es claramente visible, como aplicaciones de ejercicio guiado, videollamadas o configuraciones de análisis del movimiento.
- Estimación de pose de varias personas: diseñado para escenas con varias personas, este enfoque detecta y sigue las poses de varios individuos simultáneamente. Es especialmente útil en entornos concurridos, como lugares de trabajo, gimnasios, espacios públicos y actividades en grupo, donde los sujetos pueden superponerse u ocultarse entre sí.

Fig. 3. Comprender el movimiento humano en el espacio 3D frente al espacio de imagen 2D (Fuente)
Cómo funcionan los modelos de estimación de la pose humana#
La estimación de pose puede aplicarse a muchos tipos de objetos, pero, para simplificar, centrémonos en la estimación de la pose humana.
La mayoría de los sistemas de estimación de la pose humana se entrenan con conjuntos de datos anotados en los que se etiquetan partes clave del cuerpo en grandes colecciones de imágenes y fotogramas de vídeo. A partir de estos ejemplos, el modelo aprende patrones visuales vinculados a puntos de referencia corporales humanos, como los hombros, los codos, las caderas, las rodillas y los tobillos, para poder predecir puntos clave con precisión en nuevas escenas.
Otro aspecto clave es la arquitectura de inferencia del modelo, que determina cómo detecta los puntos clave y los ensambla para formar poses completas. Algunos sistemas detectan primero a cada persona y después estiman los puntos clave dentro de la región de cada una, mientras que otros detectan los puntos clave en toda la imagen y luego los agrupan por individuos. Los diseños más recientes de una sola etapa pueden predecir las poses en una pasada, equilibrando velocidad y precisión para su uso en tiempo real.
A continuación, repasaremos detalladamente los distintos enfoques de estimación de pose.
Estimación de pose ascendente#
En un enfoque ascendente, el modelo examina toda la imagen y encuentra primero los puntos clave corporales, como la cabeza, los hombros, los codos, las caderas, las rodillas y los tobillos. En esta fase no intenta separar a las personas. Simplemente detecta todos los puntos clave o articulaciones corporales definidos por el esqueleto de la pose en la escena.
Después, el sistema realiza un segundo paso para conectar los puntos. Vincula los puntos clave que corresponden entre sí y los agrupa en esqueletos completos, uno por persona. Como no necesita detectar primero a cada persona, los métodos ascendentes suelen funcionar bien en escenas concurridas donde las personas se superponen, aparecen con distintos tamaños o están parcialmente ocultas.
Detección de pose descendente#
En cambio, los sistemas descendentes empiezan detectando primero a cada persona de la imagen. Colocan un cuadro delimitador alrededor de cada individuo y tratan cada cuadro como una región independiente que analizar.
Una vez aislada una persona, el modelo predice los puntos clave corporales dentro de esa región. Esta configuración paso a paso suele producir resultados muy precisos, especialmente cuando solo hay unas pocas personas en la escena y cada una es claramente visible.
Estimación de pose de una sola etapa o híbrida#
Los modelos de una sola etapa, a veces denominados híbridos, predicen las poses en una pasada. En lugar de ejecutar primero la detección de personas y después la estimación de puntos clave, generan al mismo tiempo la ubicación de la persona y sus puntos clave corporales.
Como todo sucede en un único módulo, estos modelos suelen ser más rápidos y eficientes, lo que los convierte en una opción idónea para usos en tiempo real, como el seguimiento del movimiento en directo y la captura de movimiento. Los modelos como Ultralytics YOLO11 se basan en esta idea y buscan equilibrar la velocidad con predicciones fiables de los puntos clave.
Entrenamiento y evaluación de modelos de estimación de pose#
Independientemente del enfoque utilizado, un modelo de estimación de pose debe entrenarse y probarse cuidadosamente antes de resultar fiable en el mundo real. Normalmente aprende a partir de grandes conjuntos de imágenes (y, en ocasiones, vídeos) en los que se etiquetan los puntos clave corporales, lo que le ayuda a gestionar distintas poses, ángulos de cámara y entornos.
Algunos conjuntos de datos de estimación de pose conocidos son COCO Keypoints, MPII Human Pose, CrowdPose y OCHuman. Cuando estos conjuntos de datos no reflejan las condiciones a las que se enfrentará el modelo durante el despliegue, los ingenieros suelen recopilar y etiquetar imágenes adicionales del entorno objetivo, como una fábrica, un gimnasio o una clínica.

Fig. 4. Varias poses estimadas mediante visión artificial (Fuente)
Después del entrenamiento, el rendimiento del modelo se evalúa con pruebas de referencia estándar para medir su precisión y robustez, así como para orientar ajustes posteriores destinados a su uso en el mundo real. Los resultados suelen comunicarse mediante la precisión media promedio, conocida habitualmente como mAP, que resume el rendimiento en distintos umbrales de confianza comparando las poses predichas con la verdad fundamental etiquetada.
En muchas pruebas de referencia de pose, una pose predicha se empareja con una pose de referencia mediante la similitud de puntos clave de objetos (OKS). OKS mide la cercanía entre los puntos clave predichos y los puntos clave anotados, teniendo en cuenta factores como la escala de la persona y la dificultad habitual de localización de cada punto clave.
Los modelos de pose también generan puntuaciones de confianza para las personas detectadas y para los puntos clave individuales. Estas puntuaciones reflejan la confianza del modelo y se utilizan para ordenar y filtrar las predicciones, lo que resulta especialmente importante en condiciones difíciles, como la oclusión, el desenfoque de movimiento o los ángulos de cámara inusuales.
Herramientas y bibliotecas populares de estimación de pose#
Actualmente existen muchas herramientas de estimación de pose, cada una con un equilibrio diferente entre velocidad, precisión y facilidad de uso. Estas son algunas de las herramientas y bibliotecas más utilizadas:
- Ultralytics YOLO11: desarrollado como un modelo de IA de visión de código abierto de última generación, YOLO11 se basa en modelos anteriores como Ultralytics YOLOv8. Mejora la velocidad, la precisión y la eficiencia general, al tiempo que admite diversas tareas de visión artificial, incluida la estimación de pose. Con un rendimiento sólido en distintas plataformas, desde portátiles hasta dispositivos periféricos, YOLO11 es una excelente opción para muchos despliegues reales.
- Ultralytics YOLO26: este próximo modelo de nueva generación está diseñado para ser más ligero, pequeño y rápido, manteniendo una precisión elevada. Está creado para su uso en tiempo real y para facilitar el despliegue, y admite tareas como la detección de objetos, la segmentación de instancias y la estimación de pose en tamaños de modelo adecuados para todo tipo de dispositivos, desde dispositivos periféricos hasta sistemas de mayor tamaño.
- MediaPipe: es un framework multiplataforma para crear canalizaciones de visión y aprendizaje automático. Es ligero y funciona de forma eficiente en dispositivos móviles, tabletas y aplicaciones web, e incluye soluciones y modelos listos para usar para la estimación de la pose de todo el cuerpo, los puntos de referencia faciales y el seguimiento de manos.
- OpenPose: este sistema de estimación de pose de código abierto de extremo a extremo es ampliamente conocido por la detección de puntos clave de varias personas. Puede estimar conjuntamente los puntos clave del cuerpo, las manos y la cara, y se utiliza habitualmente en investigación, animación y análisis del movimiento.
- MMPose: MMPose es un kit de herramientas de estimación de pose basado en PyTorch del ecosistema OpenMMLab. Proporciona numerosas implementaciones de modelos, utilidades de entrenamiento y opciones de configuración, lo que lo hace útil para la experimentación y la personalización avanzada.
- HRNet y AlphaPose: son modelos de estimación de pose más antiguos que todavía se utilizan actualmente en investigación. HRNet es una arquitectura de modelo de pose que conserva las características de imagen de alta resolución en toda la red, lo que le ayuda a localizar los puntos clave con precisión. AlphaPose es un sistema de estimación de pose de varias personas muy utilizado, especialmente cuando se necesita una gran precisión en escenas concurridas o complejas.
Aplicaciones reales del análisis y la estimación de pose#
La estimación de pose se utiliza cada vez más para convertir vídeos normales en información útil sobre el movimiento. Al seguir los puntos clave corporales fotograma a fotograma, estos sistemas pueden inferir la postura, el movimiento y el comportamiento físico a partir de las imágenes de las cámaras, lo que hace que esta tecnología resulte práctica en muchos entornos reales.
Por ejemplo, en la asistencia sanitaria y la rehabilitación, el seguimiento de la pose puede ayudar a los profesionales clínicos a observar y medir cómo se mueve un paciente durante la terapia y la recuperación. Al extraer puntos de referencia corporales de grabaciones de vídeo normales, puede utilizarse para evaluar la postura, la amplitud de movimiento y los patrones generales de movimiento a lo largo del tiempo. Estas mediciones pueden respaldar y optimizar las evaluaciones clínicas tradicionales y, en algunos casos, facilitar el seguimiento del progreso sin necesidad de sensores ponibles ni equipos especializados.
Del mismo modo, en el deporte y la retransmisión, la estimación de pose puede analizar cómo se mueven los atletas directamente a partir de las imágenes de vídeo. Un ejemplo interesante es Hawk-Eye, un sistema de seguimiento basado en cámaras utilizado en el deporte profesional para el arbitraje y los gráficos de retransmisión. También proporciona seguimiento esquelético al estimar los puntos clave corporales de un atleta a partir de las vistas de las cámaras.
Cómo elegir la herramienta de estimación de pose adecuada#
Elegir la herramienta de estimación de pose adecuada empieza por comprender las necesidades de tu proyecto de visión artificial. Algunas aplicaciones priorizan la velocidad en tiempo real, mientras que otras requieren una mayor precisión y detalle.
El dispositivo de destino para el despliegue también marca la diferencia. Las aplicaciones móviles y los dispositivos periféricos suelen requerir modelos ligeros y eficientes, mientras que los modelos más grandes suelen encajar mejor en servidores o entornos de nube.
Además, la facilidad de uso puede ser importante. Una buena documentación, un despliegue fluido y la compatibilidad con el entrenamiento personalizado pueden agilizar tu proyecto.
En pocas palabras, cada herramienta destaca en áreas diferentes. Por ejemplo, los modelos Ultralytics YOLO ofrecen un equilibrio práctico entre velocidad, precisión y facilidad de despliegue para muchas aplicaciones reales de estimación de pose.

Fig. 5. Estimación de la pose de animales mediante Ultralytics YOLO11 (Fuente)
Conclusiones clave#
La estimación de pose ayuda a los ordenadores a comprender el movimiento humano mediante la detección de puntos clave corporales en imágenes y vídeos. Modelos como YOLO11 y YOLO26 facilitan la creación de aplicaciones en tiempo real para ámbitos como el deporte, la asistencia sanitaria, la seguridad en el lugar de trabajo y las experiencias interactivas. A medida que los modelos siguen siendo más rápidos y precisos, es probable que la estimación de pose se convierta en una función habitual de muchos sistemas de IA de visión.
¿Quieres saber más sobre IA? Visita nuestra comunidad y nuestro repositorio de GitHub. Explora nuestras páginas de soluciones para obtener más información sobre la IA en la robótica y la visión artificial en la fabricación. Descubre nuestras opciones de licencias y empieza a crear con visión artificial hoy mismo.









