¿Qué es OpenPose? Explorando un hito en la estimación de poses
Explora cómo puede utilizarse OpenPose para la estimación de poses en aplicaciones de visión por computador. Descubre sus funciones y su importancia en la IA de visión.

Hoy en día, las imágenes y las cámaras están por todas partes: integradas en nuestros teléfonos, hogares e incluso espacios públicos. No solo las usamos para capturar momentos, sino también para ayudarnos a entender e interactuar con el mundo que nos rodea.
La visión por computador, un subcampo de la inteligencia artificial (AI), hace posible todo esto al permitir que las máquinas interpreten datos visuales. Permite a los sistemas detectar objetos, reconocer rostros y seguir movimientos, desempeñando un papel clave en muchas de las tecnologías que utilizamos a diario.
Gracias a los avances recientes en AI, los modelos de visión por computador ahora pueden analizar y extraer datos e información más complejos. Un ejemplo de ello es la estimación de la pose, una tarea de visión por computador centrada en comprender el movimiento humano.
Funciona identificando puntos clave del cuerpo, como hombros, codos y rodillas, en imágenes o vídeos. Esto permite analizar cómo se mueven las personas, haciendo posibles aplicaciones en el seguimiento de la actividad física, la animación, la sanidad y mucho más.
Entre las numerosas herramientas desarrolladas para la estimación de la pose, OpenPose destaca como un gran avance. Creado por investigadores del Perceptual Computing Lab de Carnegie Mellon University, fue uno de los primeros sistemas de código abierto capaces de detectar poses de cuerpo completo, incluidas las manos, los pies y los puntos clave faciales, de varias personas en tiempo real usando únicamente una cámara (con hasta 135 puntos clave por persona).
En este artículo exploraremos OpenPose, cómo funciona y su importancia como hito en la visión por computador.

Fig 1. Estimación de la pose de varias personas con OpenPose.
Un vistazo a la historia de la estimación de la pose#
Antes de que la AI se adoptara ampliamente, el seguimiento del movimiento humano en vídeos implicaba utilizar equipos especializados. En sectores como el cine y la animación, los actores solían llevar trajes con marcadores reflectantes para que las cámaras pudieran capturar sus movimientos en un entorno de estudio controlado.
Aunque estas técnicas de captura de movimiento basadas en marcadores eran precisas, también resultaban caras y estaban limitadas a configuraciones específicas. A medida que avanzaba la visión por computador, los investigadores buscaron formas de seguir el movimiento corporal sin utilizar marcadores. Usaron bordes, contornos y plantillas para encontrar formas humanas en las imágenes.
Estos primeros sistemas funcionaban en casos sencillos y directos, pero tenían dificultades en situaciones del mundo real. A menudo ofrecían malos resultados cuando las personas se movían de forma inesperada o cuando aparecía más de una persona en un fotograma.
A finales de la década de 2010, el aprendizaje profundo provocó un cambio importante en la estimación de la pose. Los modelos de AI para visión podían entrenarse con grandes conjuntos de datos de poses humanas. En lugar de depender de bordes y plantillas, los modelos aprendían a reconocer las articulaciones y la estructura corporales estudiando miles de imágenes etiquetadas. Esto hizo que la estimación de la pose fuera más precisa, flexible y útil en una gama más amplia de entornos.

Fig 2. Evolución de los modelos de estimación de la pose humana de 2017 a 2023.
OpenPose: el punto de partida de la estimación moderna de la pose#
OpenPose se publicó por primera vez en 2017 y es capaz de estimar simultáneamente las poses de varias personas en una sola imagen. A diferencia de los sistemas anteriores, OpenPose no necesita trajes ni marcadores especiales. Funciona con cámaras estándar y puede procesar imágenes y vídeos en tiempo real. Estas características hicieron que la estimación de la pose fuera más accesible para desarrolladores e investigadores.
Los cimientos que OpenPose estableció para la visión por computador ayudaron a otros a crear arquitecturas más recientes para muchas otras aplicaciones. Hoy, los modelos de AI para visión, como Ultralytics YOLOv8 y Ultralytics YOLO11, compatibles con tareas de estimación de la pose, ofrecen resultados más rápidos y una latencia menor.

Fig 3. Uso de YOLO11 para la estimación de la pose.
Sin embargo, OpenPose es un excelente punto de partida si te interesa saber cómo ha evolucionado la estimación de la pose. Introdujo ideas clave en las que muchos sistemas más recientes siguen basándose hoy.
Capacidades clave de OpenPose#
Ahora que entendemos mejor por qué es importante OpenPose, veamos más de cerca qué puede hacer realmente.
En el centro de las capacidades de OpenPose se encuentra algo llamado detección de puntos clave. Los puntos clave son referencias específicas del cuerpo humano, como la punta de la nariz, el centro de los hombros, los codos, las muñecas, las caderas, las rodillas y los tobillos. OpenPose puede detectar hasta 135 de estos puntos por persona, incluidas zonas detalladas como los dedos y los rasgos faciales.
Cuando estos puntos se conectan, forman una representación simplificada del cuerpo humano; puedes pensar en ella como un esqueleto digital. Este esquema esquelético muestra no solo dónde está una persona, sino también cómo está colocada: si está sentada, de pie, saludando, sonriendo o caminando. Los ordenadores pueden interpretar visualmente el movimiento humano usando estos esqueletos, de forma muy parecida a cómo entendemos instintivamente el lenguaje corporal de alguien.
El seguimiento esquelético resulta especialmente útil porque elimina el ruido y las distracciones del fondo, permitiendo que el sistema se centre exclusivamente en la postura y el movimiento humanos. En lugar de analizar cada píxel, OpenPose se concentra en puntos significativos que cuentan cómo se mueve o interactúa una persona.
Al extraer esta información estructurada de imágenes o vídeos cotidianos, OpenPose permite crear aplicaciones que responden a gestos, supervisan la actividad física, evalúan señales emocionales o incluso animan personajes digitales.
¿Cómo funciona OpenPose?#
Este es un resumen de cómo OpenPose detecta y conecta puntos clave del cuerpo humano a partir de una entrada visual:
- Empieza con una imagen: OpenPose toma una sola imagen de una fotografía, un vídeo o una señal de cámara en directo.
- Detecta las partes importantes del cuerpo: El sistema busca puntos clave del cuerpo, como la nariz, los codos, las muñecas, las rodillas y los tobillos. Los marca allí donde tiene la certeza de que se encuentra una parte del cuerpo.
- Determina qué partes están conectadas: A continuación, OpenPose comprueba cómo se conectan los puntos clave. Utiliza cálculos matemáticos para decidir qué articulaciones pertenecen a la misma persona; por ejemplo, asociar una muñeca con el codo y el hombro derechos.
- Dibuja un esqueleto para cada persona: Después de agrupar los puntos clave, OpenPose los conecta en una «figura de palitos» que muestra la pose de cada persona. Esto funciona incluso cuando aparecen varias personas en el mismo fotograma.
- Devuelve los datos de la pose: Por último, proporciona las posiciones exactas de todos los puntos clave detectados. Estos datos pueden utilizarse para seguir movimientos, reconocer gestos o crear herramientas interactivas, todo ello en tiempo real.

Fig 4. Detección y seguimiento de puntos clave humanos con OpenPose.
Aplicaciones de la estimación de la pose en distintos sectores con OpenPose#
OpenPose fue una de las primeras herramientas avanzadas que hicieron práctica la estimación de la pose para diversos casos de uso reales. Aunque hoy no se utiliza habitualmente en soluciones de visión por computador en tiempo real, desempeñó un papel importante en los primeros trabajos de ámbitos como el deporte, el entretenimiento, la educación y la seguridad.
Veamos más de cerca cómo ayudó a allanar el camino en estas áreas.
Estimación de la pose con OpenPose para el fitness y el deporte#
Cuando ves un partido de béisbol, es fácil entender lo que ocurre: reconoces al instante un lanzamiento, un bateo o el robo de una base. Como seres humanos, leemos intuitivamente los movimientos corporales y les damos sentido sin apenas esfuerzo. Para las máquinas, en cambio, reconocer estas acciones es mucho más complejo. Necesitan información precisa sobre cómo se mueve cada parte del cuerpo por el espacio.
OpenPose supuso un avance considerable en este ámbito de la visión por computador. Era una herramienta práctica para analizar la técnica deportiva en diversos entornos.
Muchos proyectos de investigación utilizaron OpenPose para descomponer movimientos como bateos y saltos, e incluso clasificar acciones específicas de béisbol según cómo se movían los jugadores. Como funcionaba en entornos abiertos con vídeo estándar, permitió a los investigadores probar cómo podrían funcionar estos sistemas en situaciones reales de entrenamiento o preparación.
Estos primeros estudios ayudaron a sentar las bases de las herramientas de seguimiento del rendimiento que ahora se utilizan en la tecnología deportiva avanzada.

Fig 5. Un vistazo a un flujo de trabajo de clasificación de acciones de béisbol con OpenPose.
Uso de OpenPose en sistemas de seguridad y protección#
Del mismo modo, los investigadores también utilizaron OpenPose para explorar cómo el seguimiento de poses basado en vídeo podía contribuir a la supervisión de la seguridad. Se probó para detectar comportamientos como caídas, gestos inesperados o patrones de movimiento en zonas públicas.
Como funcionaba con cámaras estándar, OpenPose hizo más accesible la experimentación inicial en entornos como hospitales y centros de transporte. Estos estudios ayudaron a impulsar el desarrollo de modelos más recientes, que ahora se utilizan en sistemas de vigilancia, detección de caídas y respuesta ante emergencias.

Fig 6. Detección de caídas habilitada por OpenPose.
Ventajas e inconvenientes de OpenPose#
Estas son algunas de las ventajas que ofrece OpenPose:
- Útil para la investigación y la creación de prototipos: Se ha utilizado ampliamente en la investigación académica, especialmente en ámbitos como la interacción persona-ordenador, la biomecánica y el análisis del comportamiento.
- Compatibilidad multiplataforma: Puede ejecutarse en Windows, Linux y macOS, con compatibilidad tanto con unidades centrales de procesamiento (CPUs) como con unidades de procesamiento gráfico (GPUs).
- Capacidad de procesamiento sin conexión: Puede ejecutarse en entornos sin acceso a Internet, por lo que resulta ideal para contextos sensibles a la privacidad, como la sanidad o la educación.
Aunque OpenPose supuso un gran avance, también presenta limitaciones técnicas importantes que conviene tener en cuenta. Estos son algunos de los principales desafíos asociados a OpenPose:
- Altos requisitos de procesamiento: Ejecutar OpenPose en tiempo real requiere una GPU potente y considerables recursos informáticos.
- Sensibilidad al entorno: El rendimiento puede disminuir con poca luz, en espacios concurridos o cuando los ángulos de la cámara no son ideales.
- Más pesado que los modelos recientes: En comparación con los modelos de estimación de la pose más recientes, OpenPose es relativamente grande y lento. No se adapta bien al despliegue en dispositivos con recursos limitados, como smartphones, tabletas o sistemas integrados.
Conclusiones clave#
OpenPose desempeñó un papel importante a la hora de hacer más accesible la estimación de la pose. Demostró que el seguimiento de los movimientos corporales podía realizarse con una cámara sencilla, sin depender de trajes ni equipos especializados.
Sentó las bases de muchas aplicaciones prácticas en los ámbitos de la sanidad, la educación, el entretenimiento y la investigación. Aunque los modelos más recientes ofrecen ahora mayor velocidad y un rendimiento más ligero, OpenPose sigue siendo un punto de referencia clave para comprender cómo ha evolucionado la estimación de la pose.
Únete a nuestra comunidad y visita nuestro repositorio de GitHub para obtener más información sobre AI. Si quieres crear tus propias soluciones de visión por computador, consulta nuestras opciones de licencia. También puedes descubrir cómo la visión por computador en la sanidad y la AI en la logística están generando un impacto.









