Keypoints
Aprende cómo los puntos clave definen la geometría y la postura de un objeto en IA. Explora la estimación de pose con Ultralytics YOLO26 y empieza a usar nuestro SDK de Python fácil de usar.
Los keypoints son ubicaciones espaciales o puntos de referencia distintos dentro de una imagen que definen características significativas de un objeto o sujeto. En el contexto de la visión artificial y el aprendizaje automático, un keypoint se representa normalmente mediante un conjunto de coordenadas (X, Y) que señalan con precisión una parte específica de un objeto, como el codo de una persona, la esquina de un edificio o el centro de la rueda de un coche. A diferencia de las tareas más simples que solo identifican la presencia de un objeto, identificar keypoints permite a los modelos de inteligencia artificial (IA) comprender la geometría, la postura y la disposición estructural del sujeto. Esta capacidad es fundamental para el análisis visual avanzado, permitiendo que las máquinas interpreten el lenguaje corporal, realicen un seguimiento de movimientos precisos y alineen superposiciones digitales con objetos del mundo real.
El papel de los keypoints en los modelos de IA#
Los keypoints sirven como datos fundamentales para la estimación de poses, una técnica que mapea la estructura esquelética de un humano o un animal. Al detectar un conjunto predefinido de puntos —como hombros, rodillas y tobillos—, los algoritmos pueden reconstruir la pose completa de un sujeto en tiempo real. Este proceso va más allá de la detección de objetos estándar, que normalmente genera una caja delimitadora alrededor de un objeto sin comprender su forma interna.
Las arquitecturas modernas, como el avanzado Ultralytics YOLO26, han evolucionado para predecir estos keypoints con gran precisión y velocidad. Estos modelos utilizan redes de aprendizaje profundo (DL) entrenadas en masivos conjuntos de datos anotados, como COCO Keypoints, para aprender los patrones visuales asociados con las articulaciones y los rasgos faciales. Durante la inferencia, el modelo regresa las coordenadas de cada keypoint, incluyendo a menudo una puntuación de confianza para indicar la fiabilidad de la predicción.
Keypoints frente a conceptos relacionados#
Es útil distinguir los keypoints de otros resultados comunes de la visión por ordenador para comprender su utilidad única:
- Keypoints frente a cajas delimitadoras: Una caja delimitadora proporciona una localización aproximada, encerrando todo el objeto en un rectángulo. Los keypoints proporcionan una localización precisa de partes específicas dentro de ese objeto.
- Keypoints frente a segmentación de imágenes: La segmentación de imágenes clasifica cada píxel para crear una máscara precisa de la forma del objeto. Aunque la segmentación ofrece información detallada de los contornos, los keypoints ofrecen un resumen estructural (un "esqueleto") que suele ser más eficiente para analizar el movimiento y la cinemática.
- Keypoints frente a descriptores de características: En el procesamiento de imágenes tradicional como SIFT (Scale-Invariant Feature Transform), los keypoints son puntos de interés (esquinas, manchas) utilizados para la concordancia de imágenes. En la estimación de poses moderna mediante DL, los keypoints son etiquetas semánticas (por ejemplo, "muñeca izquierda") aprendidas por la red.
Aplicaciones en el mundo real#
La capacidad de rastrear partes específicas del cuerpo o características de los objetos abre diversas aplicaciones en todas las industrias:
- Análisis deportivo: Los entrenadores y atletas utilizan la estimación de poses para analizar la biomecánica. Al realizar un seguimiento de los keypoints en las articulaciones, los sistemas pueden calcular ángulos y velocidades para mejorar la técnica en deportes como el golf, el tenis o las carreras de velocidad. Descubre cómo los modelos Ultralytics YOLO realizan un seguimiento de los swings de golf para proporcionar información práctica.
- Atención sanitaria y rehabilitación: Las plataformas de fisioterapia aprovechan los keypoints para controlar los ejercicios de los pacientes de forma remota. El sistema asegura que los pacientes mantengan una forma correcta durante las rutinas de rehabilitación, reduciendo el riesgo de lesiones y haciendo un seguimiento del progreso de recuperación.
- Realidad aumentada (RA): Los filtros de redes sociales y las aplicaciones de prueba virtual dependen de los keypoints faciales (contornos de ojos, nariz, boca) para anclar máscaras digitales o gafas de forma segura al rostro del usuario, manteniendo la alineación incluso mientras se mueve.
- Monitorización del conductor: Los sistemas de seguridad automotriz rastrean puntos de referencia faciales para detectar signos de somnolencia o distracción, alertando al conductor si sus ojos se cierran o si la posición de su cabeza indica falta de atención.
Implementación de la detección de keypoints con Ultralytics YOLO26#
Utilizando la plataforma Ultralytics o el SDK de Python, los desarrolladores pueden implementar fácilmente la detección de keypoints. El siguiente ejemplo demuestra cómo cargar un modelo YOLO26-pose preentrenado y ejecutar la inferencia en una imagen para detectar esqueletos humanos.
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")Este flujo de trabajo sencillo permite el despliegue rápido de aplicaciones sofisticadas de visión artificial (CV). Para los usuarios que buscan entrenar sus propios modelos de keypoints personalizados —por ejemplo, para detectar puntos específicos en maquinaria industrial o especies animales—, la plataforma Ultralytics simplifica el proceso de anotación de datos y entrenamiento de modelos en la nube.
Consideraciones avanzadas#
El despliegue exitoso de la detección de keypoints requiere gestionar desafíos como la oclusión (cuando una parte del cuerpo está oculta) y diversas condiciones de iluminación. Los modelos modernos abordan esto mediante una sólida aumento de datos durante el entrenamiento, exponiendo la red a diversos escenarios. Además, la integración de keypoints con algoritmos de seguimiento de objetos permite la identificación coherente de individuos a lo largo del tiempo en secuencias de vídeo, algo esencial para aplicaciones como la seguridad o el análisis de comportamiento.






