Keypoints
Aprende cómo los puntos clave definen la geometría y la postura de los objetos en IA. Explora la estimación de poses con Ultralytics YOLO26 y empieza a utilizar nuestro SDK de Python fácil de usar.
Los puntos clave son ubicaciones espaciales o puntos de referencia diferenciados dentro de una imagen que definen características significativas de un objeto o sujeto. En el contexto de la visión por computador y el aprendizaje automático, un punto clave suele representarse mediante un conjunto de coordenadas (X, Y) que señala una parte específica de un objeto, como el codo de una persona, la esquina de un edificio o el centro de la rueda de un coche. A diferencia de las tareas más sencillas que solo identifican la presencia de un objeto, identificar puntos clave permite que los modelos de inteligencia artificial (AI) comprendan la geometría, la postura y la disposición estructural del sujeto. Esta capacidad es fundamental para el análisis visual avanzado, ya que permite a las máquinas interpretar el lenguaje corporal, seguir movimientos precisos y alinear superposiciones digitales con objetos del mundo real.
El papel de los puntos clave en los modelos de IA#
Los puntos clave sirven como datos fundamentales para la estimación de la pose, una técnica que representa la estructura esquelética de una persona o un animal. Al detectar un conjunto predefinido de puntos, como hombros, rodillas y tobillos, los algoritmos pueden reconstruir la pose completa de un sujeto en tiempo real. Este proceso va más allá de la detección de objetos estándar, que normalmente genera un cuadro delimitador alrededor de un objeto sin comprender su forma interna.
Las arquitecturas modernas, como la Ultralytics YOLO26 de última generación, han evolucionado para predecir estos puntos clave con gran precisión y velocidad. Estos modelos utilizan redes de aprendizaje profundo (DL) entrenadas con enormes conjuntos de datos anotados, como los puntos clave de COCO, para aprender los patrones visuales asociados a las articulaciones y los rasgos faciales. Durante la inferencia, el modelo regresa las coordenadas de cada punto clave e incluye a menudo una puntuación de confianza que indica la fiabilidad de la predicción.
Puntos clave frente a conceptos relacionados#
Para comprender su utilidad específica, resulta útil distinguir los puntos clave de otras salidas habituales de la visión por computador:
- Puntos clave frente a cuadros delimitadores: Un cuadro delimitador proporciona una localización aproximada y encierra todo el objeto en un rectángulo. Los puntos clave proporcionan una localización detallada de partes específicas dentro de ese objeto.
- Puntos clave frente a la segmentación de imágenes: La segmentación de imágenes clasifica cada píxel para crear una máscara precisa de la forma del objeto. Mientras que la segmentación ofrece información detallada sobre los límites, los puntos clave ofrecen un resumen estructural (un «esqueleto»), que suele ser más eficiente para analizar el movimiento y la cinemática.
- Puntos clave frente a descriptores de características: En el procesamiento tradicional de imágenes, como SIFT (Transformada de características invariantes a la escala), los puntos clave son puntos de interés (esquinas, regiones) que se utilizan para comparar imágenes. En la estimación moderna de poses mediante DL, los puntos clave son etiquetas semánticas (por ejemplo, «muñeca izquierda») que aprende la red.
Aplicaciones en el mundo real#
La capacidad de seguir partes específicas del cuerpo o características de los objetos permite habilitar diversas aplicaciones en distintos sectores:
- Análisis deportivo: Los entrenadores y atletas utilizan la estimación de poses para analizar la biomecánica. Al seguir los puntos clave de las articulaciones, los sistemas pueden calcular ángulos y velocidades para mejorar la técnica en deportes como el golf, el tenis o el sprint. Descubre cómo los modelos Ultralytics YOLO siguen los swings de golf para proporcionar información práctica.
- Sanidad y rehabilitación: Las plataformas de fisioterapia aprovechan los puntos clave para supervisar a distancia los ejercicios de los pacientes. El sistema garantiza que los pacientes mantengan una postura correcta durante las rutinas de rehabilitación, reduce el riesgo de lesiones y realiza un seguimiento de la evolución de la recuperación.
- Realidad aumentada (AR): Los filtros de redes sociales y las aplicaciones de prueba virtual dependen de puntos clave faciales (ojos, nariz y contornos de la boca) para fijar máscaras digitales o gafas de forma segura al rostro del usuario y mantener la alineación incluso cuando se mueve.
- Supervisión del conductor: Los sistemas de seguridad de los vehículos siguen los puntos de referencia faciales para detectar signos de somnolencia o distracción y avisan al conductor si cierra los ojos o si la posición de su cabeza indica falta de atención.
Implementación de la detección de puntos clave con Ultralytics YOLO26#
Mediante la Ultralytics Platform o el SDK de Python, los desarrolladores pueden implementar fácilmente la detección de puntos clave. El siguiente ejemplo muestra cómo cargar un modelo YOLO26-pose preentrenado y ejecutar la inferencia sobre una imagen para detectar esqueletos humanos.
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")Este sencillo flujo de trabajo permite implementar rápidamente aplicaciones sofisticadas de visión por computador (CV). Para quienes quieran entrenar sus propios modelos personalizados de puntos clave —por ejemplo, para detectar puntos específicos en maquinaria industrial o en especies animales—, la Ultralytics Platform simplifica el proceso de anotación de datos y entrenamiento de modelos en la nube.
Consideraciones avanzadas#
Implementar correctamente la detección de puntos clave requiere abordar desafíos como la oclusión (cuando una parte del cuerpo queda oculta) y las distintas condiciones de iluminación. Los modelos modernos afrontan estos problemas mediante una ampliación de datos sólida durante el entrenamiento, exponiendo la red a escenarios variados. Además, integrar puntos clave con algoritmos de seguimiento de objetos permite identificar de forma coherente a las personas a lo largo del tiempo en secuencias de vídeo, algo esencial para aplicaciones como la seguridad o el análisis del comportamiento.









