Keypoints
Aprende como os keypoints definem a geometria e postura do objeto em IA. Explora a estimativa de pose com o Ultralytics YOLO26 e começa com o nosso SDK Python fácil de usar.
Os keypoints são localizações espaciais ou marcos distintos dentro de uma imagem que definem características significativas de um objeto ou sujeito. No contexto de computer vision e machine learning, um keypoint é tipicamente representado por um conjunto de coordenadas (X, Y) que apontam com precisão para uma parte específica de um objeto, como o cotovelo de uma pessoa, o canto de um edifício ou o centro da roda de um carro. Ao contrário de tarefas mais simples que apenas identificam a presença de um objeto, a identificação de keypoints permite que os modelos de artificial intelligence (AI) compreendam a geometria, a postura e a disposição estrutural do sujeito. Esta capacidade é fundamental para a análise visual avançada, permitindo que as máquinas interpretem a linguagem corporal, rastreiem movimentos precisos e alinhem sobreposições digitais com objetos do mundo real.
O papel dos Keypoints em modelos de IA#
Os keypoints servem como dados fundamentais para a pose estimation, uma técnica que mapeia a estrutura esquelética de um humano ou animal. Ao detetar um conjunto predefinido de pontos — como ombros, joelhos e tornozelos —, os algoritmos conseguem reconstruir a pose completa de um sujeito em tempo real. Este processo vai além da object detection padrão, que normalmente gera uma bounding box em torno de um objeto sem compreender a sua forma interna.
As arquiteturas modernas, tais como o estado da arte Ultralytics YOLO26, evoluíram para prever estes keypoints com alta precisão e velocidade. Estes modelos utilizam redes de deep learning (DL) treinadas em massivos conjuntos de dados anotados, como o COCO Keypoints, para aprender os padrões visuais associados a articulações e características faciais. Durante a inferência, o modelo faz a regressão das coordenadas para cada keypoint, incluindo frequentemente uma pontuação de confiança para indicar a fiabilidade da previsão.
Keypoints vs. conceitos relacionados#
É útil distinguir keypoints de outras saídas comuns de visão computacional para compreender sua utilidade única:
- Keypoints vs. Bounding Boxes: Uma bounding box fornece uma localização aproximada, envolvendo o objeto inteiro num retângulo. Os keypoints fornecem uma localização de granulação fina de partes específicas dentro desse objeto.
- Keypoints vs. Image Segmentation: A image segmentation classifica cada pixel para criar uma máscara precisa da forma do objeto. Embora a segmentação ofereça informações detalhadas sobre os limites, os keypoints oferecem um resumo estrutural (um "esqueleto") que é frequentemente mais eficiente para analisar o movimento e a kinematics.
- Keypoints vs. Feature Descriptors: No processamento de imagem tradicional como o SIFT (Scale-Invariant Feature Transform), os keypoints são pontos de interesse (cantos, manchas) usados para correspondência de imagens. Na estimation de pose moderna por DL, os keypoints são rótulos semânticos (por exemplo, "pulso esquerdo") aprendidos pela rede.
Aplicações no Mundo Real#
A capacidade de rastrear partes específicas do corpo ou características de objetos desbloqueia diversas aplicações em vários setores:
- Sports Analytics: Treinadores e atletas utilizam a estimation de pose para analisar a biomecânica. Ao rastrear keypoints nas articulações, os sistemas podem calcular ângulos e velocidades para melhorar a técnica em desportos como golfe, ténis ou corrida de velocidade. Vê como os Ultralytics YOLO models track golf swings para fornecer feedback acionável.
- Saúde e reabilitação: Plataformas de fisioterapia aproveitam keypoints para monitorar exercícios de pacientes remotamente. O sistema garante que os pacientes mantenham a forma correta durante as rotinas de reabilitação, reduzindo o risco de lesões e rastreando o progresso da recuperação.
- Realidade Aumentada (AR): Filtros de redes sociais e aplicações de prova virtual dependem de keypoints faciais (olhos, nariz, contornos da boca) para ancorar máscaras digitais ou óculos de forma segura no rosto de um usuário, mantendo o alinhamento mesmo quando ele se move.
- Monitoramento de motoristas: Sistemas de segurança automotiva rastreiam marcos faciais para detectar sinais de sonolência ou distração, alertando o motorista se seus olhos se fecharem ou se a posição de sua cabeça indicar falta de atenção.
Implementando a deteção de pontos-chave com o Ultralytics YOLO26#
Utilizando a Ultralytics Platform ou o SDK em Python, os programadores podem implementar facilmente a deteção de keypoints. O exemplo seguinte demonstra como carregar um modelo YOLO26-pose model pré-treinado e executar a inferência numa imagem para detetar esqueletos humanos.
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")Este fluxo de trabalho simples permite a implementação rápida de aplicações de computer vision (CV) sofisticadas. Para utilizadores que pretendem treinar os seus próprios modelos de keypoints personalizados — por exemplo, para detetar pontos específicos em maquinaria industrial ou espécies animais —, a Ultralytics Platform simplifica o processo de anotação de dados e treino de modelos na cloud.
Considerações avançadas#
A implementação bem-sucedida da deteção de keypoints requer a gestão de desafios como a oclusão (quando uma parte do corpo está oculta) e diversas condições de iluminação. Os modelos modernos resolvem isto através de uma robusta data augmentation durante o treino, expondo a rede a cenários variados. Além disso, a integração de keypoints com algoritmos de object tracking permite a identificação consistente de indivíduos ao longo do tempo em streams de vídeo, o que é essencial para aplicações como segurança ou análise comportamental.






