Keypoints
Aprende como os keypoints definem a geometria e a postura dos objetos em IA. Explora a estimativa de pose com o Ultralytics YOLO26 e começa a utilizar o nosso Python SDK fácil de usar.
Os pontos-chave são localizações espaciais distintas ou pontos de referência numa imagem que definem características significativas de um objeto ou indivíduo. No contexto da visão computacional e da aprendizagem automática, um ponto-chave é normalmente representado por um conjunto de coordenadas (X, Y) que identifica precisamente uma parte específica de um objeto, como o cotovelo de uma pessoa, o canto de um edifício ou o centro da roda de um carro. Ao contrário de tarefas mais simples que apenas identificam a presença de um objeto, a identificação de pontos-chave permite que os modelos de inteligência artificial (AI) compreendam a geometria, a postura e a disposição estrutural do indivíduo. Esta capacidade é fundamental para análises visuais avançadas, permitindo que as máquinas interpretem a linguagem corporal, acompanhem movimentos precisos e alinhem sobreposições digitais com objetos do mundo real.
O papel dos pontos-chave nos modelos de AI#
Os pontos-chave servem como dados fundamentais para a estimativa de pose, uma técnica que mapeia a estrutura esquelética de uma pessoa ou animal. Ao detetar um conjunto predefinido de pontos — como ombros, joelhos e tornozelos — os algoritmos conseguem reconstruir a pose completa de um indivíduo em tempo real. Este processo vai além da deteção de objetos convencional, que normalmente produz uma caixa delimitadora em torno de um objeto sem compreender a sua forma interna.
As arquiteturas modernas, como a Ultralytics YOLO26 de última geração, evoluíram para prever estes pontos-chave com elevada precisão e velocidade. Estes modelos utilizam redes de aprendizagem profunda (DL) treinadas com enormes conjuntos de dados anotados, como COCO Keypoints, para aprender os padrões visuais associados a articulações e características faciais. Durante a inferência, o modelo faz a regressão das coordenadas de cada ponto-chave, incluindo frequentemente uma pontuação de confiança que indica a fiabilidade da previsão.
Pontos-chave vs. conceitos relacionados#
É útil distinguir os pontos-chave de outras saídas comuns da visão computacional para compreender a sua utilidade específica:
- Pontos-chave vs. caixas delimitadoras: Uma caixa delimitadora fornece uma localização aproximada, envolvendo todo o objeto num retângulo. Os pontos-chave fornecem uma localização detalhada de partes específicas dentro desse objeto.
- Pontos-chave vs. segmentação de imagens: A segmentação de imagens classifica cada pixel para criar uma máscara precisa da forma do objeto. Embora a segmentação ofereça informações detalhadas sobre os contornos, os pontos-chave fornecem um resumo estrutural (um "esqueleto") que é frequentemente mais eficiente para analisar o movimento e a cinemática.
- Pontos-chave vs. descritores de características: No processamento tradicional de imagens, como o SIFT (Transformada de características invariante à escala), os pontos-chave são pontos de interesse (cantos, regiões) utilizados para a correspondência de imagens. Na estimativa de pose moderna com DL, os pontos-chave são rótulos semânticos (por exemplo, "pulso esquerdo") aprendidos pela rede.
Aplicações no mundo real#
A capacidade de acompanhar partes específicas do corpo ou características de objetos permite aplicações diversificadas em vários setores:
- Análise desportiva: Treinadores e atletas utilizam a estimativa de pose para analisar a biomecânica. Ao acompanhar os pontos-chave nas articulações, os sistemas podem calcular ângulos e velocidades para melhorar a técnica em desportos como golfe, ténis ou corrida de velocidade. Vê como os modelos Ultralytics YOLO acompanham tacadas de golfe para fornecer feedback útil.
- Cuidados de saúde e reabilitação: As plataformas de fisioterapia utilizam pontos-chave para monitorizar remotamente os exercícios dos pacientes. O sistema garante que os pacientes mantêm a postura correta durante as rotinas de reabilitação, reduzindo o risco de lesões e acompanhando a evolução da recuperação.
- Realidade aumentada (AR): Os filtros das redes sociais e as aplicações de experimentação virtual dependem de pontos-chave faciais (olhos, nariz e contornos da boca) para fixar máscaras ou óculos digitais de forma segura no rosto do utilizador, mantendo o alinhamento mesmo quando este se move.
- Monitorização do condutor: Os sistemas de segurança automóvel acompanham pontos de referência faciais para detetar sinais de sonolência ou distração, alertando o condutor se os seus olhos se fecharem ou se a posição da cabeça indicar falta de atenção.
Implementação da deteção de pontos-chave com Ultralytics YOLO26#
Utilizando a Ultralytics Platform ou o SDK de Python, os programadores podem implementar facilmente a deteção de pontos-chave. O exemplo seguinte demonstra como carregar um modelo YOLO26-pose pré-treinado e executar a inferência numa imagem para detetar esqueletos humanos.
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results showing detected keypoints and skeletons
for result in results:
result.show() # Display the image with keypoints drawn
# Access keypoint coordinates (x, y, confidence)
keypoints = result.keypoints.data
print(f"Detected keypoints shape: {keypoints.shape}")Este fluxo de trabalho simples permite a implementação rápida de aplicações sofisticadas de visão computacional (CV). Para os utilizadores que pretendem treinar os seus próprios modelos personalizados de pontos-chave — por exemplo, para detetar pontos específicos em maquinaria industrial ou em espécies animais — a Ultralytics Platform simplifica o processo de anotação de dados e treino de modelos na cloud.
Considerações avançadas#
A implementação bem-sucedida da deteção de pontos-chave exige lidar com desafios como a oclusão (quando uma parte do corpo está escondida) e condições de iluminação diversificadas. Os modelos modernos abordam estes desafios através de uma aumento de dados robusto durante o treino, expondo a rede a cenários variados. Além disso, a integração de pontos-chave com algoritmos de acompanhamento de objetos permite a identificação consistente de indivíduos ao longo do tempo em fluxos de vídeo, algo essencial para aplicações como segurança ou análise comportamental.









