O guia completo das ferramentas de estimativa de pose
Aprende como as ferramentas de estimativa de pose podem ser utilizadas para detetar pontos-chave do corpo em imagens e vídeo, estimar poses 2D e 3D e impulsionar várias aplicações de IA de visão.

Como seres humanos, interpretamos o movimento instintivamente. Quando alguém se inclina para a frente, vira a cabeça ou levanta um braço, conseguimos inferir imediatamente o que está a fazer. É uma capacidade discreta, quase subconsciente, que molda a forma como interagimos com as pessoas e exploramos o mundo.
À medida que a tecnologia se torna uma parte cada vez maior da vida quotidiana, é natural querermos que os nossos dispositivos compreendam o movimento com a mesma facilidade que nós. Os avanços recentes na inteligência artificial, especialmente os avanços baseados em aprendizagem profunda, estão a tornar isso possível. Em particular, a visão computacional ajuda as máquinas a extrair significado de imagens e vídeos e está a impulsionar este progresso.
Por exemplo, a estimativa de pose é uma tarefa comum de visão computacional que prevê as localizações de pontos-chave predefinidos do corpo (como os ombros, cotovelos, ancas e joelhos) numa imagem ou num fotograma de vídeo. Estes pontos-chave podem ser ligados através de uma definição fixa de esqueleto para formar uma representação simplificada da pose.
Modelos de visão computacional como o Ultralytics YOLO11 e o próximo Ultralytics YOLO26 suportam tarefas como a estimativa de pose e podem ser utilizados para alimentar aplicações em tempo real, incluindo feedback sobre a técnica em fitness e desporto, monitorização de segurança e experiências interativas de realidade aumentada.

Fig. 1. Uma visão geral da utilização do Ultralytics YOLO11 para estimativa de pose (Fonte)
Neste artigo, vamos explorar em profundidade as ferramentas de estimativa de pose e ver como funciona a estimativa de pose, onde é utilizada e quais são alguns dos principais modelos e bibliotecas disponíveis atualmente. Vamos começar!
O que é a estimativa de pose?#
A estimativa de pose é uma técnica de visão computacional que ajuda um sistema a compreender como uma pessoa ou um objeto está posicionado numa imagem ou num vídeo. Em vez de analisar todos os píxeis da mesma forma, prevê um conjunto de pontos de referência consistentes, como a cabeça, os ombros, os cotovelos, as ancas, os joelhos e os tornozelos.
A maioria dos modelos produz as coordenadas destes pontos-chave e uma pontuação que reflete a probabilidade de cada previsão estar correta. Estes pontos-chave podem então ser ligados através de uma disposição predefinida do esqueleto para formar uma representação simples da pose.
Quando aplicados fotograma a fotograma em vídeos, os pontos-chave resultantes podem ser associados ao longo do tempo para estimar o movimento. Isto permite aplicações como verificações da técnica, análise de movimentos e interação baseada em gestos.

Fig. 2. Um exemplo de estimativa de pose (Fonte)
A necessidade de ferramentas de estimativa de pose#
O movimento humano contém muita informação. A forma como alguém se dobra, estende o corpo ou muda o peso pode revelar intenção, esforço, fadiga ou até risco de lesão. Até recentemente, captar esse nível de detalhe exigia normalmente sensores especializados, fatos de captura de movimento ou ambientes laboratoriais controlados.
A estimativa de pose muda isso. A extração de pontos de referência corporais de imagens e vídeos comuns permite que os computadores analisem o movimento utilizando câmaras padrão. Isto torna a análise do movimento mais acessível, escalável e prática em contextos reais.
Eis algumas formas como a estimativa de pose pode gerar impacto:
- Locais de trabalho mais seguros: os sistemas orientados por visão podem ser utilizados para detetar posturas de risco, esforço repetitivo ou técnicas de levantamento inseguras antes que ocorram lesões.
- Melhor treino de fitness e desporto: as soluções de IA de visão podem avaliar a técnica, o equilíbrio e a execução em tempo real, fornecendo feedback imediato aos utilizadores sem dispositivos vestíveis.
- Cuidados de saúde e reabilitação: os profissionais de saúde podem acompanhar remotamente a evolução da recuperação, a postura e a amplitude de movimento utilizando simples gravações de vídeo.
- Experiências interativas: a estimativa de pose facilita o acompanhamento e a representação precisa do movimento humano por avatares digitais e ambientes imersivos.
A evolução dos algoritmos de estimativa de pose#
A ideia de estimar poses existe há muitos anos. As primeiras abordagens utilizavam modelos geométricos simples e regras elaboradas manualmente, funcionando normalmente apenas em condições controladas.
Por exemplo, um sistema podia ter um bom desempenho quando uma pessoa permanecia imóvel numa posição fixa, mas falhar quando começava a caminhar, a virar-se ou a interagir com objetos em cenas do mundo real. Estes métodos tinham frequentemente dificuldades com movimentos naturais, ângulos de câmara variáveis, fundos desorganizados e oclusão parcial.
A estimativa de pose moderna baseia-se na aprendizagem profunda para lidar com estes desafios. Ao treinarem redes neuronais convolucionais com grandes conjuntos de dados anotados, os modelos aprendem padrões visuais que os ajudam a detetar pontos-chave de forma mais fiável em diferentes poses, pessoas e ambientes.
Com mais exemplos, o modelo melhora as suas previsões e torna-se melhor a generalizar para novas cenas. Graças a este progresso, a estimativa de pose suporta atualmente uma vasta gama de casos de utilização prática, incluindo a monitorização do local de trabalho e a ergonomia, bem como a análise desportiva, na qual treinadores e analistas estudam a forma como os atletas se movem.
Tipos de técnicas de estimativa de pose#
A estimativa de pose assume algumas formas diferentes, dependendo do contexto e do que é necessário medir. Eis os principais tipos que encontrarás:
- Estimativa de pose 2D: esta abordagem deteta pontos-chave do corpo numa imagem ou num fotograma de vídeo bidimensional. Funciona bem com câmaras padrão e é eficiente do ponto de vista computacional, sendo adequada para tarefas como o acompanhamento básico de movimentos, a análise da postura e o feedback da técnica em tempo real.
- Estimativa de pose 3D: ao estimar a profundidade além das coordenadas da imagem, a estimativa de pose 3D proporciona uma compreensão espacial do movimento corporal. É especialmente útil quando o movimento para a frente e para trás é importante, como na análise desportiva, reabilitação, biomecânica e animação. Especificamente, a estimativa de pose humana 3D capta as posições e os movimentos das articulações no espaço 3D, reduzindo a ambiguidade que pode ocorrer com projeções 2D.
- Estimativa de pose de uma só pessoa: estes sistemas foram concebidos para acompanhar uma pessoa de cada vez. Tendem a ter o melhor desempenho em contextos controlados ou sem controlados, nos quais o sujeito é claramente visível, como aplicações de exercício orientado, videochamadas ou configurações de análise de movimento.
- Estimativa de pose de várias pessoas: concebida para cenas com várias pessoas, esta abordagem deteta e acompanha simultaneamente as poses de vários indivíduos. É particularmente útil em ambientes movimentados, como locais de trabalho, ginásios, espaços públicos e atividades de grupo, onde os sujeitos podem sobrepor-se ou ocultar-se uns aos outros.

Fig. 3. Compreender o movimento humano no espaço 3D versus o espaço de imagem 2D (Fonte)
Compreender como funcionam os modelos de estimativa de pose humana#
A estimativa de pose pode ser aplicada a muitos tipos de objetos, mas, para simplificar, vamos concentrar-nos na estimativa de pose humana.
A maioria dos sistemas de estimativa de pose humana é treinada com conjuntos de dados anotados nos quais as partes principais do corpo estão identificadas em grandes coleções de imagens e fotogramas de vídeo. Com estes exemplos, o modelo aprende padrões visuais associados a pontos de referência do corpo humano, como os ombros, cotovelos, ancas, joelhos e tornozelos, para conseguir prever pontos-chave com precisão em novas cenas.
Outro aspeto importante é a arquitetura de inferência do modelo, que determina como este deteta os pontos-chave e os reúne em poses completas. Alguns sistemas detetam primeiro cada pessoa e depois estimam os pontos-chave dentro da região de cada pessoa, enquanto outros detetam pontos-chave em toda a imagem e depois agrupam-nos por indivíduo. Os designs mais recentes de uma só etapa podem prever poses numa única passagem, equilibrando velocidade e precisão para utilização em tempo real.
Em seguida, vamos analisar detalhadamente as diferentes abordagens à estimativa de pose.
Estimativa de pose de baixo para cima#
Numa abordagem de baixo para cima, o modelo observa a imagem inteira e encontra primeiro os pontos-chave do corpo, como a cabeça, os ombros, os cotovelos, as ancas, os joelhos e os tornozelos. Nesta fase, não tenta separar as pessoas. Limita-se a detetar todos os pontos-chave ou articulações corporais definidos pelo esqueleto da pose em toda a cena.
Depois disso, o sistema executa uma segunda etapa para ligar os pontos. Liga os pontos-chave que pertencem uns aos outros e agrupa-os em esqueletos completos, um por pessoa. Como não precisa de detetar primeiro cada pessoa, os métodos de baixo para cima funcionam frequentemente bem em cenas com muita gente, nas quais as pessoas se sobrepõem, aparecem em tamanhos diferentes ou estão parcialmente ocultas.
Deteção de pose de cima para baixo#
Em contrapartida, os sistemas de cima para baixo começam por detetar primeiro cada pessoa na imagem. Colocam uma caixa delimitadora à volta de cada indivíduo e tratam cada caixa como uma região própria para análise.
Depois de isolar uma pessoa, o modelo prevê os pontos-chave do corpo dentro dessa região. Esta configuração passo a passo produz frequentemente resultados muito precisos, especialmente quando há poucas pessoas na cena e cada uma está claramente visível.
Estimativa de pose de uma só etapa ou híbrida#
Os modelos de uma só etapa, por vezes chamados híbridos, preveem poses numa única passagem. Em vez de executarem primeiro a deteção de pessoas e depois a estimativa de pontos-chave, produzem a localização da pessoa e os pontos-chave do corpo ao mesmo tempo.
Como tudo acontece num único módulo, estes modelos são frequentemente mais rápidos e eficientes, o que os torna adequados para utilizações em tempo real, como o acompanhamento de movimentos ao vivo e a captura de movimento. Modelos como o Ultralytics YOLO11 baseiam-se nesta ideia, procurando equilibrar velocidade com previsões fiáveis de pontos-chave.
Treinar e avaliar modelos de estimativa de pose#
Independentemente da abordagem utilizada, um modelo de estimativa de pose continua a precisar de ser treinado e testado cuidadosamente antes de ser fiável no mundo real. Normalmente, aprende com grandes conjuntos de imagens (e, por vezes, de vídeos) nos quais os pontos-chave do corpo estão identificados, o que o ajuda a lidar com diferentes poses, ângulos de câmara e ambientes.
Alguns conjuntos de dados de estimativa de pose conhecidos incluem COCO Keypoints, MPII Human Pose, CrowdPose e OCHuman. Quando estes conjuntos de dados não refletem as condições que o modelo enfrentará na implementação, os engenheiros recolhem e anotam frequentemente imagens adicionais do contexto-alvo, como o chão de fábrica, um ginásio ou uma clínica.

Fig. 4. Várias poses a serem estimadas utilizando visão computacional (Fonte)
Após o treino, o desempenho do modelo é avaliado em referências padrão para medir a precisão e a robustez e orientar afinações adicionais para utilização no mundo real. Os resultados são frequentemente apresentados utilizando a precisão média média, normalmente referida como mAP, que resume o desempenho em diferentes limiares de confiança comparando as poses previstas com a verdade de referência anotada.
Em muitos benchmarks de pose, uma pose prevista é associada a uma pose de referência através da Similaridade de Pontos-Chave de Objetos (OKS). A OKS mede a proximidade entre os pontos-chave previstos e os pontos-chave anotados, tendo em conta fatores como a escala da pessoa e a dificuldade típica de localização de cada ponto-chave.
Os modelos de pose também produzem pontuações de confiança para as pessoas detetadas e para pontos-chave individuais. Estas pontuações refletem a confiança do modelo e são utilizadas para ordenar e filtrar previsões, o que é especialmente importante em condições desafiantes, como oclusão, desfocagem de movimento ou ângulos de câmara invulgares.
Ferramentas e bibliotecas populares de estimativa de pose#
Atualmente, existem muitas ferramentas de estimativa de pose, cada uma equilibrando velocidade, precisão e facilidade de utilização. Eis algumas das ferramentas e bibliotecas mais utilizadas:
- Ultralytics YOLO11: desenvolvido como um modelo de IA de visão open source de última geração, o YOLO11 baseia-se em modelos anteriores, como o Ultralytics YOLOv8. Melhora a velocidade, a precisão e a eficiência geral, suportando várias tarefas de visão computacional, incluindo a estimativa de pose. Com um desempenho sólido em várias plataformas, desde portáteis a dispositivos de edge, o YOLO11 é uma excelente opção para muitas implementações no mundo real.
- Ultralytics YOLO26: este próximo modelo de nova geração foi concebido para ser mais leve, mais pequeno e mais rápido, mantendo uma precisão elevada. Foi desenvolvido para utilização em tempo real e implementação mais simples e suporta tarefas como deteção de objetos, segmentação de instâncias e estimativa de pose em tamanhos de modelo adequados a tudo, desde dispositivos de edge a sistemas de maior escala.
- MediaPipe: é uma framework multiplataforma para criar pipelines de visão e aprendizagem automática. É leve e funciona de forma eficiente em dispositivos móveis, tablets e aplicações Web, incluindo soluções e modelos prontos a utilizar para pose de corpo inteiro, pontos de referência faciais e acompanhamento das mãos.
- OpenPose: este sistema open source de estimativa de pose de ponta a ponta é amplamente conhecido pela deteção de pontos-chave de várias pessoas. Consegue estimar simultaneamente pontos-chave do corpo, das mãos e do rosto e é habitualmente utilizado em investigação, animação e análise de movimento.
- MMPose: o MMPose é um toolkit de estimativa de pose baseado em PyTorch do ecossistema OpenMMLab. Disponibiliza muitas implementações de modelos, utilitários de treino e opções de configuração, o que o torna útil para experimentação e personalização avançada.
- HRNet e AlphaPose: são modelos de estimativa de pose mais antigos que continuam a ser utilizados atualmente em investigação. O HRNet é uma arquitetura de modelo de pose que mantém características de imagem de alta resolução ao longo de toda a rede, ajudando a localizar pontos-chave com precisão. O AlphaPose é um sistema de estimativa de pose de várias pessoas amplamente utilizado, especialmente quando é necessária uma elevada precisão em cenas congestionadas ou complexas.
Aplicações reais da análise e estimativa de pose#
A estimativa de pose é cada vez mais utilizada para transformar vídeos comuns em informações úteis sobre movimento. Ao acompanhar pontos-chave do corpo fotograma a fotograma, estes sistemas podem inferir a postura, o movimento e o comportamento físico a partir de transmissões de câmaras, tornando esta tecnologia prática em muitos contextos reais.
Por exemplo, nos cuidados de saúde e na reabilitação, o acompanhamento da pose pode ajudar os profissionais de saúde a observar e medir a forma como um paciente se move durante a terapia e a recuperação. Ao extrair pontos de referência do corpo de gravações de vídeo comuns, pode ser utilizado para avaliar a postura, a amplitude de movimento e os padrões gerais de movimento ao longo do tempo. Estas medições podem apoiar e otimizar as avaliações clínicas tradicionais e, em alguns casos, facilitar o acompanhamento do progresso sem a necessidade de sensores vestíveis ou equipamento especializado.
De forma semelhante, no desporto e na radiodifusão, a estimativa de pose pode analisar a forma como os atletas se movem diretamente a partir de transmissões de vídeo. Um exemplo interessante é o Hawk-Eye, um sistema de acompanhamento baseado em câmaras utilizado no desporto profissional para arbitragem e gráficos de transmissão. Também fornece acompanhamento esquelético ao estimar os pontos-chave do corpo de um atleta a partir das imagens das câmaras.
Escolher a ferramenta certa de estimativa de pose#
Escolher a ferramenta certa de estimativa de pose começa por compreender as necessidades do teu projeto de visão computacional. Algumas aplicações dão prioridade à velocidade em tempo real, enquanto outras exigem maior precisão e detalhe.
O dispositivo de implementação pretendido também faz diferença. As aplicações móveis e os dispositivos de edge exigem normalmente modelos leves e eficientes, enquanto os modelos maiores são frequentemente mais adequados para servidores ou ambientes de cloud.
Além disso, a facilidade de utilização pode desempenhar um papel importante. Uma boa documentação, uma implementação simples e o suporte para treino personalizado podem agilizar o teu projeto.
Em termos simples, diferentes ferramentas destacam-se em áreas diferentes. Por exemplo, os modelos Ultralytics YOLO proporcionam um equilíbrio prático entre velocidade, precisão e facilidade de implementação para muitas aplicações reais de estimativa de pose.

Fig. 5. Estimativa de pose de animais utilizando o Ultralytics YOLO11 (Fonte)
Principais conclusões#
A estimativa de pose ajuda os computadores a compreender o movimento humano ao detetar pontos-chave do corpo em imagens e vídeos. Modelos como YOLO11 e YOLO26 facilitam a criação de aplicações em tempo real para áreas como o desporto, os cuidados de saúde, a segurança no local de trabalho e as experiências interativas. À medida que os modelos continuam a tornar-se mais rápidos e precisos, é provável que a estimativa de pose se torne uma funcionalidade comum em muitos sistemas de IA de visão.
Queres saber mais sobre IA? Consulta a nossa comunidade e o nosso repositório do GitHub. Explora as nossas páginas de soluções para saber mais sobre IA na robótica e visão computacional na indústria. Descobre as nossas opções de licenciamento e começa hoje a criar com visão computacional!









