Tudo o que você precisa saber sobre tarefas de visão computacional
Aprenda como funcionam tarefas de visão computacional como rastreamento de objetos, segmentação de instâncias e classificação de imagens, e como o Ultralytics YOLO11 as suporta.

Graças às câmaras e aos avanços na inteligência artificial (IA), os computadores e as máquinas são agora capazes de ver o mundo de uma forma semelhante à dos humanos. Por exemplo, podem reconhecer pessoas, seguir objetos e até compreender o contexto do que está a acontecer num vídeo.
Especificamente, a computer vision é o ramo da IA que permite às máquinas compreender e interpretar informação visual do mundo à sua volta. A Computer vision envolve uma variedade de tarefas, cada uma concebida para extrair um tipo específico de percepção de imagens ou vídeos. Por exemplo, a detecção de objectos ajuda a identificar e localizar diferentes itens numa imagem, enquanto outras tarefas como rastreio, segmentação e estimativa de pose ajudam as máquinas a compreender o movimento, as formas e as posições com maior precisão.
A computer vision task utilizada para uma aplicação específica depende do tipo de percepções de que precisas. Os modelos de computer vision como o Ultralytics YOLO11 suportam várias tarefas de computer vision, tornando-o uma escolha fiável para a construção de sistemas de Vision AI do mundo real.
Neste guia, analisaremos mais de perto as tarefas de visão computacional suportadas por modelos como o YOLO11. Vamos explorar como cada tarefa funciona e como estão a ser utilizadas em diferentes setores. Vamos começar!
O que são tarefas de visão computacional?#
As tarefas de visão computacional visam replicar as capacidades da visão humana de diferentes formas. Estas tarefas podem ajudar as máquinas a detetar objetos, seguir os seus movimentos, estimar poses e até delinear elementos individuais em imagens e vídeos. Normalmente, as tarefas de visão computacional são ativadas por modelos que decompõem os dados visuais em partes mais pequenas para que possam interpretar o que está a acontecer com maior clareza.
Os Vision AI models como os modelos Ultralytics YOLO suportam múltiplas tarefas, tais como detecção, rastreio e segmentação, num único framework. Devido a esta versatilidade, os modelos YOLO11 são fáceis de adoptar para uma ampla variedade de casos de uso.

Fig 1. Tarefas de visão computacional suportadas pelo Ultralytics YOLO11.
Um bom exemplo disto é a análise desportiva. O YOLO11 pode ser usado para detetar cada jogador no campo utilizando a deteção de objetos, e depois pode segui-los ao longo do jogo com o seguimento de objetos. Entretanto, as capacidades de estimativa de pose do YOLO11 podem ajudar a analisar os movimentos e técnicas dos jogadores, e a segmentação de instâncias pode separar cada jogador do fundo, conferindo precisão à análise.
Juntas, estas tarefas de visão computacional possibilitadas pelo YOLO11 criam uma imagem completa do que está a acontecer durante o jogo, dando às equipas informações mais profundas sobre o desempenho dos jogadores, táticas e estratégia geral.
Uma visão geral das tarefas de visão computacional suportadas pelo Ultralytics YOLO11#
Agora que vimos o que são as tarefas de visão computacional, vamos mergulhar na compreensão detalhada de cada uma suportada pelo YOLO11, utilizando exemplos do mundo real.
O suporte do Ultralytics YOLO11 para classificação de imagens#
Quando olhas para uma fotografia, a maioria das pessoas consegue dizer facilmente se esta mostra um cão, uma montanha ou um sinal de trânsito porque todos aprendemos como estas coisas tipicamente se parecem. A Image classification ajuda as máquinas a fazer o mesmo, ensinando-as a classificar e rotular uma imagem com base no seu objeto principal - quer seja um "carro", "banana" ou um "raio-x com fratura". Este rótulo ajuda os sistemas de computer vision a compreender o conteúdo visual para que possam responder ou tomar decisões em conformidade.
Uma aplicação interessante desta tarefa de visão computacional é a monitorização da vida selvagem. A classificação de imagens pode ser usada para identificar diferentes espécies animais a partir de fotografias tiradas na natureza. Ao rotular automaticamente as imagens, os investigadores podem seguir populações, monitorizar padrões de migração e identificar espécies ameaçadas mais facilmente para apoiar os esforços de conservação.

Fig 2. Um exemplo de utilização do YOLO11 para classificação de imagens.
Capacidades de detecção de objetos do Ultralytics YOLO11#
Embora a classificação de imagens seja útil para obter uma ideia geral do que uma imagem contém, esta atribui apenas um rótulo a toda a imagem. Em situações onde é necessária informação detalhada, como a localização exata e a identidade de múltiplos objectos, a object detection torna-se essencial.
A deteção de objetos é o processo de identificar e localizar objetos individuais dentro de uma imagem, muitas vezes desenhando caixas delimitadoras (bounding boxes) à sua volta. O Ultralytics YOLO11 tem um desempenho especialmente bom na deteção de objetos em tempo real, tornando-o ideal para uma vasta gama de aplicações.
Pega, por exemplo, nas soluções de visão computacional utilizadas em lojas de retalho para o abastecimento de prateleiras. A deteção de objetos pode ajudar a contar frutos, legumes e outros artigos, garantindo um inventário preciso. Em campos agrícolas, a mesma tecnologia pode monitorizar a maturação das culturas para ajudar os agricultores a determinar a melhor altura para a colheita, distinguindo até entre produtos maduros e verdes.
Fig 3. Deteção de frutos usando o Ultralytics YOLO11.
Usando o YOLO11 para segmentação de instâncias#
A detecção de objectos utiliza caixas delimitadoras para identificar e localizar objectos numa imagem, mas não capta as suas formas exatas. É aí que entra a instance segmentation. Em vez de desenhar uma caixa à volta de um objeto, a segmentação de instâncias traça o seu contorno preciso.
Podes pensar nisto da seguinte forma: em vez de simplesmente indicar que "há uma maçã nesta área", ela delineia cuidadosamente e preenche a forma exata da maçã. Este processo detalhado ajuda os sistemas de IA a compreender claramente os limites de um objeto, especialmente quando os objetos estão próximos uns dos outros.
A segmentação de instâncias pode ser aplicada a muitas aplicações, desde inspeções de infraestruturas a levantamentos geológicos. Por exemplo, dados de levantamentos geológicos podem ser analisados usando o YOLO11 para segmentar fissuras ou anomalias superficiais, tanto grandes como pequenas. Ao desenhar limites precisos à volta destas anomalias, os engenheiros podem identificar problemas e resolvê-los antes que um projeto comece.

Fig 4. Segmentação de fissuras ativada pelo YOLO11.
Seguimento de objetos: Seguir objetos através de fotogramas com o YOLO11#
Até agora, as tarefas de computer vision que analisámos centram-se no que está numa única imagem. No entanto, quando se trata de vídeos, precisamos de percepções que vão além de um único fotograma. A tarefa de object tracking pode ser utilizada para este efeito.
A capacidade de seguimento de objetos do YOLO11 pode seguir um objeto específico, como uma pessoa ou um carro, à medida que este se move através de uma série de fotogramas de vídeo. Mesmo que o ângulo da câmara mude ou outros objetos apareçam, o sistema continua a seguir o mesmo alvo.
Isto é crucial para aplicações que requerem monitorização ao longo do tempo, como o seguimento de carros no trânsito. De facto, o YOLO11 pode seguir veículos com precisão, acompanhando cada carro para ajudar a estimar a sua velocidade em tempo real. Isto faz do seguimento de objetos um componente chave em sistemas como a monitorização de tráfego.

Fig 5. O suporte do YOLO11 para rastreio de objectos pode ser utilizado para estimativa de velocidade.
Deteção de caixas delimitadoras orientadas (OBB) usando o YOLO11#
Os objetos no mundo real nem sempre estão perfeitamente alinhados - podem estar inclinados, de lado ou posicionados em ângulos estranhos. Por exemplo, em imagens de satélite, os navios e edifícios aparecem frequentemente rodados.
Os métodos tradicionais de detecção de objectos utilizam caixas rectangulares fixas que não se ajustam à orientação de um objeto, tornando difícil captar com precisão estas formas rodadas. A Oriented bounding box (OBB) detection resolve este problema utilizando caixas que rodam para encaixar perfeitamente à volta de um objeto, alinhando-se com o seu ângulo para uma detecção mais precisa.
Relativamente à monitorização portuária, o suporte do YOLO11 para deteção OBB pode ajudar a identificar e seguir navios com precisão, independentemente da sua orientação, garantindo que cada navio que entra ou sai do porto é devidamente monitorizado. Esta deteção precisa fornece informações em tempo real sobre as posições e movimentos dos navios, o que é fundamental para gerir portos movimentados e evitar colisões.

Fig 6. Detecção de barcos utilizando detecção OBB e YOLO11.
Estimativa de pose e YOLO11: Acompanhamento de pontos-chave#
A Pose estimation é uma técnica de computer vision que rastreia pontos-chave, tais como articulações, membros ou outros marcadores, para compreender como um objeto se move. Em vez de tratar um objeto ou corpo inteiro como uma unidade completa, este método decompõe-no nas suas partes principais. Isto torna possível analisar movimentos, gestos e interações em detalhe.
Uma aplicação comum desta tecnologia é a estimativa de pose humana. Ao seguir as posições de várias partes do corpo em tempo real, fornece uma imagem clara de como uma pessoa se está a mover. Esta informação pode ser usada para diversos fins, desde o reconhecimento de gestos e monitorização de atividades até à análise de desempenho no desporto.
Da mesma forma, na reabilitação física, os terapeutas podem usar a estimativa de pose humana e o YOLO11 para monitorizar os movimentos dos pacientes durante os exercícios. Isto ajuda a garantir que cada movimento é feito corretamente enquanto se acompanha o progresso ao longo do tempo.

Fig 7. O YOLO11 pode monitorizar um treino utilizando a estimativa de pose.
Explorar como o YOLO11 suporta várias tarefas de visão computacional#
Agora que explorámos detalhadamente todas as tarefas de visão computacional suportadas pelo YOLO11, vamos ver como o YOLO11 as suporta.
O YOLO11 não é apenas um único modelo - é um conjunto de variantes de modelos especializados, cada um concebido para uma tarefa específica de computer vision. Isto torna o YOLO11 uma ferramenta versátil que pode ser adaptada a uma vasta gama de aplicações. Também podes afinar estes modelos em datasets personalizados para enfrentar os desafios únicos dos teus projetos.
Aqui estão as YOLO11 model variants pré-treinadas para tarefas de visão específicas:
- YOLO11: Este modelo deteta e rotula múltiplos objetos em tempo real, tornando-o ideal para reconhecimento visual de alta velocidade.
- YOLO11-seg: Esta variante foca-se na segmentação usando máscaras detalhadas para separar objetos dos seus fundos.
- YOLO11-obb: Este modelo foi concebido para detetar objetos rodados ao desenhar caixas delimitadoras que se alinham com a orientação de cada objeto.
- YOLO11-cls: Esta variante classifica imagens atribuindo um único rótulo de categoria com base no conteúdo geral.
- YOLO11-pose: Este modelo estima pontos-chave no corpo para seguir a postura, as posições dos membros e o movimento.
Cada variante está disponível em diferentes tamanhos, permitindo aos utilizadores escolher o equilíbrio certo entre velocidade e precisão para as suas necessidades específicas.
Principais pontos#
As tarefas de visão computacional estão a mudar a forma como as máquinas compreendem e interagem com o mundo. Ao decompor imagens e vídeos em elementos chave, estas tecnologias facilitam a análise detalhada de objetos, movimentos e interações.
Desde a melhoria da segurança rodoviária e desempenho desportivo até à simplificação de processos industriais, modelos como o YOLO11 podem fornecer informações em tempo real que impulsionam a inovação. À medida que a Vision AI continua a evoluir, desempenhará provavelmente um papel cada vez mais importante na forma como interpretamos e utilizamos dados visuais todos os dias.
Junta-te à our community e visita o our GitHub repository para veres a IA em ação. Explora as our licensing options e descobre mais sobre AI in agriculture e computer vision in manufacturing nas nossas páginas de soluções.






