Tudo o que precisas de saber sobre tarefas de visão computacional
Aprende como funcionam tarefas de visão computacional, como o rastreamento de objetos, a segmentação de instâncias e a classificação de imagens, e como o Ultralytics YOLO11 as suporta.

Graças às câmaras e aos avanços na inteligência artificial (IA), os computadores e as máquinas conseguem agora ver o mundo de uma forma semelhante à dos humanos. Por exemplo, podem reconhecer pessoas, acompanhar objetos e até compreender o contexto do que está a acontecer num vídeo.
Especificamente, a visão computacional é o ramo da IA que permite às máquinas compreender e interpretar informações visuais do mundo à sua volta. A visão computacional envolve várias tarefas, cada uma concebida para extrair um tipo específico de informação de imagens ou vídeos. Por exemplo, a deteção de objetos ajuda a identificar e localizar diferentes itens numa imagem, enquanto outras tarefas, como o rastreamento, a segmentação e a estimativa de pose, ajudam as máquinas a compreender com maior precisão o movimento, as formas e as posições.
A tarefa de visão computacional utilizada numa determinada aplicação depende do tipo de informação de que precisas. Modelos de visão computacional como o Ultralytics YOLO11 são compatíveis com várias tarefas de visão computacional, o que faz dele uma opção fiável para criar sistemas de IA de visão para aplicações reais.
Neste guia, vamos analisar mais detalhadamente as tarefas de visão computacional compatíveis com modelos como o YOLO11. Vamos explorar como funciona cada tarefa e como está a ser utilizada em diferentes setores. Vamos começar!
O que são tarefas de visão computacional?#
As tarefas de visão computacional procuram reproduzir as capacidades da visão humana de diferentes formas. Estas tarefas podem ajudar as máquinas a detetar objetos, acompanhar os seus movimentos, estimar poses e até delinear elementos individuais em imagens e vídeos. Normalmente, as tarefas de visão computacional são possibilitadas por modelos que dividem os dados visuais em partes menores, para que possam interpretar mais claramente o que está a acontecer.
Modelos de IA de visão, como os modelos Ultralytics YOLO, são compatíveis com várias tarefas, como deteção, rastreamento e segmentação, num único framework. Graças a esta versatilidade, os modelos YOLO11 são fáceis de adotar numa grande variedade de casos de utilização.

Fig. 1. Tarefas de visão computacional compatíveis com o Ultralytics YOLO11.
Um bom exemplo disso encontra-se na análise desportiva. O YOLO11 pode ser utilizado para detetar cada jogador no campo através da deteção de objetos e, depois, acompanhá-lo durante todo o jogo com o rastreamento de objetos. Entretanto, as capacidades de estimativa de pose do YOLO11 podem ajudar a analisar os movimentos e as técnicas dos jogadores, enquanto a segmentação de instâncias pode separar cada jogador do fundo, aumentando a precisão da análise.
Em conjunto, estas tarefas de visão computacional possibilitadas pelo YOLO11 criam uma imagem completa do que está a acontecer durante o jogo, fornecendo às equipas informações mais detalhadas sobre o desempenho dos jogadores, as táticas e a estratégia geral.
Uma visão geral das tarefas de visão computacional compatíveis com o Ultralytics YOLO11#
Agora que analisámos o que são as tarefas de visão computacional, vamos compreender em maior detalhe cada uma das tarefas compatíveis com o YOLO11, recorrendo a exemplos do mundo real.
Compatibilidade do Ultralytics YOLO11 com a classificação de imagens#
Quando olhas para uma fotografia, a maioria das pessoas consegue facilmente dizer se esta mostra um cão, uma montanha ou um sinal de trânsito, porque todos aprendemos o aspeto típico destas coisas. A classificação de imagens ajuda as máquinas a fazer o mesmo, ensinando-as a classificar e identificar uma imagem com base no seu objeto principal — seja um «carro», uma «banana» ou uma «radiografia com fratura». Esta etiqueta ajuda os sistemas de visão computacional a compreender o conteúdo visual, para que possam responder ou tomar decisões em conformidade.
Uma aplicação interessante desta tarefa de visão computacional é a monitorização da vida selvagem. A classificação de imagens pode ser utilizada para identificar diferentes espécies animais a partir de fotografias captadas na natureza. Ao identificar automaticamente as imagens, os investigadores podem acompanhar as populações, monitorizar os padrões de migração e identificar mais facilmente espécies ameaçadas, contribuindo para os esforços de conservação.

Fig. 2. Um exemplo da utilização do YOLO11 para classificação de imagens.
Capacidades de deteção de objetos do Ultralytics YOLO11#
Embora a classificação de imagens seja útil para obter uma ideia geral do conteúdo de uma imagem, atribui apenas uma etiqueta à imagem inteira. Em situações que exigem informações detalhadas, como a localização precisa e a identidade de vários objetos, a deteção de objetos torna-se essencial.
A deteção de objetos é o processo de identificar e localizar objetos individuais numa imagem, frequentemente desenhando caixas delimitadoras à sua volta. O Ultralytics YOLO11 apresenta um desempenho especialmente bom na deteção de objetos em tempo real, sendo ideal para uma grande variedade de aplicações.
Considera, por exemplo, as soluções de visão computacional utilizadas em lojas de retalho para abastecer as prateleiras. A deteção de objetos pode ajudar a contar frutas, legumes e outros artigos, garantindo um inventário preciso. Em campos agrícolas, a mesma tecnologia pode monitorizar a maturação das culturas para ajudar os agricultores a determinar a melhor altura para a colheita, distinguindo inclusivamente os produtos maduros dos imaturos.
Fig. 3. Deteção de frutas com o Ultralytics YOLO11.
Utilizar o YOLO11 para segmentação de instâncias#
A deteção de objetos utiliza caixas delimitadoras para identificar e localizar objetos numa imagem, mas não capta as suas formas exatas. É aqui que entra a segmentação de instâncias. Em vez de desenhar uma caixa à volta de um objeto, a segmentação de instâncias traça o seu contorno preciso.
Podes pensar nisto da seguinte forma: em vez de indicar simplesmente que «há uma maçã nesta área», delineia e preenche cuidadosamente a forma exata da maçã. Este processo detalhado ajuda os sistemas de IA a compreender claramente os limites de um objeto, sobretudo quando os objetos estão próximos uns dos outros.
A segmentação de instâncias pode ser aplicada em muitas áreas, desde inspeções de infraestruturas a levantamentos geológicos. Por exemplo, os dados de levantamentos geológicos podem ser analisados com o YOLO11 para segmentar fissuras ou anomalias superficiais grandes e pequenas. Ao traçar limites precisos à volta destas anomalias, os engenheiros podem localizar os problemas e resolvê-los antes do início de um projeto.

Fig. 4. Segmentação de fissuras possibilitada pelo YOLO11.
Rastreamento de objetos: acompanhar objetos entre fotogramas com o YOLO11#
Até agora, as tarefas de visão computacional que analisámos concentram-se no que está presente numa única imagem. No entanto, quando se trata de vídeos, precisamos de informações que vão além de um único fotograma. A tarefa de rastreamento de objetos pode ser utilizada para isso.
A capacidade de rastreamento de objetos do YOLO11 pode acompanhar um objeto específico, como uma pessoa ou um carro, à medida que este se move por uma série de fotogramas de vídeo. Mesmo que o ângulo da câmara mude ou que apareçam outros objetos, o sistema continua a acompanhar o mesmo alvo.
Isto é essencial para aplicações que exigem monitorização ao longo do tempo, como o rastreamento de carros no trânsito. Na verdade, o YOLO11 consegue rastrear veículos com precisão, acompanhando cada carro para ajudar a estimar a sua velocidade em tempo real. Isto faz do rastreamento de objetos um componente essencial de sistemas como os de monitorização do trânsito.

Fig. 5. A compatibilidade do YOLO11 com o rastreamento de objetos pode ser utilizada para estimar a velocidade.
Detetar caixas delimitadoras orientadas (OBB) com o YOLO11#
Os objetos do mundo real nem sempre estão perfeitamente alinhados — podem estar inclinados, de lado ou posicionados em ângulos invulgares. Por exemplo, em imagens de satélite, os navios e os edifícios aparecem frequentemente rodados.
Os métodos tradicionais de deteção de objetos utilizam caixas retangulares fixas que não se ajustam à orientação de um objeto, dificultando a captação precisa destas formas rodadas. A deteção de caixas delimitadoras orientadas (OBB) resolve este problema utilizando caixas que rodam para se ajustarem perfeitamente à volta de um objeto, alinhando-se com o seu ângulo para uma deteção mais precisa.
No que diz respeito à monitorização de portos, a compatibilidade do YOLO11 com a deteção de OBB pode ajudar a identificar e rastrear embarcações com precisão, independentemente da sua orientação, garantindo que todos os navios que entram ou saem do porto são devidamente monitorizados. Esta deteção precisa fornece informações em tempo real sobre as posições e os movimentos das embarcações, algo essencial para gerir portos movimentados e evitar colisões.

Fig. 6. Deteção de barcos com deteção de OBB e YOLO11.
Estimativa de pose e YOLO11: rastrear pontos-chave#
A estimativa de pose é uma técnica de visão computacional que rastreia pontos-chave, como articulações, membros ou outros marcadores, para compreender como um objeto se move. Em vez de tratar um objeto ou corpo inteiro como uma única unidade completa, este método divide-o nas suas partes fundamentais. Isto permite analisar detalhadamente movimentos, gestos e interações.
Uma aplicação comum desta tecnologia é a estimativa da pose humana. Ao rastrear em tempo real as posições de várias partes do corpo, fornece uma visão clara de como uma pessoa se está a mover. Estas informações podem ser utilizadas para diversos fins, desde o reconhecimento de gestos e a monitorização de atividades até à análise do desempenho desportivo.
Da mesma forma, na reabilitação física, os terapeutas podem utilizar a estimativa da pose humana e o YOLO11 para monitorizar os movimentos dos pacientes durante os exercícios. Isto ajuda a garantir que cada movimento é realizado corretamente, ao mesmo tempo que permite acompanhar a evolução ao longo do tempo.

Fig. 7. O YOLO11 pode monitorizar um treino através da estimativa de pose.
Explorar a compatibilidade do YOLO11 com várias tarefas de visão computacional#
Agora que explorámos detalhadamente todas as tarefas de visão computacional compatíveis com o YOLO11, vamos analisar como o YOLO11 as suporta.
O YOLO11 não é apenas um modelo — é um conjunto de variantes de modelos especializados, cada uma concebida para uma tarefa de visão computacional específica. Isto faz do YOLO11 uma ferramenta versátil, adaptável a uma grande variedade de aplicações. Também podes fazer fine-tuning destes modelos com datasets personalizados para enfrentar os desafios específicos dos teus projetos.
Eis as variantes do modelo YOLO11 pré-treinadas para tarefas de visão específicas:
- YOLO11: este modelo deteta e identifica vários objetos em tempo real, sendo ideal para reconhecimento visual de alta velocidade.
- YOLO11-seg: esta variante concentra-se na segmentação, utilizando máscaras detalhadas para separar os objetos dos seus fundos.
- YOLO11-obb: este modelo foi concebido para detetar objetos rodados, desenhando caixas delimitadoras alinhadas com a orientação de cada objeto.
- YOLO11-cls: esta variante classifica imagens atribuindo uma única etiqueta de categoria com base no conteúdo geral.
- YOLO11-pose: este modelo estima pontos-chave do corpo para rastrear a postura, as posições dos membros e o movimento.
Cada variante está disponível em diferentes tamanhos, permitindo aos utilizadores escolher o equilíbrio adequado entre velocidade e precisão para as suas necessidades específicas.
Principais conclusões#
As tarefas de visão computacional estão a mudar a forma como as máquinas compreendem e interagem com o mundo. Ao decompor imagens e vídeos em elementos fundamentais, estas tecnologias facilitam a análise detalhada de objetos, movimentos e interações.
Desde melhorar a segurança rodoviária e o desempenho desportivo até otimizar processos industriais, modelos como o YOLO11 podem fornecer informações em tempo real que impulsionam a inovação. À medida que a IA de visão continua a evoluir, é provável que desempenhe um papel cada vez mais importante na forma como interpretamos e utilizamos os dados visuais no dia a dia.
Junta-te à nossa comunidade e visita o nosso repositório no GitHub para veres a IA em ação. Explora as nossas opções de licenciamento e descobre mais sobre IA na agricultura e visão computacional na indústria transformadora nas nossas páginas de soluções.









