O que é a segmentação de instâncias? Um guia rápido
Acompanha-nos numa análise mais detalhada do que é a segmentação de instâncias, de como funciona, da sua utilização em várias aplicações de visão computacional e do impacto que pode ter.

As aplicações de visão computacional estão a tornar-se cada vez mais comuns no nosso dia a dia, desde câmaras de trânsito que monitorizam as condições das estradas até sistemas de pagamento automático nas lojas. Ao permitir que as máquinas compreendam dados visuais de forma semelhante aos humanos, a IA de visão está a causar impacto numa série de setores.
Muitas destas aplicações dependem da deteção de objetos, uma tarefa de visão computacional que coloca caixas delimitadoras em torno dos objetos principais nas imagens. Embora esta abordagem funcione frequentemente bem, algumas soluções de análise de imagens precisam de uma precisão ainda maior.
Por exemplo, a imagiologia médica exige mais do que simplesmente detetar um tumor: é crucial delinear a sua forma exata. De forma semelhante, na robótica, as máquinas precisam de reconhecer os contornos exatos de um objeto para o agarrar corretamente. Para responder a estes desafios, a segmentação de instâncias oferece uma solução mais precisa.
A segmentação de instâncias é uma tarefa de visão computacional concebida para casos de utilização em que detetar objetos não é suficiente: proporciona precisão ao nível dos píxeis. Modelos de visão computacional como o Ultralytics YOLO11 podem ser utilizados para aplicar facilmente a segmentação de instâncias a imagens e vídeos.

Fig. 1. Exemplo de utilização do YOLO11 para segmentação de instâncias.
Neste guia, vamos explicar como funciona a segmentação de instâncias, as suas aplicações e como o Ultralytics YOLO11 pode ser treinado de forma personalizada para tarefas de segmentação específicas.
O que é a segmentação de instâncias?#
Imagina que tens uma fotografia de grupo com várias pessoas próximas umas das outras. A deteção de objetos pode ajudar a desenhar caixas à volta de cada pessoa, mas isso não indica a sua forma exata.
A segmentação de instâncias, por outro lado, é semelhante a contornar cuidadosamente cada pessoa para veres todo o seu contorno, mesmo quando há sobreposição. Em vez de apenas assinalar a localização de algo com uma caixa, identifica a forma exata de cada objeto ao nível dos píxeis, facilitando a compreensão de imagens complexas.
O resultado é uma máscara detalhada que preenche a forma de um objeto, indicando exatamente quais os píxeis que lhe pertencem. Este nível de precisão é útil em muitas aplicações do mundo real nas quais é importante compreender a forma exata e os limites dos objetos.

Fig. 2. Demonstração do suporte do Ultralytics YOLO11 para segmentação de instâncias.
Segmentação de instâncias vs. segmentação semântica#
Ao explorares a segmentação de instâncias, poderás deparar-te com o conceito de segmentação semântica.
Ambas as técnicas ajudam os computadores a compreender imagens ao nível dos píxeis, mas têm finalidades diferentes. A segmentação semântica atribui uma categoria a cada píxel, agrupando todos os objetos do mesmo tipo. Por exemplo, numa imagem com vários carros, a segmentação semântica marcaria todos como "carro", sem distinguir os veículos individualmente.
A segmentação de instâncias, por outro lado, vai um passo além ao identificar cada objeto separadamente. Atribui etiquetas únicas a instâncias individuais e cria máscaras precisas em torno das suas formas. Assim, na mesma imagem, a segmentação de instâncias não etiquetaria simplesmente tudo como "carro", mas reconheceria e delinearia cada carro individualmente.
A principal diferença entre as duas é que a segmentação semântica agrupa os objetos por categoria, enquanto a segmentação de instâncias distingue cada objeto como uma entidade única, com limites claros. A escolha da tarefa a utilizar depende da aplicação específica: pode ser suficiente saber o que está numa imagem ou pode ser importante diferenciar objetos individuais.

Fig. 3. Segmentação de instâncias vs. segmentação semântica (à direita e à esquerda, respetivamente).
Modelos populares de segmentação de instâncias#
Atualmente, existem vários modelos de segmentação de instâncias disponíveis para a comunidade de IA de visão. Alguns são mais rápidos, outros mais precisos e outros mais fáceis de utilizar.
Embora sejam úteis, estas opções podem levar à pergunta: qual é a mais adequada para uma tarefa específica? Entre as opções disponíveis, os modelos Ultralytics YOLO são bastante populares porque se concentram na velocidade e na precisão.
Além disso, estes modelos evoluíram significativamente ao longo dos anos. Por exemplo, o Ultralytics YOLOv5 simplificou a implementação utilizando frameworks como PyTorch, tornando a IA de visão avançada acessível a um público mais vasto, sem exigir conhecimentos técnicos aprofundados.
Dando continuidade a esse sucesso, o Ultralytics YOLOv8 introduziu um suporte melhorado para tarefas de visão computacional, como segmentação de instâncias, estimativa de pose e classificação de imagens.
Agora, o Ultralytics YOLO11 eleva o desempenho a um novo nível. Obtém uma precisão média (mAP) superior no conjunto de dados COCO, com menos 22% de parâmetros do que o YOLOv8m, o que significa que consegue reconhecer objetos com maior precisão utilizando menos recursos.

Fig. 4. Avaliação comparativa do YOLO11.
Em termos simples, o Ultralytics YOLO11 oferece uma precisão de vanguarda sem comprometer a eficiência, sendo uma solução transformadora neste campo.
Compreender como funciona a segmentação de instâncias#
De seguida, vamos explorar como funciona normalmente a segmentação de instâncias. Os modelos de visão computacional mais antigos utilizam uma abordagem em duas etapas.
Primeiro, detetam os objetos desenhando caixas delimitadoras à sua volta. Depois, geram uma máscara ao nível dos píxeis para delinear a forma exata de cada objeto. Um exemplo conhecido é o Mask R-CNN, que se baseia em modelos de deteção de objetos, adicionando uma etapa de previsão de máscaras. Embora este método seja eficaz, pode ser lento porque processa a imagem em várias fases, tornando as aplicações em tempo real mais desafiantes.
Entretanto, modelos como o Ultralytics YOLO11 processam as imagens de uma só vez, prevendo simultaneamente as caixas delimitadoras dos objetos e as máscaras de segmentação de instâncias. Esta abordagem simplificada torna o processo muito mais rápido, mantendo uma elevada precisão. Por isso, é particularmente útil para aplicações em tempo real, como condução autónoma, análise de vídeo e robótica, nas quais tanto a velocidade como a precisão são cruciais.
Treino personalizado do Ultralytics YOLO11 para segmentação de instâncias#
Pronto a utilizar, o YOLO11 é fornecido como um modelo pré-treinado. Foi treinado no conjunto de dados COCO-Seg, que abrange objetos do quotidiano para segmentação de instâncias. No entanto, o pacote Ultralytics Python suporta treino personalizado, essencial para aplicações especializadas nas quais é necessário segmentar objetos únicos.
Porque é importante fazer o treino personalizado ou o ajuste fino de um modelo? O treino personalizado utiliza a aprendizagem por transferência, aproveitando o conhecimento já incorporado nos modelos pré-treinados. Em vez de começar do zero, adapta um modelo existente a novas tarefas utilizando conjuntos de dados mais pequenos e menos recursos computacionais, mantendo uma elevada precisão.
Como treinar o Ultralytics YOLO11 de forma personalizada#
Eis uma análise mais detalhada das etapas envolvidas no ajuste fino do Ultralytics YOLO11 para segmentação de instâncias:
- Preparação dos dados: Recolhe e anota imagens de acordo com a tua aplicação específica. A Ultralytics oferece suporte para vários conjuntos de dados de imagens, mas também podes treinar com o teu próprio conjunto de dados, preparando as imagens e anotações no formato YOLO necessário.
- Utilização de um modelo pré-treinado: Em vez de começares do zero, utiliza um modelo Ultralytics YOLO11 pré-treinado.
- Treino do modelo: Ajusta definições essenciais do treino, como o tamanho do batch (imagens processadas por iteração), o tamanho da imagem (resolução de entrada pretendida) e as épocas (ciclos de treino totais), e treina o modelo.
- Avaliação do desempenho: Após a conclusão do treino do modelo, podes testar a sua precisão utilizando métricas de desempenho como mAP. O pacote Ultralytics Python também fornece funções integradas para a avaliação do modelo.
Aplicações de segmentação de instâncias possibilitadas pelo Ultralytics YOLO11#
A segmentação de instâncias pode ser utilizada para resolver desafios do mundo real, ajudando as máquinas a ver e compreender os objetos com maior precisão. Desde melhorar a automatização até proteger o ambiente, desempenha um papel importante em muitos setores. Vejamos alguns exemplos de áreas onde está a causar impacto.
Segurança e monitorização de estaleiros de construção com o Ultralytics YOLO11#
A segmentação de instâncias pode ser fundamental para garantir a segurança e a eficiência em estaleiros de construção. Por exemplo, pode ser utilizada para monitorizar maquinaria pesada.
O Ultralytics YOLO11 pode ser ajustado para segmentar e identificar com precisão diferentes tipos de equipamento, como gruas, escavadoras e tratores, e para acompanhar as suas posições em tempo real. Isto permite aos gestores do estaleiro garantir que a maquinaria opera estritamente dentro das áreas designadas e não invade zonas onde estejam trabalhadores ou existam perigos.
Além disso, a integração destas soluções com sistemas de alertas em tempo real permite tomar rapidamente medidas corretivas. Para além disso, os dados recolhidos podem ajudar a otimizar a disposição e o fluxo de trabalho do estaleiro, reduzindo ainda mais os riscos e aumentando a produtividade.

Fig. 5. Monitorização de maquinaria pesada com o Ultralytics YOLO11.
Monitorização de animais com segmentação e Ultralytics YOLO11#
A monitorização do comportamento animal ajuda investigadores, agricultores e conservacionistas a cuidar melhor dos animais em diferentes ambientes. A segmentação de instâncias desempenha um papel importante nestes sistemas, identificando e segmentando animais individuais em explorações agrícolas, jardins zoológicos e habitats naturais. Ao contrário da deteção de objetos tradicional, que utiliza caixas delimitadoras, a segmentação de instâncias fornece uma delimitação ao nível dos píxeis de cada animal, o que é particularmente útil quando os animais estão próximos uns dos outros.
A segmentação detalhada facilita um acompanhamento mais preciso dos movimentos e comportamentos. Os animais sobrepostos ou agrupados podem ser reconhecidos distintamente, permitindo uma análise mais precisa das interações, avaliações de saúde e padrões de atividade. De forma geral, obter conhecimentos mais profundos sobre o comportamento animal melhora as práticas de cuidado e gestão dos animais.

Fig. 6. Monitorização de gado com segmentação de instâncias.
Ultralytics YOLO11 na análise desportiva e no acompanhamento de jogadores#
O acompanhamento preciso de jogadores e eventos é uma parte importante da análise desportiva. Os métodos tradicionais de acompanhamento dependem de etiquetagem manual, que pode não captar interações detalhadas. A visão computacional pode ser utilizada para segmentar detalhes como cada jogador, a bola e eventos importantes ao nível dos píxeis, obtendo informações detalhadas.
Por exemplo, a segmentação de instâncias pode ajudar a detetar eventos como faltas ou incidentes sem bola, separando claramente cada jogador e objeto. Esta monitorização detalhada, possibilitada por modelos como o Ultralytics YOLO11, oferece aos analistas informações mais claras para estudar padrões de movimento, posicionamento espacial e interações com elevada precisão. Um benefício importante destes conhecimentos é ajudarem as equipas a aperfeiçoar as suas estratégias e a melhorar o desempenho geral.
Vantagens e desvantagens da segmentação de instâncias#
Eis alguns dos principais benefícios que a segmentação de instâncias pode trazer a vários setores:
- Automatização melhorada: Ao automatizar tarefas como o controlo de qualidade e a monitorização da segurança, a segmentação de instâncias reduz a necessidade de intervenção manual e minimiza o erro humano.
- Melhor compreensão da cena: Ao delinear cada objeto com precisão, a segmentação de instâncias contribui para uma compreensão mais profunda de cenas complexas, apoiando uma tomada de decisões mais informada.
- Pós-processamento eficiente: O resultado ao nível dos píxeis simplifica tarefas como a remoção do fundo, a contagem de objetos e a análise espacial, reduzindo a necessidade de etapas adicionais de processamento.
Embora estes benefícios evidenciem o impacto da segmentação de instâncias em diferentes casos de utilização, também é essencial considerar os desafios envolvidos na sua implementação.
Eis algumas das principais limitações da segmentação de instâncias:
- Desafios com a transparência: A segmentação de objetos transparentes ou refletores, como vidro e água, é difícil, conduzindo a limites imprecisos.
- Sobrecarga de manutenção: Para manter os modelos precisos e relevantes, são necessárias atualizações e ajustes finos contínuos à medida que as condições ambientais e os conjuntos de dados mudam.
- Grande esforço de anotação: O treino de modelos de segmentação de instâncias exige anotações detalhadas ao nível dos píxeis, aumentando significativamente o tempo e o custo envolvidos na preparação dos dados.
Principais conclusões#
A segmentação de instâncias permite distinguir objetos individuais com precisão, mesmo quando estão sobrepostos. Ao captar os limites dos objetos ao nível dos píxeis, proporciona uma compreensão mais profunda dos dados visuais em comparação com tarefas tradicionais de visão computacional, como a deteção de objetos.
Os avanços recentes na visão computacional tornaram a segmentação de instâncias mais rápida e fácil de utilizar. Em particular, modelos de visão computacional como o Ultralytics YOLO11 simplificam o processo, permitindo a segmentação em tempo real com uma configuração mínima e tornando-a mais acessível a vários setores e aplicações.
Tens curiosidade sobre IA? Visita o nosso repositório no GitHub e liga-te à nossa comunidade para continuares a explorar. Descobre inovações como IA em carros autónomos e IA de visão na agricultura nas nossas páginas de soluções. Consulta as nossas opções de licenciamento e começa um projeto de visão computacional!









