O que é segmentação de instâncias? Um guia rápido
Junte-se a nós para analisar mais de perto o que é a segmentação de instâncias, como ela funciona, seu uso em diversas aplicações de visão computacional e o impacto que pode causar.

As aplicações de Computer vision estão a tornar-se mais comuns no nosso quotidiano, desde câmaras de trânsito que monitorizam as condições das estradas até sistemas de pagamento automático em lojas. Ao permitir que as máquinas compreendam dados visuais de uma forma semelhante à humana, a IA de visão está a ter impacto numa série de indústrias.
Muitas destas aplicações baseiam-se na deteção de objetos, uma computer vision task que coloca caixas delimitadoras em redor de objetos-chave em imagens. Embora esta abordagem funcione frequentemente bem, algumas soluções de análise de imagem necessitam de ainda maior precisão.
Por exemplo, a imagem médica requer mais do que apenas detectar um tumor – é crucial delinear seu formato exato. Da mesma forma, na robótica, as máquinas precisam reconhecer os contornos exatos de um objeto para agarrá-lo corretamente. Para resolver esses desafios, a segmentação de instâncias oferece uma solução mais precisa.
A segmentação de instâncias é uma tarefa de visão computacional concebida para suportar casos de utilização em que a deteção de objetos não é suficiente - fornece precisão ao nível do píxel. Modelos de visão computacional como Ultralytics YOLO11 podem ser utilizados para aplicar facilmente a segmentação de instâncias a imagens e vídeos.

Fig 1. Exemplo de utilização do YOLO11 para segmentação de instâncias.
Neste guia, explicaremos como a segmentação de instâncias funciona, suas aplicações e como o Ultralytics YOLO11 pode ser treinado de forma personalizada para tarefas específicas de segmentação.
O que é segmentação de instâncias?#
Digamos que haja uma foto de grupo de pessoas próximas umas das outras. A detecção de objetos pode ajudar a desenhar caixas ao redor de cada pessoa, mas isso não informa o formato exato delas.
Por outro lado, a Instance segmentation é semelhante a contornar cuidadosamente cada pessoa para conseguires ver o seu contorno completo, mesmo que se sobreponham. Em vez de apenas marcar onde algo está com uma caixa, identifica a forma exata de cada objeto ao nível do píxel, facilitando a compreensão de imagens complexas.
O resultado é uma máscara detalhada que preenche o formato de um objeto, identificando exatamente quais pixels pertencem a ele. Esse nível de precisão é útil em muitas aplicações do mundo real onde entender o formato exato e os limites dos objetos é importante.

Fig. 2. Exibindo o suporte do Ultralytics YOLO11 para segmentação de instâncias.
Segmentação de instâncias vs segmentação semântica#
Ao explorores a segmentação de instâncias, poderás deparar-te com o conceito de semantic segmentation.
Ambas as técnicas ajudam computadores a entender imagens em nível de pixel, mas servem a propósitos diferentes. A segmentação semântica rotula cada pixel com base em sua categoria, agrupando todos os objetos do mesmo tipo. Por exemplo, em uma imagem com vários carros, a segmentação semântica marcaria todos eles como "carro", sem distinguir entre os veículos individuais.
A segmentação de instâncias, por outro lado, vai um passo além ao identificar cada objeto separadamente. Ela atribui rótulos únicos a instâncias individuais e cria máscaras precisas ao redor de seus formatos. Assim, na mesma imagem, a segmentação de instâncias não apenas rotularia tudo como "carro", mas reconheceria e contornaria cada carro individualmente.
A principal diferença entre as duas é que a segmentação semântica agrupa objetos por categoria, enquanto a segmentação de instâncias distingue cada objeto como uma entidade única com limites claros. Escolher qual tarefa usar depende da aplicação específica – se é suficiente saber o que há em uma imagem ou se é importante diferenciar entre objetos individuais.

Fig 3. Segmentação de instâncias vs segmentação semântica (à direita e à esquerda, respetivamente).
Modelos populares de segmentação de instâncias#
Existem vários modelos de segmentação de instâncias disponíveis para a comunidade de IA de visão hoje em dia. Alguns são mais rápidos, alguns são mais precisos e alguns são mais fáceis de usar.
Essas opções, embora úteis, podem levar à pergunta: qual é a certa para usar em uma tarefa específica? Entre as opções, os modelos Ultralytics YOLO são bastante populares porque focam em velocidade e precisão.
Além disso, estes modelos evoluíram significativamente ao longo dos anos. Por exemplo, Ultralytics YOLOv5 simplificou a implementação utilizando frameworks como PyTorch, tornando a IA de visão avançada acessível a um público mais amplo sem exigir conhecimentos técnicos profundos.
Com base nesse sucesso, o Ultralytics YOLOv8 introduziu suporte melhorado para tarefas de visão computacional como segmentação de instâncias, estimativa de pose e classificação de imagens.
Agora, o Ultralytics YOLO11 leva o desempenho a um novo patamar. Ele alcança uma precisão média superior (mAP) no conjunto de dados COCO com 22% menos parâmetros do que o YOLOv8m, o que significa que consegue reconhecer objetos com mais precisão enquanto usa menos recursos.

Fig 4. Avaliação comparativa (benchmarking) do YOLO11.
Simplesmente, o Ultralytics YOLO11 oferece precisão de última geração sem comprometer a eficiência, tornando-se uma revolução na área.
Entendendo como a segmentação de instâncias funciona#
De seguida, vamos explorar como funciona tipicamente a segmentação de instâncias. Os computer vision models mais antigos utilizam uma abordagem de dois passos.
Primeiro, detetam objetos desenhando caixas delimitadoras à volta deles. Depois, geram uma máscara ao nível do píxel para delinear a forma exata de cada objeto. Um exemplo bem conhecido é o Mask R-CNN, que se baseia em modelos de object detection adicionando um passo de previsão de máscara. Embora este método seja eficaz, pode ser lento porque processa a imagem em várias fases, tornando as aplicações em tempo real mais desafiantes.
Enquanto isso, modelos como o Ultralytics YOLO11 processam imagens de uma só vez, prevendo simultaneamente caixas delimitadoras de objetos e máscaras de segmentação de instâncias. Essa abordagem otimizada o torna muito mais rápido, mantendo alta precisão. Como resultado, é particularmente útil para aplicações em tempo real, como direção autônoma, análise de vídeo e robótica, onde velocidade e precisão são cruciais.
Treinamento personalizado do Ultralytics YOLO11 para segmentação de instâncias#
Por defeito, o YOLO11 vem como um modelo pré-treinado. Foi treinado no COCO-Seg dataset, que abrange objetos do dia a dia para segmentação de instâncias. No entanto, o pacote Python da Ultralytics suporta treino personalizado, o que é essencial para aplicações especializadas onde objetos únicos precisam de ser segmentados.
Porque é que o treino personalizado ou a afinação (fine-tuning) de um modelo é importante? O Custom training tira partido da aprendizagem por transferência (transfer learning) ao basear-se no conhecimento já incorporado em modelos pré-treinados. Em vez de começares do zero, adapta um modelo existente a novas tarefas utilizando conjuntos de dados mais pequenos e menos recursos computacionais, mantendo sempre uma elevada precisão.
Como fazer o treinamento personalizado do Ultralytics YOLO11#
Aqui está uma análise mais detalhada das etapas envolvidas no fine-tuning do Ultralytics YOLO11 para segmentação de instâncias:
- Preparação de dados: Recolhe e anota imagens com base na tua aplicação específica. A Ultralytics fornece suporte para vários image datasets, mas também podes treinar utilizando o teu próprio conjunto de dados, preparando imagens e anotações no formato YOLO necessário.
- Usando um modelo pré-treinado: Em vez de começar do zero, use um modelo Ultralytics YOLO11 pré-treinado.
- Treinamento do modelo: Ajuste configurações vitais de treinamento, como tamanho do lote (imagens processadas por iteração), tamanho da imagem (resolução de entrada alvo) e épocas (ciclos totais de treinamento) e treine o modelo.
- Avaliação de desempenho: Após a conclusão do treinamento do modelo, você pode testar a precisão do modelo usando métricas de desempenho como mAP. O pacote Python da Ultralytics também fornece funções integradas para avaliação de modelo.
Aplicações de segmentação de instâncias habilitadas pelo Ultralytics YOLO11#
A segmentação de instâncias pode ser usada para resolver desafios do mundo real ajudando as máquinas a ver e entender objetos com mais precisão. Desde melhorar a automação até proteger o meio ambiente, ela desempenha um papel fundamental em muitos campos. Vamos percorrer alguns exemplos de onde ela está causando impacto.
Segurança e monitoramento em canteiros de obras usando o Ultralytics YOLO11#
A segmentação de instâncias pode ser uma parte fundamental para garantir a segurança e a eficiência em canteiros de obras. Por exemplo, ela pode ser usada para monitorar maquinário pesado.
O Ultralytics YOLO11 pode passar por fine-tuning para segmentar e identificar com precisão diferentes tipos de equipamentos, como guindastes, escavadeiras e tratores, além de rastrear suas posições em tempo real. Isso permite que os gestores do canteiro garantam que o maquinário opere estritamente dentro das áreas designadas e não invada zonas onde trabalhadores estejam presentes ou haja perigos.
Além disso, integrar tais soluções com sistemas de alerta em tempo real permite que ações corretivas rápidas sejam tomadas. Além disso, os insights coletados podem ajudar a otimizar o layout e o fluxo de trabalho do canteiro, reduzindo ainda mais os riscos e aumentando a produtividade.

Fig 5. Monitoramento de maquinário pesado usando o Ultralytics YOLO11.
Monitoramento de animais com segmentação e Ultralytics YOLO11#
A Animal behavior monitoring ajuda investigadores, agricultores e conservacionistas a cuidar melhor dos animais em diferentes ambientes. A segmentação de instâncias desempenha um papel útil nestes sistemas ao identificar e segmentar animais individuais em quintas, zoos e habitats naturais. Ao contrário da deteção de objetos tradicional que utiliza caixas delimitadoras, a segmentação de instâncias fornece uma delimitação ao nível do píxel de cada animal, o que é particularmente útil quando os animais estão muito próximos.
A segmentação detalhada facilita o rastreamento mais preciso de movimentos e comportamentos. Animais sobrepostos ou agrupados podem ser reconhecidos distintamente, fornecendo uma análise mais precisa de interações, avaliações de saúde e padrões de atividade. No geral, insights mais profundos sobre o comportamento animal melhoram as práticas de cuidado e manejo animal.

Fig 6. Monitorização de gado utilizando segmentação de instâncias.
Ultralytics YOLO11 em análise esportiva e rastreamento de jogadores#
O rastreamento preciso de jogadores e eventos é uma parte enorme da análise esportiva. Métodos de rastreamento tradicionais dependem de marcação manual, que pode não capturar interações detalhadas. A visão computacional pode ser usada para segmentar detalhes como cada jogador, bola e evento principal em nível de pixel para obter insights detalhados.
Por exemplo, a segmentação de instâncias pode ajudar a detectar eventos como faltas ou incidentes sem bola, separando claramente cada jogador e objeto. Esse monitoramento granular habilitado por modelos como o Ultralytics YOLO11 oferece aos analistas informações mais claras para estudar padrões de movimento, posicionamento espacial e interações com alta precisão. Um benefício fundamental desses insights é que eles ajudam as equipes a aprimorar suas estratégias e impulsionar o desempenho geral.
Prós e contras da segmentação de instâncias#
Aqui estão alguns dos principais benefícios que a segmentação de instâncias pode trazer para diversos setores:
- Automação aprimorada: Ao automatizar tarefas como controle de qualidade e monitoramento de segurança, a segmentação de instâncias reduz a necessidade de intervenção manual e minimiza o erro humano.
- Melhor compreensão da cena: Ao delinear com precisão cada objeto, a segmentação de instâncias contribui para uma compreensão mais profunda de cenas complexas, apoiando a tomada de decisão mais informada.
- Pós-processamento eficiente: A saída em nível de pixel simplifica tarefas como remoção de fundo, contagem de objetos e análise espacial, reduzindo a necessidade de etapas de processamento adicionais.
Embora esses benefícios destaquem como a segmentação de instâncias impacta diferentes casos de uso, também é essencial considerar os desafios envolvidos em sua implementação.
Aqui estão algumas das principais limitações da segmentação de instâncias:
- Desafios com transparência: Segmentar objetos transparentes ou reflexivos como vidro e água é difícil, levando a limites imprecisos.
- Sobrecarga de manutenção: Para manter os modelos precisos e relevantes, são necessárias atualizações contínuas e ajustes finos à medida que as condições ambientais e os conjuntos de dados mudam.
- Alto esforço de anotação: Treinar modelos de segmentação de instâncias requer anotações detalhadas em nível de pixel, o que aumenta significativamente o tempo e o custo envolvidos na preparação de dados.
Principais pontos#
A segmentação de instâncias possibilita distinguir objetos individuais com precisão, mesmo quando eles se sobrepõem. Ao capturar os limites dos objetos em nível de pixel, ela fornece uma compreensão mais profunda dos dados visuais em comparação com tarefas tradicionais de visão computacional, como a detecção de objetos.
Avanços recentes na visão computacional tornaram a segmentação de instâncias mais rápida e fácil de usar. Em particular, modelos de visão computacional como o Ultralytics YOLO11 simplificam o processo, permitindo a segmentação em tempo real com configuração mínima, tornando-a mais acessível para diversos setores e aplicações.
Curioso acerca de IA? Visita our GitHub repository e liga-te a our community para continuares a explorar. Fica a saber mais sobre inovações como AI in self-driving cars e vision AI in agriculture nas nossas páginas de soluções. Consulta our licensing options e começa um projeto de visão computacional!






