Instance Segmentation
Aprende como a segmentação de instâncias permite a deteção de objetos ao nível dos píxeis. Descobre como utilizar o Ultralytics YOLO26 para gerar máscaras em tempo real e alta velocidade, entre outras possibilidades.
A segmentação de instâncias é uma técnica sofisticada de visão computacional (CV) que identifica e delimita cada objeto distinto de interesse numa imagem ao nível dos píxeis. Enquanto a deteção de objetos padrão localiza itens usando caixas delimitadoras retangulares, a segmentação de instâncias aprofunda a análise ao gerar uma máscara precisa para cada entidade detetada. Esta capacidade permite que os modelos de inteligência artificial (AI) distingam entre objetos individuais da mesma classe — como separar duas pessoas sobrepostas — proporcionando uma compreensão mais rica e detalhada da cena visual em comparação com métodos de classificação mais simples.
Distinguir os Tipos de Segmentação#
Para compreender plenamente a utilidade da segmentação de instâncias, é útil diferenciá-la de outras tarefas relacionadas de processamento de imagens. Cada método oferece um nível diferente de granularidade, dependendo dos requisitos da aplicação.
- Segmentação Semântica: Esta abordagem classifica cada píxel de uma imagem numa categoria (por exemplo, "estrada", "céu", "carro"). No entanto, não distingue entre objetos separados da mesma categoria. Se três carros estiverem estacionados lado a lado, a segmentação semântica vê-os como uma única região de "carro".
- Segmentação de Instâncias: Este método trata cada objeto como uma entidade única. Deteta instâncias individuais e atribui um rótulo exclusivo aos píxeis de cada uma. No exemplo dos carros estacionados, a segmentação de instâncias criaria três máscaras distintas, identificando separadamente o "Carro A", o "Carro B" e o "Carro C".
- Segmentação Panóptica: Uma abordagem híbrida que combina a rotulagem do fundo da segmentação semântica com a identificação de objetos contáveis da segmentação de instâncias.
A Mecânica da Análise ao Nível dos Píxeis#
Os modelos modernos de segmentação de instâncias dependem normalmente de arquiteturas avançadas de aprendizagem profunda (DL), particularmente de Redes Neuronais Convolucionais (CNNs). Estas redes extraem características de uma imagem para prever tanto a classe de um objeto como o seu contorno espacial. Historicamente, arquiteturas de duas etapas, como a Mask R-CNN, eram o padrão: primeiro propunham regiões de interesse e depois refinavam-nas em máscaras.
No entanto, avanços recentes deram origem a detetores de uma única etapa, como o YOLO26, que realizam a deteção e a segmentação simultaneamente. Esta abordagem "de ponta a ponta" melhora significativamente as velocidades de inferência em tempo real, tornando possível aplicar segmentação de alta precisão a transmissões de vídeo ao vivo em hardware de consumo.
Aplicações no mundo real#
Os limites precisos fornecidos pela segmentação de instâncias são essenciais para setores nos quais compreender a forma e a posição exatas de um objeto é necessário para a tomada de decisões.
- AI na Saúde: No diagnóstico médico, identificar o tamanho e a forma exatos de tumores ou lesões é essencial. A segmentação de instâncias permite que os modelos delimitem anomalias em exames de MRI com elevada precisão, ajudando os radiologistas no planeamento do tratamento e na monitorização da progressão da doença.
- Veículos Autónomos: Os carros autónomos dependem da segmentação para navegar em ambientes complexos. Utilizando conjuntos de dados como o Cityscapes, os veículos podem identificar superfícies transitáveis, reconhecer marcações de faixas e separar peões individuais em passadeiras movimentadas para garantir a segurança.
- AI na Agricultura: A agricultura de precisão utiliza a segmentação para monitorizar a saúde das culturas. Robôs equipados com sistemas de visão podem identificar frutos individuais para a colheita automatizada ou detetar ervas daninhas específicas para a aplicação direcionada de herbicidas, reduzindo o uso de produtos químicos e otimizando o rendimento.
Implementar a Segmentação com Python#
Os programadores podem implementar facilmente a segmentação de instâncias utilizando a biblioteca ultralytics. O exemplo seguinte demonstra como carregar um modelo YOLO26 pré-treinado e gerar máscaras de segmentação para uma imagem.
from ultralytics import YOLO
# Load a pre-trained YOLO26 instance segmentation model
# The 'n' suffix denotes the nano version, optimized for speed
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
# This predicts classes, bounding boxes, and masks
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# Displays the image with overlaid segmentation masks
results[0].show()Desafios e Treino de Modelos#
Embora poderosa, a segmentação de instâncias exige muitos recursos computacionais em comparação com a deteção simples por caixas delimitadoras. A geração de máscaras perfeitas ao nível dos píxeis requer recursos significativos de GPU e uma anotação de dados precisa. A anotação de dados para estas tarefas envolve desenhar polígonos ajustados em torno de cada objeto, o que pode consumir muito tempo.
Para simplificar este processo, as equipas utilizam frequentemente ferramentas como a Ultralytics Platform, que oferece funcionalidades de gestão de conjuntos de dados, anotação automática e treino na cloud. Isto permite aos programadores ajustar modelos com dados personalizados — como peças industriais específicas ou espécimes biológicos — e implementá-los de forma eficiente em dispositivos de AI de periferia, utilizando formatos otimizados como ONNX ou TensorRT.









