O que é o Mask R-CNN e como funciona?
Aprende como o Mask R-CNN pode ser utilizado para segmentar objetos com precisão em imagens e vídeos, em várias aplicações e setores.

Inovações como robôs em armazéns, carros autónomos a circular em segurança por ruas movimentadas, drones a monitorizar culturas agrícolas e sistemas de IA a inspecionar produtos em fábricas estão a tornar-se mais comuns à medida que a adoção da IA aumenta. Uma tecnologia essencial que impulsiona estas inovações é a visão computacional, um ramo da IA que permite às máquinas compreender e interpretar dados visuais.
Por exemplo, a deteção de objetos é uma tarefa de visão computacional que ajuda a identificar e localizar objetos em imagens usando caixas delimitadoras. Embora as caixas delimitadoras forneçam informações úteis, apenas oferecem uma estimativa aproximada da posição de um objeto e não conseguem captar a sua forma ou os seus limites exatos. Isto torna-as menos eficazes em aplicações que exigem uma identificação precisa.
Para resolver este problema, os investigadores desenvolveram modelos de segmentação que captam os contornos exatos dos objetos, fornecendo detalhes ao nível dos píxeis para uma deteção e análise mais precisas.
O Mask R-CNN é um desses modelos. Apresentado em 2017 pela Facebook AI Research (FAIR), baseia-se em modelos anteriores como o R-CNN, o Fast R-CNN e o Faster R-CNN. Como um marco importante na história da visão computacional, o Mask R-CNN abriu caminho para modelos mais avançados, como o Ultralytics YOLO11.
Neste artigo, vamos explorar o que é o Mask R-CNN, como funciona, as suas aplicações e quais foram as melhorias que surgiram depois dele, conduzindo ao Ultralytics YOLO11.
Uma visão geral do Mask R-CNN#
O Mask R-CNN, que significa Rede Neural Convolucional Baseada em Regiões de Máscara, é um modelo de aprendizagem profunda concebido para tarefas de visão computacional, como a deteção de objetos e a segmentação de instâncias.
A segmentação de instâncias vai além da deteção tradicional de objetos, pois não só identifica os objetos numa imagem, como também delimita cada um deles com precisão. Atribui uma etiqueta única a cada objeto detetado e capta a sua forma exata ao nível dos píxeis. Esta abordagem detalhada permite distinguir claramente entre objetos sobrepostos e lidar com precisão com formas complexas.
O Mask R-CNN baseia-se no Faster R-CNN, que deteta e identifica objetos, mas não define as suas formas exatas. O Mask R-CNN melhora este processo ao identificar os píxeis exatos que compõem cada objeto, permitindo uma análise de imagem muito mais detalhada e precisa.

Fig. 1. Comparação entre deteção de objetos e segmentação de instâncias.
Um olhar sobre a arquitetura do Mask R-CNN e o seu funcionamento#
O Mask R-CNN adota uma abordagem passo a passo para detetar e segmentar objetos com precisão. Começa por extrair características importantes usando uma rede neural profunda (um modelo com várias camadas que aprende a partir de dados), depois identifica possíveis áreas de objetos com uma rede de propostas de regiões (um componente que sugere regiões de objetos prováveis) e, por fim, aperfeiçoa estas áreas criando máscaras de segmentação detalhadas (contornos precisos dos objetos) que captam a forma exata de cada objeto.
De seguida, vamos percorrer cada etapa para compreender melhor como funciona o Mask R-CNN.

Fig. 2. Uma visão geral da arquitetura do Mask R-CNN (Fonte: researchgate.net).
A começar pela extração de características#
O primeiro passo da arquitetura do Mask R-CNN consiste em decompor a imagem nas suas partes principais, para que o modelo possa compreender o que está nela. Pensa nisto como quando olhas para uma fotografia e reparas naturalmente em detalhes como formas, cores e contornos. O modelo faz algo semelhante usando uma rede neural profunda chamada "backbone" (frequentemente ResNet-50 ou ResNet-101), que funciona como os seus olhos para analisar a imagem e detetar detalhes importantes.
Como os objetos nas imagens podem ser muito pequenos ou muito grandes, o Mask R-CNN usa uma Feature Pyramid Network. É como ter diferentes lupas que permitem ao modelo ver tanto os detalhes finos como a imagem geral, garantindo que objetos de todos os tamanhos sejam identificados.
Depois de estas características serem extraídas, o modelo passa a localizar os objetos potenciais na imagem, preparando o terreno para uma análise adicional.
Sugerir áreas potenciais da imagem com objetos#
Depois de a imagem ser processada para extrair as características principais, a rede de propostas de regiões assume o controlo. Esta parte do modelo analisa a imagem e sugere áreas que provavelmente contêm objetos.
Faz isto gerando várias localizações possíveis de objetos, chamadas âncoras. Em seguida, a rede avalia estas âncoras e seleciona as mais promissoras para uma análise adicional. Desta forma, o modelo concentra-se apenas nas áreas com maior probabilidade de serem relevantes, em vez de verificar cada ponto da imagem.

Fig. 3. Um exemplo de uma rede de propostas de regiões.
Aperfeiçoar as características extraídas#
Com as áreas principais identificadas, o passo seguinte consiste em aperfeiçoar os detalhes extraídos dessas regiões. Os modelos anteriores usavam um método chamado ROI Pooling (Agrupamento de Regiões de Interesse) para extrair características de cada área, mas esta técnica por vezes causava pequenos desalinhamentos ao redimensionar as regiões, tornando-se menos eficaz, especialmente para objetos mais pequenos ou sobrepostos.
O Mask R-CNN melhora este processo ao usar uma técnica chamada ROI Align (Alinhamento de Regiões de Interesse). Em vez de arredondar as coordenadas, como faz o ROI Pooling, o ROI Align usa interpolação bilinear para estimar os valores dos píxeis com maior precisão. A interpolação bilinear é um método que calcula um novo valor de píxel fazendo a média dos valores dos seus quatro vizinhos mais próximos, o que cria transições mais suaves. Isto mantém as características devidamente alinhadas com a imagem original, resultando numa deteção e segmentação de objetos mais precisas.
Por exemplo, num jogo de futebol, dois jogadores que estejam próximos podem ser confundidos um com o outro porque as suas caixas delimitadoras se sobrepõem. O ROI Align ajuda a separá-los, mantendo as suas formas distintas.

Fig. 4. O Mask R-CNN usa o ROI Align.
Classificar objetos e prever as suas máscaras#
Depois de o ROI Align processar a imagem, o passo seguinte consiste em classificar os objetos e ajustar as suas localizações. O modelo analisa cada região extraída e decide que objeto contém. Atribui uma pontuação de probabilidade a diferentes categorias e escolhe a correspondência mais provável.
Ao mesmo tempo, ajusta as caixas delimitadoras para que se adaptem melhor aos objetos. As caixas iniciais podem não estar posicionadas de forma ideal, por isso este processo ajuda a melhorar a precisão, garantindo que cada caixa envolve de perto o objeto detetado.
Por fim, o Mask R-CNN dá um passo adicional: gera em paralelo uma máscara de segmentação detalhada para cada objeto.
O Mask R-CNN e as suas aplicações em tempo real#
Quando este modelo foi lançado, gerou grande entusiasmo na comunidade de IA e depressa começou a ser usado em várias aplicações. A sua capacidade de detetar e segmentar objetos em tempo real tornou-o revolucionário em diferentes setores.
Por exemplo, monitorizar animais ameaçados na natureza é uma tarefa desafiante. Muitas espécies deslocam-se por florestas densas, o que dificulta o trabalho dos conservacionistas de as acompanhar. Os métodos tradicionais usam armadilhas fotográficas, drones e imagens de satélite, mas analisar manualmente todos estes dados consome muito tempo. Identificações incorretas e avistamentos não registados podem atrasar os esforços de conservação.
Ao reconhecer características únicas, como as riscas dos tigres, as manchas das girafas ou o formato das orelhas dos elefantes, o Mask R-CNN consegue detetar e segmentar animais em imagens e vídeos com maior precisão. Mesmo quando os animais estão parcialmente escondidos por árvores ou próximos uns dos outros, o modelo consegue separá-los e identificar cada um individualmente, tornando a monitorização da vida selvagem mais rápida e fiável.

Fig. 5. Deteção e segmentação de animais usando o Mask R-CNN.
Limitações do Mask R-CNN#
Apesar da sua importância histórica na deteção e segmentação de objetos, o Mask R-CNN também apresenta algumas desvantagens importantes. Eis alguns desafios relacionados com o Mask R-CNN:
- Elevada exigência computacional: Depende de GPUs potentes, o que pode tornar a sua execução dispendiosa e lenta ao processar grandes quantidades de dados.
- Velocidade de processamento mais baixa: O seu processo em várias etapas torna-o mais lento do que modelos em tempo real mais rápidos, como o YOLO, o que pode não ser ideal para tarefas sensíveis ao tempo.
- Dependência de dados de alta qualidade: O modelo tem melhor desempenho com imagens nítidas e devidamente etiquetadas. Imagens desfocadas ou com pouca iluminação podem reduzir significativamente a sua precisão.
- Implementação complexa: A arquitetura em várias etapas pode ser difícil de configurar e otimizar, especialmente ao lidar com grandes conjuntos de dados ou recursos limitados.
Do Mask R-CNN ao Ultralytics YOLO11#
O Mask R-CNN era excelente para tarefas de segmentação, mas muitos setores procuravam adotar a visão computacional, dando prioridade à velocidade e ao desempenho em tempo real. Este requisito levou os investigadores a desenvolver modelos de uma só etapa que detetam objetos numa única passagem, melhorando significativamente a eficiência.
Ao contrário do processo em várias etapas do Mask R-CNN, os modelos de visão computacional de uma só etapa, como o YOLO (You Only Look Once), concentram-se em tarefas de visão computacional em tempo real. Em vez de tratarem a deteção e a segmentação separadamente, os modelos YOLO conseguem analisar uma imagem de uma só vez. Isto torna-os ideais para aplicações como condução autónoma, cuidados de saúde, fabrico e robótica, nas quais é essencial tomar decisões rapidamente.
Em particular, o Ultralytics YOLO11 leva este conceito mais longe ao ser simultaneamente rápido e preciso. Usa menos 22% de parâmetros do que o YOLOv8m, mas ainda assim alcança uma precisão média média (mAP) superior no conjunto de dados COCO, o que significa que deteta objetos com maior precisão. A sua velocidade de processamento melhorada torna-o uma boa escolha para aplicações em tempo real, nas quais cada milissegundo é importante.

Fig. 6. Desempenho do YOLO11 em comparação com outros modelos.
Principais conclusões#
Ao analisar a história da visão computacional, o Mask R-CNN é reconhecido como um grande avanço na deteção e segmentação de objetos. Fornece resultados muito precisos mesmo em ambientes complexos, graças ao seu processo detalhado em várias etapas.
No entanto, este mesmo processo torna-o mais lento do que modelos em tempo real, como o YOLO. À medida que a necessidade de velocidade e eficiência aumenta, muitas aplicações usam agora modelos de uma só etapa, como o Ultralytics YOLO11, que oferecem uma deteção de objetos rápida e precisa. Embora o Mask R-CNN seja importante para compreender a evolução da visão computacional, a tendência para soluções em tempo real destaca a crescente procura por soluções de visão computacional mais rápidas e eficientes.
Junta-te à nossa comunidade em crescimento! Explora o nosso repositório no GitHub para saberes mais sobre IA. Queres começar os teus próprios projetos de visão computacional? Consulta as nossas opções de licenciamento. Descobre mais sobre IA na agricultura e IA de visão na área da saúde visitando as nossas páginas de soluções!









