Um guia sobre a arquitetura U-Net e as suas aplicações
Aprende sobre a arquitetura U-Net, como suporta a segmentação de imagens, as suas aplicações e a sua importância na evolução da visão computacional.

A visão computacional é um ramo da inteligência artificial (AI) que se concentra na análise de dados visuais. Ela abriu caminho para muitos sistemas de ponta, como a automatização do processo de inspeção de produtos em fábricas e o auxílio à navegação de veículos autónomos nas estradas.
Uma das tarefas de visão computacional mais conhecidas é a deteção de objetos. Esta tarefa permite que os modelos localizem e identifiquem objetos numa imagem usando caixas delimitadoras. Embora as caixas delimitadoras sejam úteis para várias aplicações, fornecem apenas uma estimativa aproximada da localização de um objeto.
No entanto, em áreas como a saúde, onde a precisão é crucial, os casos de uso de AI para visão dependem de mais do que apenas identificar um objeto. Muitas vezes, também requerem informações relacionadas com a forma e a posição exatas dos objetos.
É exatamente isso que a tarefa de visão computacional, a segmentação, foi concebida para fazer. Em vez de usar caixas delimitadoras, os modelos de segmentação detetam objetos ao nível dos píxeis. Ao longo dos anos, os investigadores desenvolveram modelos de visão computacional especializados para segmentação.
Um desses modelos é o U-Net. Embora modelos mais recentes e avançados tenham superado o seu desempenho, o U-Net ocupa um lugar importante na história da visão computacional. Neste artigo, vamos analisar mais detalhadamente a arquitetura U-Net, o seu funcionamento, onde foi utilizada e como se compara com modelos de segmentação mais modernos disponíveis atualmente.

Fig. 1. Um exemplo de segmentação usando o modelo de aprendizagem profunda U-Net. (Fonte)
A história da segmentação de imagens#
Antes de analisarmos o que é o U-Net, vamos primeiro compreender melhor como os modelos de segmentação de imagens evoluíram.
Inicialmente, a visão computacional baseava-se em técnicas tradicionais, como deteção de contornos, limiarização ou crescimento de regiões, para separar objetos numa imagem. Estas técnicas eram usadas para detetar limites de objetos através de contornos, separar regiões pela intensidade dos píxeis e agrupar píxeis semelhantes. Funcionavam em casos simples, mas falhavam frequentemente quando as imagens tinham ruído, formas sobrepostas ou limites pouco claros.
Após o surgimento da aprendizagem profunda em 2012, os investigadores introduziram o conceito de redes totalmente convolucionais (FCNs) em 2014 para tarefas como a segmentação semântica. Estes modelos substituíram determinadas partes de uma rede convolucional para permitir que o computador analisasse uma imagem inteira de uma só vez, em vez de a dividir em partes menores. Isto tornou possível ao modelo criar mapas detalhados que mostram com maior clareza o que está numa imagem.

Fig. 2. A evolução dos algoritmos de segmentação baseados em aprendizagem profunda. (Fonte)
Com base nas FCNs, o U-Net foi introduzido por investigadores da Universidade de Friburgo em 2015. Foi originalmente concebido para a segmentação de imagens biomédicas. Em particular, o U-Net foi concebido para ter um bom desempenho em situações em que os dados anotados são limitados.
Entretanto, versões posteriores, como UNet++ e TransUNet, acrescentaram melhorias como camadas de atenção e uma melhor extração de características. As camadas de atenção ajudam o modelo a concentrar-se nas regiões principais, enquanto a extração de características melhorada capta informações mais detalhadas.
O que é o U-Net e como fluem as características pelo modelo?#
O U-Net é um modelo de aprendizagem profunda criado especificamente para a segmentação de imagens. Recebe uma imagem como entrada e produz uma máscara de segmentação que classifica cada píxel de acordo com o objeto ou a região a que pertence.
O modelo recebe o seu nome da arquitetura em forma de U. É composto por duas partes principais: um codificador que comprime a imagem e aprende as suas características, e um descodificador que a expande novamente para o tamanho original. Este design cria uma forma de U simétrica, que ajuda o modelo a compreender tanto a estrutura geral de uma imagem como os seus detalhes mais finos.
Uma característica crucial do U-Net é o uso de ligações de atalho, que permitem transmitir diretamente informações do codificador para o descodificador. Isto significa que o modelo pode preservar detalhes importantes que poderiam perder-se quando a imagem é comprimida.
Uma visão geral da arquitetura U-Net#
Eis uma breve visão geral de como funciona a arquitetura U-Net:
- Imagem de entrada: O U-Net começa com uma imagem 2D, como uma tomografia médica ou uma fotografia de satélite. O objetivo é atribuir um rótulo de classe a cada píxel da imagem.
- Subamostragem: A imagem passa por camadas convolucionais que aprendem características visuais importantes. À medida que a imagem atravessa diferentes camadas, a sua resolução diminui e o modelo identifica padrões mais amplos.
- Camada de gargalo: No centro da rede, os mapas de características atingem a sua menor resolução espacial, captando simultaneamente características semânticas de alto nível. Em termos simples, esta representação comprimida dos mapas de características corresponde ao contexto geral da entrada.
- Sobreamostragem: Em seguida, a rede reconstrói a imagem aumentando gradualmente a resolução. As convoluções transpostas ajudam a expandir os mapas de características novamente na direção do tamanho original.
- Ligações de atalho: Os mapas de características do percurso de subamostragem são concatenados com os do percurso de sobreamostragem. Isto ajuda a preservar detalhes espaciais finos e, ao mesmo tempo, a integrar informações contextuais de alto nível.
- A saída é um mapa de segmentação: A saída final é uma máscara de segmentação píxel a píxel que corresponde ao tamanho da entrada. Cada píxel é classificado numa categoria, como objeto, fundo ou região de interesse.

Fig. 3. Diagrama da arquitetura U-Net. (Fonte)
Compreender a diferença entre ViT e U-Net#
Ao explorares o U-Net, podes perguntar-te como ele difere de outros modelos de aprendizagem profunda, como o Vision Transformer (ViT), que também pode executar tarefas de segmentação. Embora ambos os modelos possam executar tarefas semelhantes, diferem na forma como são construídos e como lidam com a segmentação.
O U-Net funciona processando imagens ao nível dos píxeis através de camadas convolucionais numa estrutura de codificador-descodificador. É frequentemente usado em tarefas que requerem uma segmentação precisa, como tomografias médicas ou cenas de veículos autónomos.
Por outro lado, o Vision Transformer (ViT) divide as imagens em patches e processa-os simultaneamente através de mecanismos de atenção. Usa a autoatenção (um mecanismo que permite ao modelo atribuir diferentes níveis de importância às partes da imagem relativamente umas às outras) para captar a relação entre as diferentes partes da imagem, ao contrário da abordagem convolucional do U-Net.
Outra diferença importante é que, em geral, o ViT precisa de mais dados para funcionar bem, mas é excelente a identificar padrões complexos. O U-Net, por outro lado, tem um bom desempenho com conjuntos de dados menores, é mais rápido de treinar e frequentemente requer menos tempo de treino.
Aplicações do modelo U-Net#
Agora que compreendemos melhor o que é o U-Net e como funciona, vamos explorar como o U-Net tem sido aplicado em diferentes áreas.
Segmentação de hemorragias cerebrais em imagiologia médica#
O U-Net tornou-se um método fiável para a segmentação ao nível dos píxeis de imagens médicas complexas, especialmente durante o seu auge na investigação. Foi utilizado por investigadores para destacar áreas importantes em exames médicos, como tumores e sinais de hemorragia interna em imagens de CT e MRI. Esta abordagem melhorou significativamente a precisão dos diagnósticos e simplificou a análise de dados médicos complexos em contextos de investigação.
Um exemplo do impacto do U-Net na investigação em saúde é a sua utilização na identificação de acidentes vasculares cerebrais e hemorragias cerebrais em exames médicos. Os investigadores podiam usar o U-Net para analisar exames da cabeça e destacar áreas preocupantes, permitindo identificar mais rapidamente os casos que requerem atenção imediata.

Fig. 4. Segmentação de lesões de AVC hemorrágico usando o 3D U-Net. (Fonte)
Segmentação de culturas na agricultura#
Outra área em que os investigadores usaram o U-Net é a agricultura, particularmente para segmentar culturas, ervas daninhas e solo. Ajuda os agricultores a monitorizar a saúde das plantas, estimar a produção e tomar melhores decisões em grandes explorações agrícolas. Por exemplo, o U-Net pode separar as culturas das ervas daninhas, tornando a aplicação de herbicidas mais eficiente e reduzindo o desperdício.
Para enfrentar desafios como o desfoque de movimento em imagens de drones, os investigadores melhoraram o U-Net com técnicas de remoção de desfoque de imagens. Isto garante uma segmentação mais nítida, mesmo quando os dados são recolhidos durante o movimento, como em levantamentos aéreos.

Fig. 5. Separação de culturas e ervas daninhas em campos agrícolas com o U-Net. (Fonte)
Condução autónoma#
Antes da introdução de modelos de AI mais avançados, o U-Net desempenhou um papel fundamental na exploração de como a segmentação poderia melhorar a condução autónoma. Em veículos autónomos, a segmentação semântica do U-Net pode ser usada para classificar cada píxel de uma imagem em categorias como estrada, veículo, peão e marcações de faixa. Isto proporciona ao veículo uma visão clara do ambiente envolvente, ajudando na navegação segura e na tomada de decisões eficazes.

Fig. 6. Uma cena de estrada cuja área transitável é segmentada usando o U-Net. (Fonte)
Vantagens e desvantagens do U-Net#
Ainda hoje, o U-Net continua a ser uma boa escolha para a segmentação de imagens entre os investigadores, graças ao seu equilíbrio entre simplicidade, precisão e adaptabilidade. Eis algumas das principais vantagens que o distinguem:
- Adaptável a diferentes modalidades: O U-Net foi adaptado a diferentes tipos de dados, incluindo exames médicos 3D, imagens de satélite e até fotogramas de vídeo.
- Inferência rápida quando otimizado: Quando devidamente ajustado, o U-Net pode funcionar de forma eficiente, tornando-o adequado para aplicações em tempo real ou quase em tempo real.
- Código aberto e comunidade: O U-Net está disponível nas principais bibliotecas de aprendizagem profunda e conta com o apoio de uma grande comunidade de programadores e investigadores.
Embora o U-Net tenha muitos pontos fortes, também existem algumas limitações a ter em conta. Eis alguns fatores a considerar:
- Sensível à qualidade dos dados: O desempenho do U-Net pode ser afetado negativamente por dados de baixa qualidade, como imagens com ruído ou baixa resolução.
- Propenso a sobreajuste com conjuntos de dados pequenos: Embora o U-Net tenha um bom desempenho com dados limitados, continua a existir o risco de sobreajuste se não for devidamente regularizado, especialmente quando o conjunto de dados é demasiado pequeno ou carece de diversidade.
- Recursos computacionais: O U-Net pode exigir muitos recursos computacionais, especialmente ao trabalhar com grandes conjuntos de dados, requerendo recursos de hardware significativos para o treino.
Principais conclusões#
O U-Net foi um marco importante na evolução da segmentação de imagens. Demonstrou que os modelos de aprendizagem profunda podem produzir resultados precisos usando conjuntos de dados menores, especialmente em áreas como a imagiologia médica.
Esta descoberta abriu caminho para aplicações mais avançadas em vários setores. À medida que a visão computacional continua a evoluir, os modelos de segmentação como o U-Net continuam a ser fundamentais para permitir que as máquinas compreendam e interpretem dados visuais com elevada precisão.
Queres desenvolver os teus próprios projetos de visão computacional? Explora o nosso repositório do GitHub para aprofundar os teus conhecimentos sobre AI e consulta as nossas opções de licenciamento. Descobre como a visão computacional na saúde está a melhorar a eficiência e explora o impacto da AI no retalho visitando as nossas páginas de soluções! Junta-te já à nossa crescente comunidade!









