O que é o ResNet-50 e qual é a sua relevância na visão computacional?
Descubra como a arquitetura do ResNet-50 permite a classificação de imagens em aplicações do mundo real nos setores da saúde, da indústria e dos sistemas autónomos.

A análise automatizada de imagens está a tornar-se cada vez mais comum em aplicações como a deteção de carros em excesso de velocidade ou a análise de imagens médicas. A tecnologia que impulsiona estas inovações é a visão computacional ou a IA de visão. É um ramo da inteligência artificial (AI) que permite às máquinas interpretar e compreender imagens e vídeos, tal como os seres humanos.
Para criar estas soluções de visão computacional, os programadores recorrem a modelos de IA de visão capazes de aprender com grandes quantidades de dados visuais. Ao longo dos anos, os investigadores desenvolveram modelos mais recentes e avançados, com um desempenho impressionante em tarefas de IA de visão, como a classificação de imagens (atribuição de etiquetas a imagens), a deteção de objetos (localização e identificação de objetos em imagens) e a segmentação de instâncias (deteção de objetos e delimitação das suas formas exatas).
No entanto, olhar para trás e compreender os modelos anteriores pode ajudar a perceber como funcionam os sistemas de visão computacional atuais. Um exemplo fundamental é o ResNet-50, um modelo influente que introduziu a ideia das ligações de atalho — caminhos simples que ajudam o modelo a aprender de forma mais rápida e precisa.
Esta inovação tornou possível treinar redes neuronais muito mais profundas de forma eficaz, conduzindo a melhorias significativas na classificação de imagens e moldando o design de muitos dos modelos que se seguiram. Neste artigo, vamos explorar o ResNet-50, o seu funcionamento e a sua relevância na evolução da visão computacional. Vamos começar!
O que é o ResNet-50?#
O ResNet-50 é um modelo de visão computacional baseado num tipo de rede neuronal chamada Rede Neural Convolucional (CNN). As CNN foram concebidas para ajudar os computadores a compreender informações visuais, aprendendo padrões nas imagens, como contornos, cores ou formas, e utilizando esses padrões para reconhecer e classificar objetos.
Apresentado em 2015 por investigadores da Microsoft Research, o ResNet-50 tornou-se rapidamente um dos modelos mais impactantes da área devido à sua precisão e eficiência em tarefas de reconhecimento de imagens em grande escala.
Uma característica fundamental do ResNet-50 é a utilização de ligações residuais, também conhecidas como ligações de atalho. São caminhos simples que permitem ao modelo saltar algumas etapas do processo de aprendizagem. Por outras palavras, em vez de obrigar o modelo a passar por cada camada, estes atalhos permitem-lhe transportar detalhes importantes diretamente. Isto torna a aprendizagem mais rápida e fiável.

Fig. 1. Uma visão das ligações residuais na arquitetura ResNet.
Este design ajuda a resolver um problema comum da aprendizagem profunda chamado problema do desaparecimento do gradiente. Em modelos muito profundos, podem perder-se informações importantes à medida que atravessam muitas camadas, dificultando a aprendizagem do modelo.
As ligações residuais ajudam a evitar este problema, mantendo o fluxo de informação claro do início ao fim. É por isso que o modelo se chama ResNet-50: ResNet significa Rede Residual, e o «50» refere-se ao número de camadas utilizadas para processar uma imagem.
Uma visão geral de como funciona o ResNet-50#
O ResNet-50 tem uma estrutura bem organizada que permite ao modelo aprofundar-se sem perder informações importantes. Segue um padrão simples e repetível, que mantém a eficiência e permite obter um desempenho elevado.
Eis uma análise mais detalhada do funcionamento da arquitetura ResNet-50:
- Extração básica de características: O modelo começa por aplicar uma operação matemática chamada convolução. Isto envolve deslizar pequenos filtros (chamados kernels) sobre a imagem para produzir mapas de características — novas versões da imagem que realçam padrões básicos, como contornos ou texturas. É assim que o modelo começa a identificar informações visuais úteis.
- Aprendizagem de características complexas: À medida que os dados avançam pela rede, o tamanho dos mapas de características diminui. Isto é feito através de técnicas como pooling ou da utilização de filtros com passos maiores (chamados strides). Ao mesmo tempo, a rede cria mais mapas de características, ajudando-a a captar padrões cada vez mais complexos, como formas, partes de objetos ou texturas.
- Compressão e expansão de dados: Cada etapa comprime os dados, processa-os e depois expande-os novamente. Isto ajuda o modelo a aprender, poupando memória.
- Ligações de atalho: São caminhos simples que permitem à informação avançar sem passar por todas as camadas. Tornam a aprendizagem mais estável e eficiente.
- Fazer uma previsão: No final da rede, todas as informações aprendidas são combinadas e passam por uma função softmax. Esta função produz uma distribuição de probabilidade sobre as classes possíveis, indicando a confiança do modelo em cada previsão — por exemplo, 90% gato, 9% cão, 1% carro.

Fig. 2. A arquitetura ResNet-50.
Características principais do ResNet-50#
Embora o ResNet-50 tenha sido originalmente concebido para a classificação de imagens, o seu design flexível tornou-o útil em muitas áreas da visão computacional. Vejamos algumas das características que distinguem o ResNet-50.
Utilizar o ResNet-50 para a classificação de imagens#
O ResNet-50 é utilizado principalmente para a classificação de imagens, cujo objetivo é atribuir uma etiqueta a uma imagem. Por exemplo, dada uma fotografia, o modelo pode classificá-la como sendo de um cão, gato ou avião com base no objeto principal que identifica.
O seu design fiável e a disponibilidade em bibliotecas de aprendizagem profunda amplamente utilizadas, como PyTorch e TensorFlow, tornaram o ResNet-50 uma escolha inicial popular para o treino com grandes conjuntos de dados de imagens. Um dos exemplos mais conhecidos é o ImageNet, uma enorme coleção de imagens etiquetadas utilizada para avaliar e comparar modelos de visão computacional.
Embora modelos mais recentes, como o Ultralytics YOLO11, apresentem um desempenho superior, o ResNet-50 continua a ser frequentemente utilizado como referência graças ao seu equilíbrio sólido entre precisão, velocidade e simplicidade.

Fig. 3. Um exemplo de utilização do ResNet-50 para classificar um cão.
Deteção de objetos possibilitada pelos backbones ResNet-50#
Enquanto a classificação de imagens consiste em identificar o objeto principal numa imagem, a deteção de objetos vai mais longe, encontrando e etiquetando vários objetos na mesma imagem. Por exemplo, numa imagem de uma rua movimentada, um modelo pode ter de detetar carros, autocarros e pessoas — e determinar onde se encontra cada um.
O ResNet-50 é utilizado como backbone em alguns destes modelos. Isto significa que trata da primeira parte do trabalho: analisar a imagem e extrair detalhes importantes que descrevem o que está nela e onde se encontra. Estes detalhes são depois enviados para a parte seguinte do modelo, chamada cabeça de deteção, que toma as decisões finais sobre os objetos presentes na imagem e a sua localização.
Modelos de deteção populares, como Faster R-CNN e DETR, utilizam o ResNet-50 nesta etapa de extração de características. Como capta bem tanto os detalhes finos como a disposição geral de uma imagem, ajuda estes modelos a fazer previsões precisas — mesmo em cenas complexas.
Aprendizagem por transferência com o ResNet-50#
Outro aspeto interessante do modelo ResNet-50 é a sua capacidade de suportar a aprendizagem por transferência. Isto significa que o modelo, originalmente treinado num grande conjunto de dados como o ImageNet para a classificação de imagens, pode ser adaptado a novas tarefas com muito menos dados.
Em vez de começar do zero, reutiliza-se a maioria das camadas do modelo, substituindo e treinando novamente apenas a camada final de classificação para a nova tarefa. Isto poupa tempo e é especialmente útil quando os dados etiquetados são limitados.
Aplicações de visão computacional do ResNet-50#
A arquitetura do ResNet-50 tornou-o útil numa vasta gama de aplicações de visão computacional. Foi especialmente importante nos primórdios da aprendizagem profunda, ajudando a transferir a tecnologia de IA de visão da investigação para a utilização no mundo real. Ao resolver desafios fundamentais, ajudou a abrir caminho para os modelos mais avançados que vemos nas aplicações atuais.
Imagiologia médica impulsionada pelo ResNet-50#
O ResNet-50 foi um dos primeiros modelos utilizados na imagiologia médica baseada em aprendizagem profunda. Os investigadores utilizaram-no para identificar padrões de doenças em radiografias, RM e outros exames de diagnóstico. Por exemplo, ajudou a detetar tumores e a classificar imagens da retina diabética para apoiar o diagnóstico em oftalmologia.
Embora sejam agora utilizados modelos mais avançados em ferramentas clínicas, o ResNet-50 desempenhou um papel fundamental na investigação inicial de IA médica. A sua facilidade de utilização e o seu design modular tornaram-no uma escolha adequada para criar protótipos de sistemas de diagnóstico.

Fig. 4. Deteção de tumores cerebrais com base no ResNet-50.
Automação industrial impulsionada pelo ResNet-50#
De forma semelhante, o ResNet-50 também foi aplicado em ambientes industriais. Por exemplo, na indústria transformadora, foi utilizado em sistemas de investigação e piloto para detetar defeitos de superfície em materiais, como aço, betão e peças pintadas.
Também foi testado em configurações destinadas a identificar poros, fissuras ou depósitos que se formam durante a fundição ou a montagem. O ResNet-50 é adequado para estas tarefas porque consegue detetar diferenças subtis na textura da superfície, uma capacidade importante para a inspeção de qualidade.
Embora modelos mais avançados, como o Ultralytics YOLO11, sejam agora frequentemente utilizados em sistemas de produção, o ResNet-50 continua a desempenhar um papel importante na investigação académica e na avaliação comparativa, sobretudo em tarefas de classificação de imagens.

Fig. 5. Inspeção de superfícies com o ResNet-50.
Vantagens e limitações do ResNet-50#
Eis algumas das vantagens do ResNet-50:
- Desempenho sólido como referência: O ResNet-50 oferece uma precisão consistente numa vasta gama de tarefas, o que faz dele uma referência de confiança tanto na investigação como em projetos aplicados.
- Bem documentado e amplamente estudado: A sua arquitetura é bem compreendida e está documentada de forma exaustiva, o que facilita a resolução de problemas e a aprendizagem por parte de programadores e investigadores.
- Versátil em vários domínios: Da imagiologia médica à indústria transformadora, o ResNet-50 foi aplicado com sucesso a vários problemas do mundo real, comprovando a sua flexibilidade.
Vejamos agora algumas das limitações do ResNet-50:
- Elevado consumo de recursos: O ResNet-50 requer mais memória e poder computacional do que os modelos leves, o que pode torná-lo menos adequado para dispositivos móveis ou aplicações em tempo real.
- Sobreajuste em conjuntos de dados pequenos: Devido à sua profundidade e complexidade, o ResNet-50 pode sofrer sobreajuste quando é treinado com dados limitados sem técnicas de regularização adequadas.
- Tamanho de entrada fixo: O ResNet-50 normalmente espera imagens com um tamanho específico, como 224×224 píxeis, pelo que muitas vezes é necessário redimensionar ou recortar as imagens, o que pode remover detalhes importantes.
Principais conclusões#
O ResNet-50 demonstrou que era possível treinar redes muito profundas de forma eficaz, mantendo um desempenho sólido em tarefas visuais. A sua arquitetura ofereceu um enquadramento claro e prático para criar modelos mais profundos que funcionassem de forma fiável.
Após o seu lançamento, os investigadores desenvolveram o design, criando versões mais profundas, como o ResNet-101 e o ResNet-152. De forma geral, o ResNet-50 é um modelo fundamental que ajudou a moldar a forma como a aprendizagem profunda é utilizada atualmente na visão computacional.
Junta-te à nossa comunidade em crescimento! Explora o nosso repositório no GitHub para saberes mais sobre IA. Queres começar os teus próprios projetos de visão computacional? Consulta as nossas opções de licenciamento. Descobre mais sobre IA na agricultura e IA de visão na área da saúde visitando as nossas páginas de soluções!









