Receptive Field
Explora como o campo recetivo define o que uma rede neuronal consegue ver. Aprende como o Ultralytics YOLO26 otimiza o contexto espacial para detetar eficazmente objetos de todos os tamanhos.
No domínio da visão computacional (CV) e da aprendizagem profunda, o campo recetivo refere-se à região específica de uma imagem de entrada que um determinado neurónio numa rede neural (NN) «vê» ou analisa. Conceptualmente, funciona de forma semelhante ao campo de visão do olho humano ou de uma lente de câmara. Determina quanto contexto espacial um modelo consegue percecionar numa determinada camada. À medida que os dados avançam por uma Rede Neural Convolucional (CNN), o campo recetivo normalmente aumenta, permitindo que o sistema passe da identificação de pequenos detalhes locais — como contornos ou cantos — para a compreensão de estruturas complexas e globais, como objetos ou cenas inteiras.
A mecânica dos campos recetivos#
O tamanho e a profundidade do campo recetivo são determinados pela arquitetura da rede. Nas camadas iniciais, os neurónios normalmente têm um campo recetivo pequeno, concentrando-se num pequeno conjunto de píxeis para captar texturas detalhadas. À medida que a rede se torna mais profunda, operações como camadas de pooling e convoluções com stride fazem efetivamente o downsample dos mapas de características. Este processo permite que os neurónios das camadas seguintes agreguem informação de uma área muito maior da entrada original.
As arquiteturas modernas, incluindo a Ultralytics YOLO26, uma solução de vanguarda, são concebidas para equilibrar meticulosamente estes campos. Se o campo recetivo for demasiado estreito, o modelo poderá não reconhecer objetos grandes, por não conseguir percecionar a sua forma completa. Por outro lado, se o campo for excessivamente amplo sem manter a resolução, o modelo poderá não detetar objetos pequenos. Para resolver este problema, os engenheiros utilizam frequentemente convoluções dilatadas (também conhecidas como convoluções atrous) para expandir o campo recetivo sem reduzir a resolução espacial, uma técnica essencial para tarefas de alta precisão, como a segmentação semântica.
Aplicações no mundo real#
Otimizar o campo recetivo é fundamental para o sucesso de várias soluções de IA.
- Condução autónoma: Na IA para o setor automóvel, os sistemas de perceção têm de acompanhar simultaneamente pequenos detalhes e obstáculos de grandes dimensões. Um veículo precisa de um campo recetivo pequeno para identificar semáforos distantes, mas necessita simultaneamente de um campo recetivo grande para compreender a trajetória de um camião próximo ou a curvatura da faixa de rodagem. Esta perceção multiescala garante melhor segurança da IA e tomada de decisões.
- Diagnóstico médico: Ao aplicar IA na área da saúde, os radiologistas dependem de modelos para detetar anomalias em exames. Para identificar tumores cerebrais, a rede necessita de um campo recetivo grande para compreender a simetria e a estrutura gerais do cérebro. No entanto, para detetar microcalcificações em mamografias, o modelo depende de camadas iniciais com campos recetivos pequenos, sensíveis a alterações subtis na textura.
Distinguir conceitos relacionados#
Para compreender plenamente o design das redes, é útil distinguir o campo recetivo de termos semelhantes:
- Campo recetivo vs. kernel: O tamanho do kernel (ou filtro) define as dimensões da janela deslizante (por exemplo, 3x3) para uma única operação de convolução. O campo recetivo é uma propriedade emergente que representa a área total acumulada da entrada que afeta um neurónio. Uma sequência de vários kernels 3x3 resultará num campo recetivo muito maior do que 3x3.
- Campo recetivo vs. mapa de características: Um mapa de características é o volume de saída produzido por uma camada, contendo as representações aprendidas. O campo recetivo descreve a relação entre um único ponto desse mapa de características e a imagem de entrada original.
- Campo recetivo vs. janela de contexto: Embora ambos os termos se refiram ao âmbito dos dados percecionados, «janela de contexto» é normalmente utilizada em Processamento de Linguagem Natural (NLP) ou na análise de vídeo para indicar um intervalo temporal ou sequencial (por exemplo, o limite de tokens). Campo recetivo refere-se estritamente à área espacial em dados organizados numa grelha (imagens).
Utilização prática no código#
Modelos de vanguarda, como a versão mais recente do YOLO26, utilizam Redes de Pirâmide de Características (FPN) para manter campos recetivos eficazes para objetos de todos os tamanhos. O exemplo seguinte mostra como carregar um modelo e executar deteção de objetos, aproveitando automaticamente estas otimizações arquiteturais internas. Os utilizadores que pretendam treinar os seus próprios modelos com arquiteturas otimizadas podem utilizar a Ultralytics Platform para uma gestão simples de conjuntos de dados e treino na cloud.
from ultralytics import YOLO
# Load the latest YOLO26 model with optimized multi-scale receptive fields
model = YOLO("yolo26n.pt")
# Run inference; the model aggregates features from various receptive field sizes
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results, detecting both large (bus) and small (person) objects
results[0].show()








