Receptive Field
Explora cómo el campo receptivo define lo que ve una red neuronal. Aprende cómo Ultralytics YOLO26 optimiza el contexto espacial para detectar objetos de todos los tamaños de manera efectiva.
En el ámbito de la computer vision (CV) y el aprendizaje profundo, el campo receptivo se refiere a la región específica de una imagen de entrada que una neurona concreta en una neural network (NN) «ve» o analiza. Conceptualment, funciona de manera similar al campo de visión del ojo humano o de la lente de una cámara. Determina cuánt contexto espacial puede percibir un modelo en una capa dada. A medida que los datos avanzan a través de una Convolutional Neural Network (CNN), el campo receptivo suele expandirse, lo que permite al sistema pasar de identificar detalles locales diminutos —como bordes o esquinas— a comprender estructuras globales complejas como objetos enteros o escenas.
La mecánica de los campos receptivos#
El tamaño y la profundidad del campo receptivo están determinados por la arquitectura de la red. En las capas iniciales, las neuronas suelen tener un campo receptivo pequeño, centrándose en un grupo diminuto de píxeles para capturar texturas de grano fino. A medida que la red se profundiza, operaciones como las pooling layers y las strided convolutions downsample eficazmente los mapas de características. Este proceso permite que las neuronas posteriores agrupen información de una porción mucho mayor de la entrada original.
Las arquitecturas modernas, incluido el avanzado Ultralytics YOLO26, están diseñadas para equilibrar estos campos meticulosamente. Si el campo receptivo es demasiado estrecho, es posible que el modelo no reconozca objetos grandes porque no puede percibir toda la forma. Por el contrario, si el campo es excesivamente amplio sin mantener la resolución, el modelo podría pasar por alto objetos pequeños. Para solucionar esto, los ingenieros suelen utilizar dilated convolutions (también conocidas como convoluciones atrous) para expandir el campo receptivo sin reducir la resolución espacial, una técnica vital para tareas de alta precisión como la semantic segmentation.
Aplicaciones en el mundo real#
Optimizar el campo receptivo es fundamental para el éxito de varias AI solutions.
- Conducción Autónoma: En la AI for automotive, los sistemas de percepción deben rastrear simultáneamente detalles mínimos y grandes obstáculos. Un vehículo necesita un campo receptivo pequeño para identificar semáforos distantes, al tiempo que requiere un campo receptivo grande para comprender la trayectoria de un camión cercano o la curvatura del carril de la carretera. Esta percepción a múltiples escalas garantiza una mejor AI safety y toma de decisiones.
- Diagnóstico Médico: Al aplicar AI in healthcare, los radiólogos confían en los modelos para detectar anomalías en las exploraciones. Para identificar brain tumors, la red requiere un campo receptivo grande para comprender la simetría y la estructura general del cerebro. Sin embargo, para detectar microcalcificaciones en mamografías, el modelo se basa en capas tempranas con campos receptivos pequeños sensibles a cambios sutiles de textura.
Distinguir conceptos relacionados#
Para entender completamente el diseño de redes, resulta útil diferenciar el campo receptivo de términos similares:
- Campo receptivo frente a Kernel: El tamaño del kernel (o filtro) define las dimensiones de la ventana deslizante (por ejemplo, 3x3) para una sola operación de convolution. El campo receptivo es una propiedad emergente que representa el área de entrada total acumulada que afecta a una neurona. Una pila de múltiples kernels de 3x3 dará como resultado un campo receptivo mucho mayor que 3x3.
- Campo receptivo frente a Feature Map: Un mapa de características es el volumen de salida producido por una capa, que contiene las representaciones aprendidas. El campo receptivo describe la relación entre un único punto en ese mapa de características y la imagen de entrada original.
- Campo receptivo frente a Context Window: Aunque ambos términos se refieren al alcance de los datos percibidos, la «ventana de contexto» se utiliza normalmente en el Natural Language Processing (NLP) o en el análisis de vídeo para denotar un intervalo temporal o secuencial (por ejemplo, el límite de tokens). El campo receptivo se refiere estrictamente al área espacial en datos en forma de cuadrícula (imágenes).
Uso práctico en código#
Los modelos punteros como el nuevo YOLO26 utilizan Feature Pyramid Networks (FPN) para mantener campos receptivos eficaces para objetos de todos los tamaños. El siguiente ejemplo muestra cómo cargar un modelo y realizar object detection, aprovechando estas optimizaciones arquitectónicas internas de forma automática. Los usuarios que deseen entrenar sus propios modelos con arquitecturas optimizadas pueden utilizar la Ultralytics Platform para una gestión de conjuntos de datos y un entrenamiento en la nube sin problemas.
from ultralytics import YOLO
# Load the latest YOLO26 model with optimized multi-scale receptive fields
model = YOLO("yolo26n.pt")
# Run inference; the model aggregates features from various receptive field sizes
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results, detecting both large (bus) and small (person) objects
results[0].show()





