Receptive Field
Descubre cómo el campo receptivo define lo que ve una red neuronal. Aprende cómo Ultralytics YOLO26 optimiza el contexto espacial para detectar eficazmente objetos de todos los tamaños.
En el ámbito de la visión artificial (CV) y el aprendizaje profundo, el campo receptivo hace referencia a la región específica de una imagen de entrada que una neurona concreta de una red neuronal (NN) «ve» o analiza. Conceptualmente, funciona de forma similar al campo de visión del ojo humano o al de la lente de una cámara. Determina cuánto contexto espacial puede percibir un modelo en una capa determinada. A medida que los datos avanzan por una red neuronal convolucional (CNN), el campo receptivo suele expandirse, lo que permite al sistema pasar de identificar detalles locales diminutos, como bordes o esquinas, a comprender estructuras globales complejas, como objetos o escenas completas.
Mecánica de los campos receptivos#
El tamaño y la profundidad del campo receptivo vienen determinados por la arquitectura de la red. En las capas iniciales, las neuronas suelen tener un campo receptivo pequeño y se centran en un conjunto diminuto de píxeles para capturar texturas detalladas. A medida que la red se hace más profunda, operaciones como las capas de pooling y las convoluciones con stride realizan efectivamente un submuestreo de los mapas de características. Este proceso permite que las neuronas posteriores agreguen información de una parte mucho mayor de la entrada original.
Las arquitecturas modernas, incluida la Ultralytics YOLO26 de vanguardia, están diseñadas para equilibrar estos campos meticulosamente. Si el campo receptivo es demasiado estrecho, el modelo puede no reconocer objetos grandes porque no puede percibir la forma completa. Por el contrario, si el campo es excesivamente amplio sin mantener la resolución, el modelo podría pasar por alto objetos pequeños. Para solucionar esto, los ingenieros suelen utilizar convoluciones dilatadas (también conocidas como convoluciones atrous) para ampliar el campo receptivo sin reducir la resolución espacial, una técnica fundamental para tareas de alta precisión como la segmentación semántica.
Aplicaciones en el mundo real#
Optimizar el campo receptivo es fundamental para el éxito de diversas soluciones de IA.
- Conducción autónoma: En la IA para el sector de la automoción, los sistemas de percepción deben seguir simultáneamente detalles minúsculos y obstáculos grandes. Un vehículo necesita un campo receptivo pequeño para identificar semáforos lejanos, y al mismo tiempo requiere un campo receptivo grande para comprender la trayectoria de un camión cercano o la curvatura del carril. Esta percepción multiescala garantiza una mayor seguridad de la IA y una mejor toma de decisiones.
- Diagnóstico médico: Al aplicar IA en sanidad, los radiólogos dependen de modelos capaces de detectar anomalías en las exploraciones. Para identificar tumores cerebrales, la red necesita un campo receptivo grande para comprender la simetría y la estructura generales del cerebro. Sin embargo, para detectar microcalcificaciones en mamografías, el modelo depende de capas iniciales con campos receptivos pequeños, sensibles a cambios sutiles en la textura.
Diferenciación de conceptos relacionados#
Para comprender plenamente el diseño de las redes, resulta útil diferenciar el campo receptivo de términos similares:
- Campo receptivo frente a kernel: El tamaño del kernel (o filtro) define las dimensiones de la ventana deslizante (por ejemplo, 3x3) para una única operación de convolución. El campo receptivo es una propiedad emergente que representa el área de entrada total acumulada que afecta a una neurona. Una pila de varios kernels 3x3 dará como resultado un campo receptivo mucho mayor que 3x3.
- Campo receptivo frente a mapa de características: Un mapa de características es el volumen de salida producido por una capa, que contiene las representaciones aprendidas. El campo receptivo describe la relación entre un único punto de ese mapa de características y la imagen de entrada original.
- Campo receptivo frente a ventana de contexto: Aunque ambos términos hacen referencia al alcance de los datos percibidos, «ventana de contexto» suele utilizarse en el procesamiento del lenguaje natural (NLP) o en el análisis de vídeo para denotar un intervalo temporal o secuencial (por ejemplo, el límite de tokens). El campo receptivo se refiere estrictamente al área espacial de datos dispuestos en cuadrícula, como las imágenes.
Uso práctico en código#
Los modelos de vanguardia, como el nuevo YOLO26, utilizan redes piramidales de características (FPN) para mantener campos receptivos eficaces para objetos de todos los tamaños. El siguiente ejemplo muestra cómo cargar un modelo y realizar detección de objetos, aprovechando automáticamente estas optimizaciones arquitectónicas internas. Los usuarios que quieran entrenar sus propios modelos con arquitecturas optimizadas pueden utilizar la Ultralytics Platform para gestionar conjuntos de datos y realizar entrenamientos en la nube sin complicaciones.
from ultralytics import YOLO
# Load the latest YOLO26 model with optimized multi-scale receptive fields
model = YOLO("yolo26n.pt")
# Run inference; the model aggregates features from various receptive field sizes
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results, detecting both large (bus) and small (person) objects
results[0].show()








