Receptive Field
Scopri come il campo ricettivo definisca ciò che una rete neurale vede. Impara come Ultralytics YOLO26 ottimizzi il contesto spaziale per rilevare efficacemente oggetti di ogni dimensione.
Nel campo della visione artificiale (CV) e del deep learning, il campo recettivo si riferisce alla regione specifica di un'immagine di input che un determinato neurone di una rete neurale (NN) "vede" o analizza. Concettualmente, funziona in modo simile al campo visivo dell'occhio umano o di un obiettivo fotografico. Determina la quantità di contesto spaziale che un modello può percepire a un determinato livello. Man mano che i dati avanzano attraverso una rete neurale convoluzionale (CNN), il campo recettivo in genere si espande, consentendo al sistema di passare dall'identificazione di dettagli locali e minuti, come bordi o angoli, alla comprensione di strutture complesse e globali, come interi oggetti o scene.
La meccanica dei campi recettivi#
Le dimensioni e la profondità del campo recettivo sono determinate dall'architettura della rete. Nei livelli iniziali, i neuroni hanno solitamente un campo recettivo ridotto e si concentrano su un piccolo gruppo di pixel per acquisire texture dettagliate. Man mano che la rete diventa più profonda, operazioni come i livelli di pooling e le convoluzioni con stride eseguono di fatto il sottocampionamento delle mappe delle caratteristiche. Questo processo consente ai neuroni dei livelli successivi di aggregare informazioni provenienti da una porzione molto più ampia dell'input originale.
Le architetture moderne, inclusa l'avanzata Ultralytics YOLO26, sono progettate per bilanciare meticolosamente questi campi. Se il campo recettivo è troppo ristretto, il modello potrebbe non riuscire a riconoscere gli oggetti grandi perché non è in grado di percepirne l'intera forma. Al contrario, se il campo è eccessivamente ampio senza mantenere la risoluzione, il modello potrebbe non rilevare gli oggetti piccoli. Per affrontare questo problema, gli ingegneri usano spesso le convoluzioni dilatate (note anche come convoluzioni atrous) per espandere il campo recettivo senza ridurre la risoluzione spaziale, una tecnica fondamentale per attività ad alta precisione come la segmentazione semantica.
Applicazioni nel mondo reale#
L'ottimizzazione del campo recettivo è fondamentale per il successo di diverse soluzioni di IA.
- Guida autonoma: nell'IA per il settore automobilistico, i sistemi di percezione devono monitorare simultaneamente dettagli minimi e ostacoli di grandi dimensioni. Un veicolo ha bisogno di un campo recettivo ridotto per identificare i semafori distanti, ma allo stesso tempo richiede un campo recettivo ampio per comprendere la traiettoria di un camion vicino o la curvatura della corsia stradale. Questa percezione a più scale garantisce una migliore sicurezza dell'IA e un processo decisionale più efficace.
- Diagnostica medica: quando si applica l'IA in ambito sanitario, i radiologi si affidano ai modelli per individuare anomalie nelle scansioni. Per identificare i tumori cerebrali, la rete richiede un campo recettivo ampio per comprendere la simmetria e la struttura complessive del cervello. Tuttavia, per rilevare le microcalcificazioni nelle mammografie, il modello si affida ai livelli iniziali con campi recettivi ridotti, sensibili a sottili variazioni della texture.
Distinzione tra concetti correlati#
Per comprendere appieno la progettazione delle reti, è utile distinguere il campo recettivo da termini simili:
- Campo recettivo vs. kernel: le dimensioni del kernel (o filtro) definiscono le dimensioni della finestra scorrevole (ad esempio, 3x3) per una singola operazione di convoluzione. Il campo recettivo è una proprietà emergente che rappresenta l'area totale dell'input accumulata e influente su un neurone. Una sequenza di più kernel 3x3 produce un campo recettivo molto più grande di 3x3.
- Campo recettivo vs. mappa delle caratteristiche: una mappa delle caratteristiche è il volume di output prodotto da un livello, contenente le rappresentazioni apprese. Il campo recettivo descrive la relazione tra un singolo punto di quella mappa delle caratteristiche e l'immagine di input originale.
- Campo recettivo vs. finestra di contesto: sebbene entrambi i termini si riferiscano all'ambito dei dati percepiti, "finestra di contesto" viene generalmente utilizzata nell'elaborazione del linguaggio naturale (NLP) o nell'analisi video per indicare un intervallo temporale o sequenziale (ad esempio, il limite di token). Il campo recettivo si riferisce strettamente all'area spaziale nei dati organizzati su una griglia (immagini).
Utilizzo pratico nel codice#
I modelli all'avanguardia, come il più recente YOLO26, utilizzano le reti piramidali delle caratteristiche (FPN) per mantenere campi recettivi efficaci per oggetti di ogni dimensione. L'esempio seguente mostra come caricare un modello ed eseguire il rilevamento degli oggetti, sfruttando automaticamente queste ottimizzazioni architetturali interne. Se vuoi addestrare i tuoi modelli con architetture ottimizzate, puoi utilizzare la Ultralytics Platform per una gestione fluida dei dataset e l'addestramento nel cloud.
from ultralytics import YOLO
# Load the latest YOLO26 model with optimized multi-scale receptive fields
model = YOLO("yolo26n.pt")
# Run inference; the model aggregates features from various receptive field sizes
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results, detecting both large (bus) and small (person) objects
results[0].show()








