Two-Stage Object Detectors
Esplora il funzionamento dei rilevatori di oggetti a due stadi, concentrandoti sulle proposte di regioni e sulla classificazione. Scopri perché i modelli moderni come Ultralytics YOLO26 sono ora all'avanguardia.
I rilevatori di oggetti a due stadi sono una classe sofisticata di architetture di apprendimento profondo (DL) utilizzate nella computer vision per identificare e localizzare gli elementi all'interno di un'immagine. A differenza dei loro equivalenti a uno stadio, che eseguono il rilevamento in un unico passaggio, questi modelli suddividono l'attività in due fasi distinte: proposta delle regioni e classificazione degli oggetti. Questo approccio biforcato è stato introdotto per dare priorità all'elevata accuratezza di localizzazione, rendendo questi rilevatori storicamente importanti nell'evoluzione dell'intelligenza artificiale (AI). Separando il "dove" dal "cosa", i rilevatori a due stadi raggiungono spesso una precisione superiore, in particolare sugli oggetti piccoli o occlusi, sebbene ciò comporti generalmente un maggiore impiego di risorse computazionali e una latenza di inferenza più elevata.
Il processo a due stadi#
L'architettura di un rilevatore a due stadi si basa su un flusso di lavoro sequenziale che imita il modo in cui una persona potrebbe esaminare attentamente una scena.
-
Proposta delle regioni: nella prima fase, il modello analizza l'immagine di input per identificare le potenziali aree in cui potrebbero trovarsi degli oggetti. Un componente noto come rete di proposta delle regioni (RPN) genera un insieme sparso di riquadri candidati, spesso chiamati Regioni di interesse (RoIs). Questa fase filtra la maggior parte dello sfondo, consentendo alla rete di concentrare la potenza di elaborazione sulle aree rilevanti.
-
Classificazione e perfezionamento: nella seconda fase, il modello estrae le caratteristiche da queste regioni candidate utilizzando reti neurali convoluzionali (CNN). Assegna quindi un'etichetta di classe specifica, ad esempio "persona" o "veicolo", a ciascuna regione e perfeziona le coordinate del riquadro di delimitazione per circoscrivere con precisione l'oggetto.
Esempi importanti di questa architettura includono la famiglia R-CNN, in particolare Faster R-CNN e Mask R-CNN, che per diversi anni hanno stabilito lo standard nei benchmark accademici.
Confronto con i rilevatori a uno stadio#
È utile distinguere i modelli a due stadi dai rilevatori di oggetti a uno stadio, come il rilevatore MultiBox a singolo scatto (SSD) e la serie Ultralytics YOLO. Mentre i modelli a due stadi danno priorità all'accuratezza elaborando separatamente le regioni, i modelli a uno stadio trattano il rilevamento come un singolo problema di regressione, mappando direttamente i pixel dell'immagine sulle coordinate dei riquadri di delimitazione e sulle probabilità delle classi.
Storicamente, ciò ha creato un compromesso: i modelli a due stadi erano più accurati ma più lenti, mentre quelli a uno stadio erano più veloci ma meno precisi. Tuttavia, i progressi moderni hanno reso meno netta questa distinzione. I modelli all'avanguardia, come YOLO26, utilizzano ora architetture end-to-end che competono con l'accuratezza dei rilevatori a due stadi, mantenendo al contempo la velocità necessaria per l'inferenza in tempo reale.
Applicazioni nel mondo reale#
Grazie alla loro enfasi su precisione e richiamo, i rilevatori a due stadi sono spesso preferiti negli scenari in cui la sicurezza e il livello di dettaglio sono più importanti della pura velocità di elaborazione.
- Diagnostica per immagini mediche: nel campo dell'AI nell'assistenza sanitaria, non riconoscere una diagnosi può avere conseguenze critiche. Le architetture a due stadi vengono utilizzate frequentemente nell'analisi di immagini mediche per rilevare anomalie come tumori nelle radiografie o nelle scansioni MRI. Il processo in più fasi contribuisce a garantire che le piccole lesioni non vengano trascurate su sfondi di tessuti complessi, fornendo ai radiologi un supporto automatizzato altamente affidabile.
- Ispezione industriale ad alta precisione: nella produzione intelligente, i sistemi automatizzati di ispezione visiva utilizzano questi modelli per identificare difetti microscopici sulle linee di assemblaggio. Ad esempio, rilevare una frattura capillare nella pala di una turbina richiede l'elevata accuratezza dell'Intersezione sull'unione (IoU) offerta dai rilevatori a due stadi, garantendo che solo i componenti impeccabili passino alla fase successiva della produzione.
Implementazione del rilevamento moderno#
Sebbene i rilevatori a due stadi abbiano gettato le basi per una computer vision ad alta accuratezza, gli sviluppatori moderni utilizzano spesso modelli avanzati a uno stadio che offrono prestazioni comparabili con flussi di lavoro di distribuzione significativamente più semplici. La piattaforma Ultralytics semplifica l'addestramento e la distribuzione di questi modelli, gestendo in modo efficiente i dataset e le risorse di calcolo.
Il seguente esempio in Python mostra come caricare ed eseguire l'inferenza utilizzando un moderno flusso di lavoro per il rilevamento degli oggetti con ultralytics, ottenendo risultati di elevata accuratezza simili a quelli degli approcci tradizionali a due stadi, ma con maggiore efficienza:
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores








