Two-Stage Object Detectors
Esplora le meccaniche dei rilevatori di oggetti a due stadi, concentrandoti sulle proposte di regione e sulla classificazione. Scopri perché modelli moderni come Ultralytics YOLO26 sono ora leader.
I rilevatori di oggetti a due stadi sono una classe sofisticata di architetture di deep learning (DL) utilizzate nella computer vision per identificare e localizzare elementi all'interno di un'immagine. A differenza delle loro controparti a stadio singolo, che eseguono il rilevamento in un unico passaggio, questi modelli dividono il compito in due fasi distinte: la proposta di regioni e la classificazione degli oggetti. Questo approccio biforcato è stato ideato per dare priorità all'elevata precisione di localizzazione, rendendo questi lettori storicamente significativi nell'evoluzione dell'intelligenza artificiale (AI). Separando il "dove" dal "cosa", i rilevatori a due stadi spesso ottengono una precisione superiore, in particolare su oggetti piccoli o occlusi, sebbene ciò avvenga tipicamente a costo di maggiori risorse computazionali e di una minore latenza di inferenza.
Il processo a due stadi#
L'architettura di un rilevatore a due stadi si basa su un flusso di lavoro sequenziale che imita il modo in cui un essere umano potrebbe esaminare attentamente una scena.
-
Proposta di regioni: Nella prima fase, il modello analizza l'immagine di input per identificare potenziali aree in cui potrebbero esistere oggetti. Un componente noto come Region Proposal Network (RPN) genera un insieme sparso di riquadri candidati, spesso definiti come Regioni di Interesse (RoIs). Questa fase filtra la maggior parte dello sfondo, consentendo alla rete di concentrare la potenza di elaborazione sulle aree rilevanti.
-
Classificazione e perfezionamento: Nella seconda fase, il modello estrae le caratteristiche da queste regioni candidate utilizzando Convolutional Neural Networks (CNNs). Assegna quindi un'etichetta di classe specifica (ad esempio, "persona", "veicolo") a ciascuna regione e perfeziona le coordinate del bounding box per racchiudere saldamente l'oggetto.
Esempi di spicco di questa architettura includono la famiglia R-CNN, in particolare Faster R-CNN e Mask R-CNN, che hanno stabilito lo standard per i benchmark accademici per diversi anni.
Confronto con i rilevatori a uno stadio#
È utile distinguere i modelli a due stadi dai rilevatori di oggetti a uno stadio come il Single Shot MultiBox Detector (SSD) e la serie Ultralytics YOLO. Mentre i modelli a due stadi danno priorità alla precisione elaborando le regioni separatamente, i modelli a stadio singolo inquadrano il rilevamento come un singolo problema di regressione, mappando i pixel dell'immagine direttamente sulle coordinate del bounding box e sulle probabilità di classe.
Storicamente, ciò ha creato un compromesso: i modelli a due stadi erano più accurati ma più lenti, mentre i modelli a stadio singolo erano più veloci ma meno precisi. Tuttavia, i moderni progressi hanno sfumato questa linea. Modelli all'avanguardia come YOLO26 utilizzano ora architetture end-to-end che rivaleggiano con la precisione dei rilevatori a due stadi, pur mantenendo la velocità necessaria per l'inferenza in tempo reale.
Applicazioni nel mondo reale#
A causa della loro enfasi su precisione e richiamo, i rilevatori a due stadi sono spesso preferiti in scenari in cui la sicurezza e i dettagli sono più critici della velocità di elaborazione grezza.
- Imaging diagnostico medico: Nel campo dell'IA nella sanità, mancare una diagnosi può essere fondamentale. Le architetture a due stadi vengono frequentemente utilizzate nell'analisi delle immagini mediche per rilevare anomalie come tumori nelle radiografie o nelle scansioni MRI. Il processo in più passaggi aiuta a garantire che le piccole lesioni non vengano trascurate su sfondi di tessuto complessi, fornendo ai radiologi un'assistenza automatizzata ad alta confidenza.
- Ispezione industriale ad alta precisione: Nella produzione intelligente, i sistemi di ispezione visiva automatizzati utilizzano questi modelli per identificare difetti microscopici sulle linee di assemblaggio. Ad esempio, il rilevamento di una frattura sottile in una pala di turbina richiede l'elevata precisione di Intersection over Union (IoU) fornita dai rilevatori a due stadi, garantendo che solo i componenti senza difetti procedano alla fase successiva della produzione.
Implementare il rilevamento moderno#
Mentre i rilevatori a due stadi hanno gettato le basi per la visione ad alta precisione, i moderni sviluppatori utilizzano spesso modelli avanzati a stadio singolo che offrono prestazioni comparabili con flussi di lavoro di distribuzione significativamente più semplici. La Ultralytics Platform semplifica l'addestramento e la distribuzione di questi modelli, gestendo in modo efficiente set di dati e risorse di calcolo.
Il seguente esempio in Python dimostra come caricare ed eseguire l'inferenza utilizzando un moderno flusso di lavoro di rilevamento degli oggetti con ultralytics, ottenendo risultati ad alta precisione simili ai tradizionali approcci a due stadi ma con maggiore efficienza:
from ultralytics import YOLO
# Load the YOLO26 model, a modern high-accuracy detector
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Process results (bounding boxes, classes, and confidence scores)
for result in results:
result.show() # Display the detection outcomes
print(result.boxes.conf) # Print confidence scores





