One-Stage Object Detectors
Esplora i detector di oggetti one-stage per un'AI in tempo reale ad alta velocità. Scopri come Ultralytics YOLO26 offre accuratezza ed efficienza di livello superiore per l'Edge AI e il deployment.
I rilevatori di oggetti a singolo stadio sono una potente classe di architetture di deep learning progettate per eseguire attività di rilevamento degli oggetti con velocità ed efficienza eccezionali. A differenza dei tradizionali rilevatori di oggetti a due stadi, che suddividono il processo di rilevamento in fasi separate per la proposta delle regioni e la successiva classificazione, i modelli a singolo stadio analizzano l'intera immagine in un'unica passata. Formulando il rilevamento come un problema di regressione diretta, queste reti prevedono simultaneamente le coordinate dei riquadri di delimitazione e le probabilità delle classi direttamente dai pixel di input. Questo approccio semplificato riduce significativamente il carico computazionale, rendendo i rilevatori a singolo stadio la scelta preferita per le applicazioni che richiedono inferenza in tempo reale e l'implementazione su dispositivi edge AI con risorse limitate.
Principi operativi fondamentali#
L'architettura di un rilevatore a singolo stadio si basa in genere su una rete neurale convoluzionale (CNN) che funge da backbone per l'estrazione delle caratteristiche. Quando un'immagine attraversa la rete, il modello genera una griglia di mappe delle caratteristiche che codificano informazioni spaziali e semantiche.
Le prime implementazioni, come il rilevatore MultiBox a singolo scatto (SSD), si basavano su anchor box predefiniti a varie scale per localizzare gli oggetti. Tuttavia, i progressi moderni, come Ultralytics YOLO11 e il modello YOLO26 all'avanguardia, si sono orientati in gran parte verso architetture prive di anchor. Queste architetture più recenti prevedono direttamente i centri e le dimensioni degli oggetti, eliminando la necessità di una complessa ottimizzazione degli iperparametri associata agli anchor. L'output finale è costituito da vettori di coordinate per la localizzazione e da un punteggio di confidenza che rappresenta il grado di certezza del modello riguardo all'oggetto rilevato.
Rilevatori a singolo stadio e a due stadi#
Distinguere tra queste due categorie principali aiuta a scegliere lo strumento giusto per un'attività specifica:
- Rilevatori di oggetti a singolo stadio: modelli come la serie Ultralytics YOLO danno priorità a una bassa latenza di inferenza. Sono ottimizzati per la velocità, il che li rende ideali per i flussi video e le applicazioni mobili. Le iterazioni recenti hanno ridotto significativamente il divario in termini di accuratezza, spesso raggiungendo o superando la precisione dei modelli più lenti, pur mantenendo prestazioni in tempo reale.
- Rilevatori di oggetti a due stadi: architetture come la famiglia R-CNN generano prima le proposte delle regioni e poi le classificano. Sebbene storicamente offrissero una maggiore precisione per gli oggetti piccoli o occlusi, comportano costi computazionali più elevati e sono generalmente più lente, limitandone l'uso negli scenari in cui il tempo è un fattore critico.
Applicazioni nel mondo reale#
L'efficienza dei rilevatori a singolo stadio ne ha favorito l'ampia adozione in diversi settori in cui una risposta immediata è fondamentale:
- Veicoli autonomi: le auto a guida autonoma richiedono l'elaborazione istantanea dei flussi video per identificare pedoni, segnali stradali e altri veicoli. I leader del settore si affidano a sistemi di visione ad alta velocità per navigare in sicurezza in ambienti complessi, spesso utilizzando il [tracciamento degli oggetti](https://ultralytics-translation-1.invalid insieme al rilevamento.
- Produzione intelligente: sulle linee di assemblaggio ad alta velocità, questi modelli eseguono il controllo qualità automatizzato rilevando difetti o verificando il posizionamento dei componenti in tempo reale. Ciò garantisce l'efficienza produttiva senza colli di bottiglia, spesso con l'integrazione tramite la Ultralytics Platform per una facile implementazione.
- Edge AI e IoT: la loro natura leggera rende i rilevatori a singolo stadio perfetti per dispositivi IoT come Raspberry Pi o NVIDIA Jetson, portando funzionalità avanzate di intelligenza a telecamere e droni remoti senza la necessità di una connettività costante al cloud.
Implementazione tecnica con Python#
L'implementazione di un rilevatore a singolo stadio è semplice utilizzando API moderne di alto livello. Per garantire risultati accurati, i modelli prevedono spesso più riquadri potenziali, che vengono poi filtrati usando tecniche come la soppressione non massima (NMS) in base alle soglie di intersezione su unione (IoU), sebbene i modelli end-to-end più recenti, come Ultralytics YOLO26, gestiscano questa procedura in modo nativo.
Il seguente esempio in Python mostra come caricare il modello YOLO26 all'avanguardia ed eseguire l'inferenza su un'immagine:
from ultralytics import YOLO
# Load the YOLO26 model, the latest natively end-to-end one-stage detector
model = YOLO("yolo26n.pt")
# Run inference on an image URL to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the first result with bounding boxes and labels
results[0].show()Vantaggi delle moderne architetture a singolo stadio#
L'evoluzione dei rilevatori a singolo stadio si è concentrata sul superamento del compromesso tra "accuratezza e velocità". Tecniche come Focal Loss sono state introdotte per affrontare lo squilibrio tra le classi durante l'addestramento, garantendo che il modello si concentri sugli esempi difficili da classificare anziché sullo sfondo abbondante. Inoltre, l'integrazione delle reti piramidali di caratteristiche (FPN) consente a questi modelli di rilevare efficacemente gli oggetti a scale diverse.
Oggi, ricercatori e sviluppatori possono addestrare facilmente queste architetture avanzate su dataset personalizzati utilizzando strumenti come la Ultralytics Platform, che semplifica il flusso di lavoro dall'annotazione dei dati all'implementazione del modello. Che si tratti di agricoltura o assistenza sanitaria, l'accessibilità dei rilevatori a singolo stadio sta democratizzando le potenti funzionalità di visione artificiale.









