L’evoluzione del rilevamento degli oggetti e dei modelli YOLO di Ultralytics
Scopri con noi l’evoluzione del rilevamento degli oggetti. Ci concentreremo su come i modelli YOLO (Guarda una sola volta) si sono evoluti negli ultimi anni.

La visione artificiale è un sottocampo dell'intelligenza artificiale (AI) che si concentra sull'insegnare alle macchine a vedere e comprendere immagini e video, in modo simile a come gli esseri umani percepiscono il mondo reale. Sebbene riconoscere gli oggetti o identificare le azioni sia naturale per gli esseri umani, quando si tratta di macchine questi compiti richiedono tecniche di visione artificiale specifiche e specializzate. Ad esempio, un'attività fondamentale della visione artificiale è il rilevamento degli oggetti, che consiste nell'identificare e localizzare gli oggetti all'interno di immagini o video.
Dagli anni '60, i ricercatori lavorano per migliorare la capacità dei computer di rilevare gli oggetti. I primi metodi, come il template matching, consistevano nello spostare un modello predefinito su un'immagine per trovare corrispondenze. Sebbene innovative, queste tecniche avevano difficoltà a gestire i cambiamenti nelle dimensioni e nell'orientamento degli oggetti e nelle condizioni di illuminazione. Oggi disponiamo di modelli avanzati come Ultralytics YOLO11, capaci di rilevare anche oggetti piccoli e parzialmente nascosti, noti come oggetti occlusi, con una precisione notevole.
Poiché la visione artificiale continua a evolversi, è importante ripercorrere lo sviluppo di queste tecnologie. In questo articolo esploreremo l'evoluzione del rilevamento degli oggetti e analizzeremo la trasformazione dei modelli YOLO (You Only Look Once). Cominciamo!
Le origini della visione artificiale#
Prima di approfondire il rilevamento degli oggetti, vediamo come è nata la visione artificiale. Le origini della visione artificiale risalgono alla fine degli anni '50 e all'inizio degli anni '60, quando gli scienziati iniziarono a studiare il modo in cui il cervello elabora le informazioni visive. In esperimenti sui gatti, i ricercatori David Hubel e Torsten Wiesel scoprirono che il cervello reagisce a schemi semplici come bordi e linee. Questa scoperta costituì la base dell'idea alla base dell'estrazione delle caratteristiche: i sistemi visivi rilevano e riconoscono caratteristiche di base nelle immagini, come i bordi, prima di passare a schemi più complessi.

Fig. 1 Imparare come il cervello di un gatto reagisce a barre luminose ha contribuito allo sviluppo dell'estrazione delle caratteristiche nella visione artificiale.
Nello stesso periodo emerse una nuova tecnologia in grado di trasformare le immagini fisiche in formati digitali, suscitando interesse per il modo in cui le macchine potevano elaborare le informazioni visive. Nel 1966, il progetto Summer Vision del Massachusetts Institute of Technology (MIT) portò avanti ulteriormente queste ricerche. Sebbene il progetto non abbia avuto un successo completo, mirava a creare un sistema in grado di separare il primo piano dallo sfondo nelle immagini. Per molti membri della comunità dell'AI per la visione, questo progetto segna l'inizio ufficiale della visione artificiale come campo scientifico.
La storia del rilevamento degli oggetti#
Con i progressi della visione artificiale tra la fine degli anni '90 e l'inizio degli anni 2000, i metodi di rilevamento degli oggetti passarono dalle tecniche di base, come il template matching, ad approcci più avanzati. Un metodo molto diffuso era Haar Cascade, utilizzato ampiamente per attività come il rilevamento dei volti. Funzionava analizzando le immagini con una finestra scorrevole, verificando caratteristiche specifiche come bordi o texture in ogni sezione dell'immagine e combinando poi queste caratteristiche per rilevare oggetti come i volti. Haar Cascade era molto più veloce dei metodi precedenti.

Fig. 2 Utilizzo di Haar Cascade per il rilevamento dei volti.
Parallelamente furono introdotti anche metodi come l'istogramma dei gradienti orientati (HOG) e le macchine a vettori di supporto (SVM). HOG utilizzava la tecnica della finestra scorrevole per analizzare i cambiamenti di luce e ombre in piccole sezioni di un'immagine, aiutando a identificare gli oggetti in base alla loro forma. Le SVM classificavano quindi queste caratteristiche per determinare l'identità dell'oggetto. Questi metodi miglioravano la precisione, ma continuavano ad avere difficoltà negli ambienti reali ed erano più lenti rispetto alle tecniche odierne.
La necessità del rilevamento degli oggetti in tempo reale#
Negli anni 2010, la diffusione del deep learning e delle reti neurali convoluzionali (CNN) portò a una svolta significativa nel rilevamento degli oggetti. Le CNN resero possibile per i computer apprendere automaticamente caratteristiche importanti da grandi quantità di dati, rendendo il rilevamento molto più preciso.
I primi modelli come R-CNN (reti neurali convoluzionali basate su regioni) rappresentarono un notevole miglioramento della precisione, aiutando a identificare gli oggetti in modo più accurato rispetto ai metodi precedenti.
Tuttavia, questi modelli erano lenti perché elaboravano le immagini in più fasi, rendendoli poco pratici per applicazioni in tempo reale in ambiti come le auto a guida autonoma o la videosorveglianza.
Per accelerare il processo furono sviluppati modelli più efficienti. Modelli come Fast R-CNN e Faster R-CNN contribuirono a questo obiettivo perfezionando il modo in cui venivano selezionate le regioni di interesse e riducendo il numero di passaggi necessari per il rilevamento. Sebbene ciò rendesse più veloce il rilevamento degli oggetti, non era ancora abbastanza rapido per molte applicazioni nel mondo reale che richiedevano risultati immediati. La crescente domanda di rilevamento in tempo reale spinse lo sviluppo di soluzioni ancora più rapide ed efficienti, capaci di bilanciare velocità e precisione.

Fig. 3. Confronto delle velocità di R-CNN, Fast R-CNN e Faster R-CNN.
I modelli YOLO (You Only Look Once): una pietra miliare#
YOLO è un modello di rilevamento degli oggetti che ha ridefinito la visione artificiale consentendo il rilevamento in tempo reale di più oggetti in immagini e video, distinguendosi nettamente dai metodi di rilevamento precedenti. Invece di analizzare ogni oggetto rilevato individualmente, l'architettura di YOLO tratta il rilevamento degli oggetti come un'unica attività, prevedendo in una sola volta sia la posizione sia la classe degli oggetti mediante CNN.
Il modello funziona dividendo un'immagine in una griglia, in cui ogni parte è responsabile del rilevamento degli oggetti nella propria area. Genera più previsioni per ogni sezione ed elimina i risultati meno affidabili, conservando solo quelli accurati.

Fig. 4 Panoramica del funzionamento di YOLO.
L'introduzione di YOLO nelle applicazioni di visione artificiale rese il rilevamento degli oggetti molto più rapido ed efficiente rispetto ai modelli precedenti. Grazie alla sua velocità e precisione, YOLO divenne rapidamente una scelta popolare per le soluzioni in tempo reale in settori come la produzione, la sanità e la robotica.
Un altro aspetto importante da sottolineare è che, essendo open source, YOLO consentiva a sviluppatori e ricercatori di migliorarlo continuamente, portando alla creazione di versioni ancora più avanzate.
Il percorso da YOLO a Ultralytics YOLO11#
I modelli YOLO sono migliorati costantemente nel tempo, basandosi sui progressi di ogni versione. Oltre a offrire prestazioni migliori, questi miglioramenti hanno reso i modelli più facili da usare per persone con diversi livelli di esperienza tecnica.
Ad esempio, con l'introduzione di Ultralytics YOLOv5, il deployment dei modelli è diventato più semplice con PyTorch, consentendo a una gamma più ampia di utenti di lavorare con l'AI avanzata. Ha riunito precisione e facilità d'uso, permettendo a più persone di implementare il rilevamento degli oggetti senza dover essere esperti di programmazione.

Fig. 5. L'evoluzione dei modelli YOLO.
Ultralytics YOLOv8 ha proseguito questo percorso aggiungendo il supporto per attività come la segmentazione delle istanze e rendendo i modelli più flessibili. È diventato più facile utilizzare YOLO sia per applicazioni di base sia per quelle più complesse, rendendolo utile in un'ampia varietà di scenari.
Con il modello più recente, Ultralytics YOLO11, sono state apportate ulteriori ottimizzazioni. Riducendo il numero di parametri e migliorando al contempo la precisione, ora è più efficiente per le attività in tempo reale. Che tu sia uno sviluppatore esperto o alle prime armi con l'AI, YOLO11 offre un approccio avanzato al rilevamento degli oggetti, facilmente accessibile.
Conoscere Ultralytics YOLO11: nuove funzionalità e miglioramenti#
YOLO11, lanciato durante l'evento ibrido annuale di Ultralytics, YOLO Vision 2024 (YV24), supporta le stesse attività di visione artificiale di YOLOv8, come il rilevamento degli oggetti, la segmentazione delle istanze, la classificazione delle immagini e la stima della posa. Gli utenti possono quindi passare facilmente a questo nuovo modello senza dover modificare i propri flussi di lavoro. Inoltre, l'architettura aggiornata di YOLO11 rende le previsioni ancora più precise. Infatti, YOLO11m raggiunge una precisione media media (mAP) superiore sul dataset COCO con il 22% di parametri in meno rispetto a YOLOv8m.
YOLO11 è inoltre progettato per funzionare in modo efficiente su una gamma di piattaforme, dagli smartphone e altri dispositivi edge ai sistemi cloud più potenti. Questa flessibilità garantisce prestazioni fluide su diverse configurazioni hardware per le applicazioni in tempo reale. Inoltre, YOLO11 è più rapido ed efficiente, riducendo i costi computazionali e velocizzando i tempi di inferenza. Che tu stia utilizzando il pacchetto Python di Ultralytics o Ultralytics HUB senza codice, integrare YOLO11 nei tuoi flussi di lavoro esistenti è semplice.
Il futuro dei modelli YOLO e del rilevamento degli oggetti#
L'impatto del rilevamento avanzato degli oggetti sulle applicazioni in tempo reale e sull'AI edge si fa già sentire in tutti i settori. Man mano che ambiti come petrolio e gas, sanità e commercio al dettaglio fanno sempre più affidamento sull'AI, la domanda di un rilevamento degli oggetti rapido e preciso continua a crescere. Ultralytics YOLO11 mira a soddisfare questa domanda consentendo un rilevamento ad alte prestazioni anche su dispositivi con potenza di calcolo limitata.
Con la crescita dell'AI edge, è probabile che i modelli di rilevamento degli oggetti come Ultralytics YOLO11 diventino ancora più essenziali per il processo decisionale in tempo reale negli ambienti in cui velocità e precisione sono fondamentali. Grazie ai continui miglioramenti nella progettazione e nell'adattabilità, il futuro del rilevamento degli oggetti sembra destinato a portare ulteriori innovazioni in un'ampia varietà di applicazioni.
Punti chiave#
Il rilevamento degli oggetti ha fatto molta strada, evolvendosi da metodi semplici alle avanzate tecniche di deep learning che vediamo oggi. I modelli YOLO sono stati al centro di questo progresso, offrendo un rilevamento in tempo reale più rapido e preciso in diversi settori. Ultralytics YOLO11 sviluppa questa eredità, migliorando l'efficienza, riducendo i costi computazionali e aumentando la precisione, diventando così una scelta affidabile per numerose applicazioni in tempo reale. Con i continui progressi nell'AI e nella visione artificiale, il futuro del rilevamento degli oggetti appare promettente, con ampi margini per ulteriori miglioramenti in termini di velocità, precisione e adattabilità.
Ti interessa l'AI? Rimani in contatto con la nostra community per continuare a imparare! Dai un'occhiata al nostro repository GitHub per scoprire come utilizziamo l'AI per creare soluzioni innovative in settori come la produzione e la sanità. 🚀









