Le future tendenze del rilevamento degli oggetti: 7 aspetti chiave da tenere d’occhio
Scopri sette tendenze future nel rilevamento degli oggetti che stanno promuovendo i progressi nella computer vision e abilitando sistemi basati sull’AI più rapidi, intelligenti e affidabili.

I robotaxi percorrono ormai le strade di San Francisco e le persone sono passate dal cercare risposte online al chattare con l'AI nelle loro attività quotidiane. Questi cambiamenti evidenziano chiaramente che l'intelligenza artificiale (AI) si sta evolvendo più rapidamente che mai e sta diventando parte della vita di tutti i giorni.
Ad esempio, uno degli ambiti che sta avanzando a un ritmo incredibile è la tecnologia della visione artificiale. Nota anche come vision AI, è un sottocampo dell'AI che si concentra sull'aiutare le macchine a interpretare e comprendere i dati visivi.
La visione artificiale è già presente ovunque, dalle casse automatiche ai droni che ispezionano le linee elettriche. Al centro di molti di questi sistemi c'è il rilevamento degli oggetti, un'attività fondamentale della visione artificiale che consente alle macchine di riconoscere e localizzare oggetti specifici all'interno di immagini e video.
Con l'accelerazione dell'adozione dell'AI, aumenta anche la domanda di sistemi di rilevamento degli oggetti veloci e precisi. I modelli di vision AI come Ultralytics YOLO11 e il prossimo Ultralytics YOLO26 sono stati sviluppati proprio con questo obiettivo, rendendo il rilevamento degli oggetti in tempo reale più affidabile e accessibile che mai.

Fig. 1. Un esempio di utilizzo di Ultralytics YOLO11 per il rilevamento degli oggetti.
Con questi rapidi progressi, il settore si sta evolvendo velocemente e diverse tendenze emergenti stanno definendo l'aspetto della prossima generazione di sistemi di rilevamento degli oggetti. In questo articolo esploreremo sette tendenze chiave che stanno definendo il futuro del rilevamento degli oggetti.
Come funziona il rilevamento degli oggetti#
Prima di analizzare le future tendenze del rilevamento degli oggetti, facciamo un passo indietro per capire cos'è, come funziona dietro le quinte e come si è sviluppato nel corso degli anni.
Il rilevamento degli oggetti è una componente fondamentale della visione artificiale che consente ai sistemi di AI di identificare ciò che è presente in un'immagine e determinare esattamente dove si trova ogni elemento. Per apprendere questa capacità, i modelli vengono addestrati su grandi dataset annotati che mostrano oggetti in condizioni molto diverse, ad esempio con angolazioni, illuminazione, dimensioni e disposizioni differenti.
Nel tempo, il modello apprende gli schemi e gli indizi visivi che distinguono un oggetto dall'altro. Una volta addestrati, i modelli di vision AI come Ultralytics YOLO possono analizzare un'intera immagine in un unico passaggio, tracciando istantaneamente i riquadri di delimitazione e assegnando le etichette. Questa velocità e precisione rendono il rilevamento degli oggetti così efficace nelle applicazioni del mondo reale.

Fig. 2. Rilevamento di una radiografia utilizzando un modello YOLO11. (Fonte)
Un caso d'uso reale del rilevamento degli oggetti#
Ad esempio, nell'analisi dei documenti, aziende come Prezent utilizzano il rilevamento degli oggetti per automatizzare la complessa attività di riprogettazione delle diapositive delle presentazioni. Tradizionalmente, questo processo richiedeva ore di modifiche manuali: individuare i titoli, riposizionare le caselle di testo, allineare le immagini e ricostruire i grafici, cercando al contempo di mantenere un layout ordinato e coerente.
Convertendo ogni diapositiva in un'immagine, i modelli Ultralytics YOLO possono rilevare titoli, caselle di testo, immagini e grafici preservando la struttura originale. In questo modo il sistema comprende con precisione come è disposto ogni elemento. Grazie a queste informazioni, l'intero processo di riprogettazione, un tempo lento e laborioso, può ora essere automatizzato in pochi secondi.
L'evoluzione del rilevamento degli oggetti nella visione artificiale#
Ecco una breve panoramica di come si è evoluto il rilevamento degli oggetti nel corso degli anni:
-
I primi anni (anni '60–'70): Le prime metodologie di rilevamento degli oggetti derivavano dall'elaborazione tradizionale delle immagini e spesso si basavano sul confronto con modelli. Con questo approccio, i computer confrontavano parti di un'immagine (pixel) con schemi di riferimento predefiniti, o modelli, per cercare somiglianze. Poiché questi modelli erano fissi e non potevano adattarsi ai cambiamenti, il metodo funzionava solo in condizioni ideali. Erano sufficienti piccole variazioni nell'illuminazione, nella scala, nella rotazione o nell'aspetto dell'oggetto per causarne il fallimento.
-
Rilevamento basato sulle caratteristiche (anni '90–2000): I ricercatori passarono poi all'idea delle caratteristiche progettate manualmente e dell'estrazione delle caratteristiche, in cui le persone definivano manualmente gli indizi visivi che un computer doveva cercare, come bordi, angoli, forme o variazioni di luminosità. Tecniche come le Haar Cascades (un metodo che ricerca semplici schemi visivi, spesso utilizzato per il rilevamento dei volti) e HOG (una tecnica che cattura la direzione dei bordi e dei contorni in un'immagine), spesso abbinate a classificatori SVM (un modello di machine learning che separa gli oggetti in categorie), resero il riconoscimento degli oggetti più accurato e veloce. Nonostante questi miglioramenti, i sistemi continuavano ad avere difficoltà a funzionare abbastanza rapidamente per l'uso in tempo reale.
-
La rivoluzione dei modelli di deep learning (anni 2010): Il deep learning e le reti neurali convoluzionali (CNNs), modelli progettati per apprendere schemi visivi analizzando le immagini in piccole regioni alla volta, ridefinirono il rilevamento degli oggetti. Modelli come R-CNN, Fast R-CNN e Faster R-CNN appresero gli schemi visivi direttamente da grandi quantità di dati. Questo portò a risultati altamente accurati, ma questi modelli continuavano a presentare problemi di latenza.
-
Rilevamento in tempo reale con YOLO (metà degli anni 2010): YOLO (guarda una sola volta) segnò una svolta importante nel rilevamento degli oggetti, prevedendo tutti i riquadri di delimitazione e le etichette delle classi in un unico passaggio attraverso la rete. Questo approccio unificato aumentò drasticamente la velocità di rilevamento e aprì la strada alle applicazioni in tempo reale. Nello stesso periodo, anche altri modelli a singolo passaggio come SSD (rilevatore a passaggio singolo) migliorarono le prestazioni eliminando i passaggi di proposta delle regioni, rendendo il rilevamento degli oggetti più rapido ed efficiente.
-
Progressi recenti (anni 2020): Grazie a importanti miglioramenti nella progettazione e nell'ottimizzazione dei modelli, gli anni 2020 hanno portato sistemi e framework di rilevamento degli oggetti all'avanguardia più veloci e accurati. Ultralytics YOLO11 ha introdotto miglioramenti architetturali che hanno aumentato la velocità di elaborazione, la precisione e le prestazioni complessive in tempo reale. Basandosi su questo slancio, il prossimo YOLO26 presenta un design ancora più efficiente e leggero, particolarmente adatto a un'ampia gamma di applicazioni pratiche.
7 tendenze nel rilevamento degli oggetti che plasmeranno il futuro#
Esploriamo ora sette tendenze emergenti nel rilevamento degli oggetti che stanno attirando l'attenzione e suscitando interesse nel settore della visione artificiale.
1. Attività di rilevamento degli oggetti più intelligenti con l'edge computing#
I controlli manuali tradizionali possono rallentare le linee di produzione e lasciare spazio a difetti non rilevati. Per affrontare questo problema, molte aziende si stanno affidando a sistemi di controllo qualità basati sull'AI e supportati dal rilevamento degli oggetti.
Gli studi dimostrano infatti che l'ispezione visiva basata sull'AI può aumentare significativamente la produttività, in alcuni casi fino al 50%, e incrementare i tassi di rilevamento dei difetti fino al 90% rispetto all'ispezione manuale. È interessante notare che la nuova tendenza che sta facendo parlare di sé in questo settore e in altre applicazioni di vision AI riguarda il fatto che questa analisi avviene ora direttamente sui dispositivi stessi tramite l'edge computing.
Con l'edge computing, l'intelligenza si avvicina al punto in cui i dati vengono acquisiti. Telecamere e sensori possono eseguire localmente i modelli di rilevamento degli oggetti, identificando istantaneamente gli oggetti e determinandone la posizione senza affidarsi all'elaborazione nel cloud. Questo consente loro di analizzare i fotogrammi in tempo reale.
Inoltre, riduce i ritardi di rete, limita l'utilizzo della larghezza di banda e garantisce il funzionamento dei sistemi anche quando la connessione Internet è instabile o assente. In ambienti dinamici come quelli manifatturieri, questo passaggio all'elaborazione sul dispositivo offre risposte più rapide, operazioni più fluide e risultati molto più affidabili.
2. Diagnostica sanitaria basata sulla visione#
I medici spesso dedicano molto tempo all'analisi delle immagini mediche per assicurarsi che nulla venga trascurato. Oggi molti ospedali stanno iniziando a esplorare tecnologie all'avanguardia per il rilevamento degli oggetti, così da accelerare il processo. Questo riflette una tendenza più ampia nel settore sanitario, dove la vision AI viene sempre più utilizzata per favorire un rilevamento più precoce, diagnosi più rapide e un'analisi delle immagini più coerente.
Il rilevamento degli oggetti può essere utilizzato per evidenziare rapidamente le aree che potrebbero richiedere attenzione, migliorando il processo decisionale e gli esiti per i pazienti. Ad esempio, modelli come Ultralytics YOLO11 possono aiutare i medici a individuare i tumori cerebrali nelle scansioni MRI.

Fig. 3. Rilevamento e localizzazione dei tumori cerebrali nelle scansioni MRI con l'aiuto di Ultralytics YOLO11. (Fonte)
Poiché Ultralytics YOLO11 è in grado di riconoscere schemi sottili nelle scansioni MRI, può aiutare a identificare con maggiore precisione tumori piccoli o in fase iniziale. Sebbene la diagnosi finale spetti ai medici, strumenti come YOLO11 possono contribuire a rendere più efficiente la loro analisi, facendo emergere prima i possibili problemi e aiutando ad assicurarsi che nulla di importante venga trascurato.
3. Veicoli autonomi e visione in tempo reale per una mobilità più sicura#
Nelle strade trafficate delle città, le auto a guida autonoma si affidano a telecamere e sensori per monitorare continuamente l'ambiente circostante. Questi sistemi rilevano pedoni, veicoli, corsie e segnali stradali in tempo reale. Grazie alla visione artificiale e agli algoritmi di rilevamento degli oggetti, un'auto autonoma può interpretare ciò che accade intorno a sé e prendere decisioni di guida autonoma più sicure.
Nelle regioni caratterizzate da modelli di traffico diversificati e da una combinazione di veicoli, questi sistemi devono affrontare una complessità aggiuntiva. Ad esempio, uno studio recente ha valutato i modelli Ultralytics YOLOv8 su dati sul traffico raccolti a Hyderabad e Bangalore, dove diversi veicoli, tra cui automobili, autobus, motociclette, biciclette e autorickshaw, condividono la strada in modi dinamici e spesso imprevedibili.
I risultati hanno mostrato che Ultralytics YOLOv8 ha ottenuto prestazioni eccellenti in questi scenari complessi, rilevando con precisione un'ampia gamma di oggetti anche in condizioni di traffico intenso e non strutturato. Questo evidenzia una tendenza crescente nella mobilità autonoma: i modelli di vision AI sono sempre più capaci di gestire ambienti complessi e reali che un tempo rappresentavano importanti difficoltà per i sistemi automatizzati.
4. Automazione intelligente e robotica con la visione artificiale#
La manipolazione di piccoli oggetti, la selezione degli oggetti e dei materiali rilevati o la navigazione in spazi ingombri sono sempre state attività difficili per i robot. Questi compiti richiedono un rapido adattamento e movimenti precisi, aspetti con cui i sistemi di automazione tradizionali spesso faticano in ambienti imprevedibili.
Una tendenza in crescita nella robotica è l'utilizzo della vision AI per fornire ai robot la capacità di percepire e reagire all'ambiente circostante in tempo reale. Per esplorare questo cambiamento, un gruppo di ricercatori ha recentemente sviluppato un robot domestico in grado di riconoscere e selezionare gli oggetti mentre si muoveva in ambienti interni.
Utilizzando modelli come Ultralytics YOLO11 per il rilevamento degli oggetti, insieme a una telecamera di profondità e a una pinza flessibile, il robot è riuscito a identificare oggetti di forme e dimensioni diverse e a collocarli autonomamente nelle posizioni corrette. Questo esperimento dimostra come la combinazione della visione artificiale con i sistemi robotici possa migliorare la consapevolezza spaziale e la reattività.

Fig. 4. Un robot che utilizza Ultralytics YOLO11 e il rilevamento della profondità per prendere decisioni intelligenti. (Fonte)
Dimostra inoltre come le tecniche di AI all'avanguardia aiutino i robot ad adattarsi ad ambienti sconosciuti apprendendo dagli schemi visivi nel tempo. Grazie a questi progressi, i robot stanno diventando più capaci e maggiormente integrati nelle attività quotidiane, dall'assistenza domestica alla logistica di magazzino e al supporto sanitario.
5. Sistemi di sorveglianza e sicurezza proattivi#
I sistemi di sorveglianza intelligenti stanno adottando rapidamente l'intelligenza artificiale per individuare attività insolite o pericolose. Con i modelli di rilevamento degli oggetti, le telecamere possono riconoscere potenziali problemi in tempo reale e avvisare immediatamente i team di sicurezza, contribuendo a migliorare sia la prevenzione sia la risposta.
Ad esempio, negli stabilimenti produttivi in cui l'uso degli smartphone è limitato per motivi di sicurezza, i sistemi di AI possono rilevare automaticamente i telefoni nel momento in cui compaiono e tracciarne i movimenti utilizzando YOLO e altri modelli di visione. Questo riflette una tendenza più ampia nel settore della sicurezza, dove la vision AI viene utilizzata per monitorare gli ambienti in modo più proattivo e reagire più rapidamente ai potenziali rischi.
Oltre al rilevamento, questi sistemi vengono sempre più combinati con altre tecnologie per creare una soluzione di sicurezza più completa. I dispositivi edge consentono di elaborare i filmati localmente, riducendo i ritardi e mantenendo prestazioni affidabili, mentre strumenti come i sistemi di controllo degli accessi o il riconoscimento facciale possono aggiungere un ulteriore livello di verifica. Insieme, queste tecnologie contribuiscono a creare reti di sorveglianza più intelligenti e connesse, capaci di reagire rapidamente ed efficacemente alle situazioni del mondo reale.
6. Realtà aumentata e rilevamento degli oggetti nella vita quotidiana#
Nei magazzini affollati e nei grandi spazi commerciali, i lavoratori spesso devono gestire molte attività contemporaneamente. La realtà aumentata è d'aiuto sovrapponendo indicazioni digitali direttamente al mondo reale. Quando vengono abbinati al rilevamento degli oggetti, i sistemi AR possono identificare gli articoli, monitorarne la posizione e visualizzare informazioni utili in tempo reale. Questo rende le attività quotidiane più semplici, rapide e intuitive per chi li utilizza.
Una tendenza in crescita in questo ambito è l'uso della vision AI per trasformare i dispositivi di uso quotidiano in assistenti intelligenti capaci di comprendere l'ambiente circostante. Con la continua integrazione di AR e rilevamento degli oggetti, i luoghi di lavoro stanno iniziando ad adottare strumenti immersivi che offrono una guida a mani libere e flussi di lavoro più efficienti.
Un buon esempio sono gli occhiali AR di Amazon basati sull'AI, attualmente in fase di sviluppo e test. Questi occhiali utilizzano il rilevamento degli oggetti e la classificazione delle immagini per riconoscere i pacchi, guidare i lavoratori lungo il percorso corretto e registrare la prova di consegna. In questo modo si crea un'esperienza più sicura e a mani libere, che aiuta i lavoratori a rimanere concentrati ed efficienti per tutta la giornata.
7. Dispositivi intelligenti basati sull'IoT per sistemi di visione in tempo reale#
I dispositivi intelligenti sono diventati sistemi capaci di vedere, comprendere e reagire all'ambiente circostante. L'Internet delle cose (IoT) guida questo cambiamento collegando telecamere, sensori, macchine e app intelligenti in reti che raccolgono ed elaborano i dati in tempo reale.
Quando l'IoT opera insieme al rilevamento degli oggetti e all'edge computing, i dispositivi possono interpretare le informazioni visive, individuare anomalie e reagire istantaneamente senza l'intervento umano. Questo crea sistemi adattivi ed efficienti che alimentano abitazioni, industrie e intere città intelligenti.
Ad esempio, uno studio recente ha mostrato come un sistema di protezione della fauna selvatica basato sull'IoT utilizzi Ultralytics YOLOv8 per rilevare gli animali che si avvicinano ai terreni agricoli. Una volta rilevati, il sistema utilizza un processo decisionale basato sull'AI per attivare sistemi di dissuasione delicati, come luci o suoni, allontanando gli animali in sicurezza. Questo aiuta a prevenire i danni alle colture e favorisce la pacifica convivenza con la fauna selvatica locale, dimostrando come l'IoT e la visione artificiale possano rendere l'agricoltura più sostenibile.
Altre tendenze interessanti nella vision AI#
Oltre a queste sette tendenze nel rilevamento degli oggetti, ecco alcuni sviluppi degni di nota che stanno plasmando il futuro della vision AI:
- La ricerca sull'apprendimento autosupervisionato: Nuovi metodi basati sul deep learning consentono ai modelli di apprendere caratteristiche visive utili da grandi insiemi di immagini non annotate, aiutando i sistemi di rilevamento degli oggetti a migliorare senza dipendere eccessivamente dalle annotazioni manuali.
- La diffusione del rilevamento degli oggetti basato sui Transformer: I Transformer stanno diventando sempre più comuni perché catturano le relazioni a lungo raggio all'interno delle immagini, offrendo ai modelli una migliore comprensione del contesto e aumentando la precisione del rilevamento.
- Integrazione del rilevamento e della misurazione della luce (LiDAR) per una percezione 3D più ricca: La combinazione di LiDAR con il rilevamento degli oggetti basato sulle telecamere fornisce informazioni precise sulla profondità, rafforzando la percezione 3D in applicazioni come la navigazione, la robotica e la guida autonoma.
Punti chiave#
Il rilevamento degli oggetti è andato ben oltre il semplice riconoscimento delle immagini e viene ora utilizzato per alimentare sistemi intelligenti capaci di prendere decisioni in tempo reale. Guardando al futuro, è probabile che i modelli raggiungano una precisione ancora maggiore e una comprensione più profonda del contesto, rendendo la vision AI ancora più affidabile e versatile in diversi settori. Con il continuo progresso di queste tecnologie, esse plasmeranno una nuova generazione di sistemi di visione artificiale più intelligenti e adattivi.
Vuoi saperne di più? Unisciti alla nostra community ed esplora il repository GitHub per entrare in contatto con altre persone che operano nel settore dell'AI. Visita le nostre pagine sulle soluzioni dedicate all'AI nella robotica e alla visione artificiale per l'agricoltura, ed esplora le nostre opzioni di licenza per iniziare oggi stesso a utilizzare la vision AI.









