L’AI generativa sta cambiando il futuro della computer vision
Scopri interessanti approfondimenti da una tavola rotonda al YOLO Vision 2024. Esplora come l’AI generativa sta plasmando il futuro dei modelli di Vision AI in tempo reale.

L’IA generativa è un ramo dell’intelligenza artificiale (AI) che crea nuovi contenuti, come immagini, testi o audio, apprendendo i pattern dai dati esistenti. Grazie ai recenti progressi, ora può essere utilizzata per produrre contenuti altamente realistici che spesso imitano la creatività umana.
Tuttavia, l’impatto dell’IA generativa va oltre la semplice creazione di contenuti. Mentre i modelli di computer vision in tempo reale come i modelli Ultralytics YOLO continuano a evolversi, l’IA generativa sta anche ridefinendo il modo in cui i dati visivi vengono elaborati e aumentati, aprendo la strada ad applicazioni innovative in scenari reali.
Questo nuovo cambiamento tecnologico è stato un argomento di conversazione interessante durante YOLO Vision 2024 (YV24), un evento ibrido annuale organizzato da Ultralytics. YV24 ha riunito appassionati di AI e leader del settore per discutere delle ultime innovazioni nella computer vision. L’evento si è concentrato sull’innovazione, sull’efficienza e sul futuro delle soluzioni di AI in tempo reale.
Uno dei momenti più importanti dell’evento è stata una tavola rotonda su YOLO nell’era dell’IA generativa. Alla tavola rotonda hanno partecipato Glenn Jocher, fondatore e CEO di Ultralytics, Jing Qiu, ingegnere senior di machine learning presso Ultralytics, e Ao Wang della Tsinghua University. Hanno esplorato il modo in cui l’IA generativa sta influenzando la computer vision e le sfide legate alla creazione di modelli di AI pratici.
In questo articolo ripercorreremo i principali spunti emersi dalla loro discussione e analizzeremo più da vicino come l’IA generativa stia trasformando la Vision AI.
Sviluppo dei modelli Ultralytics YOLO#
Oltre a Glenn Jocher, molti ingegneri qualificati hanno svolto un ruolo fondamentale nello sviluppo dei modelli Ultralytics YOLO. Uno di loro, Jing Qiu, ha raccontato il suo inizio inaspettato con YOLO. Ha spiegato che la sua passione per l’AI è iniziata durante gli anni universitari. Ha dedicato molto tempo a esplorare e conoscere questo settore. Jing Qiu ha ricordato come è entrato in contatto con Glenn Jocher su GitHub e ha iniziato a partecipare a vari progetti di AI.
Riprendendo quanto detto da Jing Qiu, Glenn Jocher ha descritto GitHub come "un modo incredibile per condividere: persone che non si sono mai incontrate si riuniscono per aiutarsi a vicenda, contribuendo al lavoro degli altri. È una grande community e un modo davvero fantastico per iniziare nel campo dell’AI."

Fig. 1. Glenn Jocher e Jing Qiu parlano sul palco di YV24.
L’interesse di Jing Qiu per l’AI e il suo lavoro su Ultralytics YOLOv5 hanno contribuito a perfezionare il modello. In seguito, ha svolto un ruolo fondamentale nello sviluppo di Ultralytics YOLOv8, che ha introdotto ulteriori miglioramenti. Ha descritto il tutto come un viaggio incredibile. Oggi Jing Qiu continua a migliorare e a lavorare su modelli come Ultralytics YOLO11.
YOLOv10: ottimizzato per le prestazioni nel mondo reale#
Partecipando da remoto dalla Cina alla tavola rotonda, Ao Wang si è presentato come dottorando. Inizialmente studiava ingegneria del software, ma la sua passione per l’AI lo ha portato a orientarsi verso la computer vision e il deep learning.
Ha incontrato per la prima volta il celebre modello YOLO mentre sperimentava diverse tecniche e modelli di AI. È rimasto colpito dalla sua velocità e accuratezza, che lo hanno spinto ad approfondire attività di computer vision come il rilevamento degli oggetti. Di recente, Ao Wang ha contribuito a YOLOv10, una versione recente del modello YOLO. La sua ricerca si è concentrata sull’ottimizzazione del modello per renderlo più veloce e accurato.
La differenza fondamentale tra l’IA generativa e la Vision AI#
La tavola rotonda è poi passata a discutere dell’IA generativa e Jing Qiu ha sottolineato che l’IA generativa e la Vision AI hanno scopi molto diversi. L’IA generativa crea o genera elementi come testi, immagini e video, mentre la Vision AI analizza ciò che esiste già, principalmente le immagini.
Glenn Jocher ha evidenziato che anche le dimensioni rappresentano una grande differenza. I modelli di IA generativa sono enormi e spesso contengono miliardi di parametri, ovvero impostazioni interne che aiutano il modello ad apprendere dai dati. I modelli di computer vision sono molto più piccoli. Ha detto: “Il modello YOLO più piccolo che abbiamo è circa mille volte più piccolo del più piccolo LLM [modello linguistico di grandi dimensioni]. Quindi, 3 milioni di parametri rispetto a tre miliardi.”

Fig. 2. La tavola rotonda sull’IA generativa e la Vision AI a YV24.
Jing Qiu ha aggiunto che anche i processi di addestramento e distribuzione dell’IA generativa e della computer vision sono molto diversi. L’IA generativa ha bisogno di server enormi e potenti per funzionare. Modelli come YOLO, invece, sono progettati per l’efficienza e possono essere addestrati e distribuiti su hardware standard. Questo rende i modelli Ultralytics YOLO più pratici per l’utilizzo nel mondo reale.
Sebbene siano diversi, questi due settori stanno iniziando a intrecciarsi. Glenn Jocher ha spiegato che l’IA generativa sta portando nuovi progressi nella Vision AI, rendendo i modelli più intelligenti ed efficienti.
L’impatto dell’IA generativa sulla computer vision#
L’IA generativa ha fatto rapidi progressi e queste innovazioni stanno influenzando molte altre aree dell’intelligenza artificiale, inclusa la computer vision. Vediamo ora alcuni interessanti spunti emersi dalla tavola rotonda su questo tema.
I progressi dell’hardware consentono innovazioni nell’AI#
All’inizio della tavola rotonda, Glenn Jocher ha spiegato che le idee del machine learning esistono da molto tempo, ma i computer non erano abbastanza potenti per renderle operative. Le idee sull’AI avevano bisogno di hardware più potente per diventare realtà.
La diffusione delle GPU (unità di elaborazione grafica) negli ultimi 20 anni, con le loro capacità di elaborazione parallela, ha cambiato tutto. Hanno reso l’addestramento dei modelli di AI molto più veloce ed efficiente, consentendo al deep learning di svilupparsi rapidamente.
Oggi, i chip per l’AI come le TPU (unità di elaborazione tensoriale) e le GPU ottimizzate consumano meno energia pur gestendo modelli più grandi e complessi. Questo ha reso l’AI più accessibile e utile nelle applicazioni del mondo reale.
Con ogni nuovo miglioramento dell’hardware, le applicazioni dell’IA generativa e della computer vision diventano più potenti. Questi progressi rendono l’AI in tempo reale più veloce ed efficiente, pronta per essere utilizzata in un numero maggiore di settori.
Come l’IA generativa sta plasmando i modelli di rilevamento degli oggetti#
Quando gli è stato chiesto in che modo l’IA generativa stia influenzando la computer vision, Jing Qiu ha detto che i transformer, modelli che aiutano l’AI a concentrarsi sulle parti più importanti di un’immagine, hanno cambiato il modo in cui l’AI comprende ed elabora le immagini. Il primo grande passo è stato DETR (Transformer per il rilevamento), che ha utilizzato questo nuovo approccio per il rilevamento degli oggetti. Ha migliorato l’accuratezza, ma presentava problemi di prestazioni che in alcuni casi lo rendevano più lento.
Per risolvere questo problema, i ricercatori hanno creato modelli ibridi come RT-DETR. Questi modelli combinano reti neurali convoluzionali (CNNs, modelli di deep learning che apprendono ed estraggono automaticamente le caratteristiche dalle immagini) e transformer, bilanciando velocità e accuratezza. Questo approccio sfrutta i vantaggi dei transformer e rende al contempo più veloce il rilevamento degli oggetti.
È interessante notare che YOLOv10 utilizza livelli di attenzione basati sui transformer, ovvero parti del modello che agiscono come un riflettore per evidenziare le aree più importanti di un’immagine ignorando i dettagli meno rilevanti, per aumentarne le prestazioni.
Ao Wang ha inoltre spiegato come l’IA generativa stia cambiando il modo in cui vengono addestrati i modelli. Tecniche come il masked image modeling aiutano l’AI ad apprendere dalle immagini in modo più efficiente, riducendo la necessità di grandi dataset annotati manualmente. Questo rende l’addestramento della computer vision più veloce e meno dispendioso in termini di risorse.
Il futuro dell’IA generativa e della Vision AI#
Un’altra idea chiave discussa durante la tavola rotonda riguardava il modo in cui l’IA generativa e la Vision AI potrebbero unirsi per creare modelli più capaci. Glenn Jocher ha spiegato che, sebbene questi due approcci abbiano punti di forza diversi, combinarli potrebbe aprire nuove possibilità.
Ad esempio, i modelli di Vision AI come YOLO spesso suddividono un’immagine in una griglia per identificare gli oggetti. Questo metodo basato su una griglia potrebbe aiutare i modelli linguistici a migliorare la loro capacità sia di individuare i dettagli sia di descriverli, una sfida che molti modelli linguistici affrontano oggi. In sostanza, la combinazione di queste tecniche potrebbe portare a sistemi in grado di rilevare con precisione e spiegare chiaramente ciò che vedono.

Fig. 3. Il futuro dell’IA generativa e della Vision AI. Immagine dell’autore.
Punti chiave#
L’IA generativa e la computer vision stanno progredendo insieme. Sebbene l’IA generativa crei immagini e video, migliora anche l’analisi di immagini e video introducendo nuove idee innovative che potrebbero rendere i modelli di Vision AI più accurati ed efficienti.
In questa stimolante tavola rotonda di YV24, Glenn Jocher, Jing Qiu e Ao Wang hanno condiviso le loro opinioni su come queste tecnologie stiano plasmando il futuro. Con hardware per l’AI migliore, l’IA generativa e la Vision AI continueranno a evolversi, portando a innovazioni ancora più grandi. Questi due settori stanno collaborando per creare un’AI più intelligente, veloce e utile nella vita quotidiana.
Unisciti alla nostra community ed esplora il nostro repository GitHub per saperne di più sulla Vision AI. Scopri le nostre opzioni di licenza per avviare i tuoi progetti di computer vision. Ti interessano innovazioni come l’AI nella produzione o la computer vision nei veicoli a guida autonoma? Visita le nostre pagine dedicate alle soluzioni per saperne di più.









