I principali momenti salienti di Ultralytics a YOLO Vision 2025 Shenzhen!
Ripercorri i momenti salienti di YOLO Vision 2025 Shenzhen, dove Ultralytics ha riunito innovatori, partner e la community dell'AI per una giornata all'insegna dell'ispirazione.

Il 26 ottobre, YOLO Vision 2025 (YV25) ha fatto il suo debutto in Cina presso l'edificio B10 dell'OCT Creative Culture Park di Shenzhen. L'evento ibrido di Ultralytics dedicato all'AI per la visione ha riunito oltre 200 partecipanti in presenza, mentre molti altri si sono collegati online tramite YouTube e Bilibili.
La diretta streaming di YV25 Shenzhen ha già superato le 3.500 visualizzazioni su YouTube e continua a suscitare interesse mentre i momenti salienti dell'evento vengono condivisi dalla community. È stata una giornata ricca di idee, conversazioni ed esplorazioni pratiche sulle prossime direzioni dell'AI per la visione.
La giornata è iniziata con il caloroso benvenuto della nostra presentatrice, Huang Xueying, che ha invitato tutti a entrare in contatto, imparare e partecipare alle discussioni durante l'evento. Ha spiegato che questo era il secondo YOLO Vision dell'anno, dopo l'edizione di Londra a settembre, e ha raccontato quanto fosse entusiasmante riunire nuovamente qui a Shenzhen la community dell'AI per la visione.
In questo articolo ripercorreremo i momenti salienti della giornata, compresi gli aggiornamenti sui modelli, le sessioni degli speaker, le demo dal vivo e i momenti di community che hanno riunito tutti. Iniziamo!
Il percorso dei modelli Ultralytics YOLO finora#
Il primo keynote della giornata è stato tenuto dal fondatore e CEO di Ultralytics Glenn Jocher, che ha raccontato come i modelli Ultralytics YOLO siano passati da una svolta nella ricerca ad alcuni dei modelli di AI per la visione più utilizzati al mondo. Glenn ha spiegato che il suo lavoro iniziale si concentrava sul rendere YOLO più semplice da usare.
Ha portato i modelli in PyTorch, migliorato la documentazione e condiviso tutto apertamente, così gli sviluppatori di tutto il mondo potessero costruirci sopra. Come ha ricordato, «Nel 2018 mi sono tuffato a capofitto. Ho deciso che questo sarebbe stato il mio futuro». Quello che era iniziato come uno sforzo personale è diventato rapidamente un movimento globale open source.

Fig. 1. Glenn Jocher parla sul palco di YOLO Vision 2025 Shenzhen.
Oggi, i modelli Ultralytics YOLO alimentano miliardi di inferenze ogni giorno e Glenn ha sottolineato che questa scala è stata possibile solo grazie alle persone che hanno contribuito a costruirli. Ricercatori, ingegneri, studenti, appassionati e collaboratori open source di tutto il mondo hanno plasmato YOLO trasformandolo in ciò che è oggi.
Come ha detto Glenn: «Ce ne sono quasi mille [collaboratori] là fuori e siamo davvero molto grati. Non saremmo qui, dove siamo oggi, senza queste persone».
Aggiornamenti su Ultralytics YOLO26#
Una prima occhiata a Ultralytics YOLO26 era stata condivisa all'inizio dell'anno durante l'evento YOLO Vision 2025 London, dove era stato presentato come il prossimo grande passo avanti nella famiglia di modelli Ultralytics YOLO. A YV25 Shenzhen, Glenn ha fornito un aggiornamento sui progressi compiuti da quell'annuncio e ha offerto alla community dell'AI uno sguardo più ravvicinato sull'evoluzione del modello.
Ultralytics YOLO26 è progettato per essere più piccolo, veloce e preciso, mantenendo al contempo la praticità necessaria per l'uso nel mondo reale. Glenn ha spiegato che il team ha trascorso l'ultimo anno a perfezionare l'architettura, valutare le prestazioni su diversi dispositivi e integrare gli insegnamenti della ricerca e i feedback della community. L'obiettivo è offrire prestazioni all'avanguardia senza rendere i modelli più difficili da distribuire.
Cosa aspettarsi da Ultralytics YOLO26#
Uno degli aggiornamenti principali evidenziati da Glenn è che Ultralytics YOLO26 è abbinato a una campagna dedicata di ottimizzazione degli iperparametri, passando dall'addestramento completamente da zero al fine-tuning su dataset più grandi. Ha spiegato che questo approccio è molto più allineato ai casi d'uso reali.
Ecco alcuni degli altri miglioramenti principali presentati durante l'evento:
- Architettura semplificata: il livello Distribution Focal Loss (DFL) è stato rimosso. Questo rende i modelli più semplici e veloci da eseguire, mantenendo lo stesso livello di accuratezza.
- Supporto all'inferenza end-to-end: Ultralytics YOLO26 è nativamente end-to-end, ovvero può funzionare senza un livello NMS separato. Questo rende molto più semplice l'esportazione in formati come ONNX e TensorRT e la distribuzione su hardware edge.
- Migliori prestazioni sugli oggetti piccoli: strategie di loss aggiornate aiutano il modello a rilevare gli oggetti minuscoli in modo più affidabile, una sfida di lunga data nella computer vision.
- Un nuovo ottimizzatore ibrido: YOLO26 include un nuovo ottimizzatore ispirato alle recenti ricerche sull'addestramento dei modelli linguistici di grandi dimensioni, che migliora l'accuratezza del modello ed è ora integrato direttamente nel pacchetto Python di Ultralytics.
Ultralytics YOLO26 è il prossimo passo verso un'AI per la visione pratica#
Nel complesso, questi aggiornamenti producono modelli fino al 43% più veloci su CPU e anche più precisi di Ultralytics YOLO11, rendendo YOLO26 particolarmente importante per dispositivi embedded, robotica e sistemi edge.
Ultralytics YOLO26 supporterà tutte le stesse attività e dimensioni dei modelli attualmente disponibili in YOLO11, per un totale di 25 varianti di modello nella famiglia. Sono inclusi modelli per il rilevamento, la segmentazione, la stima della posa, i bounding box orientati e la classificazione, dal formato nano fino all'extra large.
Il team sta inoltre lavorando a cinque varianti promptable. Si tratta di modelli in grado di ricevere un prompt testuale e restituire direttamente i bounding box, senza bisogno di addestramento.
È un primo passo verso workflow di visione più flessibili e basati su istruzioni, più semplici da adattare a diversi casi d'uso. I modelli Ultralytics YOLO26 sono ancora in fase di sviluppo attivo, ma i primi risultati sulle prestazioni sono promettenti e il team sta lavorando per rilasciarli presto.
Uno sguardo alla Ultralytics Platform#
Dopo l'aggiornamento su YOLO26, Glenn ha invitato Prateek Bhatnagar, il nostro Head of Product Engineering, a tenere una demo dal vivo della Ultralytics Platform. Questa piattaforma è progettata per riunire gli elementi principali del workflow di computer vision, tra cui l'esplorazione dei dataset, l'annotazione delle immagini, l'addestramento dei modelli e il confronto dei risultati.

Fig. 2. Prateek Bhatnagar presenta la Ultralytics Platform.
Prateek ha sottolineato che la piattaforma rimane fedele alle radici open source di Ultralytics, introducendo due spazi dedicati alla community: una community per i dataset e una per i progetti, dove gli sviluppatori possono contribuire, riutilizzare e migliorare il lavoro degli altri. Durante la demo, ha mostrato l'annotazione assistita dall'AI, il semplice addestramento sul cloud e la possibilità di eseguire il fine-tuning dei modelli direttamente dalla community, senza bisogno di risorse GPU locali.
La piattaforma è attualmente in fase di sviluppo. Prateek ha invitato il pubblico a restare aggiornato sugli annunci e ha osservato che il team sta crescendo in Cina per supportarne il lancio.
Le voci dietro YOLO: il panel degli autori#
Con la crescente partecipazione, l'evento è passato a una discussione panel con alcuni dei ricercatori che hanno sviluppato diversi modelli YOLO. Al panel hanno partecipato Glenn Jocher, Jing Qiu, il nostro Senior Machine Learning Engineer; Chen Hui, Machine Learning Engineer presso Meta e uno degli autori di YOLOv10; e Bo Zhang, Algorithm Strategist presso Meituan e uno degli autori di YOLOv6.

Fig. 3. Un panel sullo sviluppo dei modelli YOLO con Huang Xueying, Chen Hui, Bo Zhang, Jing Qiu e Glenn Jocher.
La discussione si è concentrata su come YOLO continui a evolversi attraverso l'uso nel mondo reale. Gli speaker hanno parlato di come i progressi siano spesso guidati dalle difficoltà della distribuzione pratica, come l'esecuzione efficiente sui dispositivi edge, il miglioramento del rilevamento degli oggetti piccoli e la semplificazione dell'esportazione dei modelli.
Invece di perseguire soltanto l'accuratezza, il panel ha sottolineato l'importanza di bilanciare velocità, facilità d'uso e affidabilità negli ambienti di produzione. Un altro insegnamento condiviso è stato il valore dell'iterazione e dei feedback della community.
Ecco altri spunti interessanti emersi dalla conversazione:
- Il rilevamento open-vocabulary sta prendendo piede nell'ecosistema YOLO: i modelli più recenti mostrano come l'allineamento visione-linguaggio e i workflow basati su prompt possano rilevare oggetti oltre le categorie predefinite.
- L'attenzione leggera è in crescita: il panel ha discusso di come l'uso di efficienti meccanismi di attenzione, anziché dell'attenzione completa ovunque, possa aumentare l'accuratezza mantenendo l'inferenza abbastanza leggera per i dispositivi edge.
- Iterare presto e spesso con la community: i partecipanti al panel hanno ribadito una mentalità costruisci–testa–migliora, in cui rilasciare prima i modelli e imparare dagli utenti porta a risultati migliori rispetto a lunghi cicli di sviluppo privati.
Le figure di riferimento che plasmano il futuro dell'AI e della visione#
Passiamo ora a esaminare più da vicino alcuni keynote di YV25 Shenzhen, in cui esponenti della community dell'AI hanno condiviso l'evoluzione dell'AI per la visione, dagli esseri umani digitali e la robotica al ragionamento multimodale e alla distribuzione efficiente sull'edge.
Insegnare all'AI a comprendere l'esperienza umana#
In una sessione ricca di spunti, il Dr. Peng Zhang dell'Alibaba Qwen Lab ha illustrato come il suo team stia sviluppando grandi modelli video in grado di generare esseri umani digitali espressivi, con movimenti e controllo più naturali. Ha presentato Wan S2V e Wan Animate, che utilizzano riferimenti audio o di movimento per produrre parlato, gesti e animazioni realistici, affrontando i limiti della generazione basata esclusivamente sul testo.

Fig. 4. Peng Zhang spiega come i grandi modelli video possano alimentare gli esseri umani digitali.
Il Dr. Zhang ha parlato anche dei progressi verso avatar interattivi in tempo reale, compreso il cloning zero-shot dell'aspetto e del movimento e di modelli leggeri in grado di animare un volto direttamente da un feed video live, avvicinando gli esseri umani digitali realistici alla possibilità di funzionare senza problemi sui dispositivi di uso quotidiano.
Dalla percezione all'azione: l'era dell'intelligenza incarnata#
Uno dei temi principali di YV25 Shenzhen è stato il passaggio da modelli di visione che si limitano a vedere il mondo a sistemi in grado di agire al suo interno. In altre parole, la percezione non è più la fine della pipeline, ma sta diventando l'inizio dell'azione.
Ad esempio, nel suo keynote, Hu Chunxu di D-Robotics ha descritto come i loro kit di sviluppo e le soluzioni SoC (sistema su chip) integrino rilevamento, controllo del movimento in tempo reale e processo decisionale in uno stack hardware e software unificato. Trattando percezione e azione come un ciclo di feedback continuo, anziché come fasi separate, il loro approccio supporta robot in grado di muoversi, adattarsi e interagire in modo più affidabile negli ambienti reali.

Fig. 5. La demo di D-Robotics a YOLO Vision 2025 a Shenzhen, Cina.
Alex Zhang di Baidu Paddle ha ripreso questa idea nel suo intervento, spiegando come YOLO e PaddleOCR collaborino per rilevare gli oggetti e poi interpretare il testo e la struttura che li circondano. Questo consente ai sistemi di trasformare immagini e documenti in informazioni utilizzabili e strutturate per attività come la logistica, le ispezioni e l'elaborazione automatizzata.
Intelligenza sull'edge: AI efficiente per ogni dispositivo#
Un altro tema interessante di YV25 Shenzhen è stato il modo in cui la Vision AI stia diventando più efficiente e capace sui dispositivi edge.
Paul Jung di DEEPX ha parlato della distribuzione dei modelli YOLO direttamente sull'hardware embedded, riducendo la dipendenza dal cloud. Concentrandosi sul basso consumo energetico, sull'inferenza ottimizzata e sul tuning dei modelli consapevole dell'hardware, DEEPX abilita la percezione in tempo reale per droni, robot mobili e sistemi industriali operanti in ambienti dinamici.
Analogamente, Liu Lingfei di Moore Threads ha illustrato come la piattaforma Moore Threads E300 integri l'elaborazione tramite unità centrale di elaborazione (CPU), unità di elaborazione grafica (GPU) e unità di elaborazione neurale (NPU) per offrire inferenza visiva ad alta velocità su dispositivi compatti.
La piattaforma può eseguire più stream YOLO a frame rate elevati e la sua toolchain semplifica operazioni come la quantizzazione, la compilazione statica e l'ottimizzazione delle prestazioni. Moore Threads ha inoltre reso open source un'ampia gamma di modelli di computer vision ed esempi di distribuzione per ridurre le barriere agli sviluppatori.
Unire visione e linguaggio per sistemi AI più intelligenti#
Fino a poco tempo fa, costruire un singolo modello in grado sia di comprendere le immagini sia di interpretare il linguaggio richiedeva grandi architetture transformer, costose da eseguire. A YV25 Shenzhen, Yue Ziyin di Yuanshi Intelligence ha presentato una panoramica di RWKV, un'architettura che combina le capacità di ragionamento su contesti lunghi dei Transformer con l'efficienza dei modelli ricorrenti.
Ha spiegato come Vision-RWKV applichi questo design alla computer vision elaborando le immagini in modo da scalare linearmente con la risoluzione. Questo la rende adatta agli input ad alta risoluzione e ai dispositivi edge con capacità di calcolo limitate.
Yue ha inoltre mostrato come RWKV venga utilizzato nei sistemi visione-linguaggio, dove le caratteristiche delle immagini vengono abbinate alla comprensione del testo per andare oltre il rilevamento degli oggetti e interpretare scene, documenti e contesti del mondo reale.

Fig. 6. Yue Ziyin parla delle applicazioni di RWKV.
Stand e demo dal vivo che hanno dato vita all'AI per la visione#
Mentre gli interventi sul palco guardavano al futuro dell'AI per la visione, gli stand sul piano espositivo mostravano come questa tecnologia venga già utilizzata oggi. I partecipanti hanno potuto vedere i modelli in esecuzione dal vivo, confrontare le opzioni hardware e parlare direttamente con i team che sviluppano questi sistemi.
Ecco una panoramica delle tecnologie esposte:
- Piattaforme per sviluppatori e prototipazione: Seeed, M5Stack e Infermove hanno presentato schede di sviluppo compatte e kit introduttivi che rendono semplice sperimentare con applicazioni basate su YOLO e passare rapidamente dalle idee a demo funzionanti.
- Hardware edge ad alte prestazioni: Hailo, DEEPX, Intel e Moore Threads hanno mostrato chip e moduli progettati per un'inferenza veloce ed efficiente.
- Workflow di visione e linguaggio: Baidu Paddle e RWKV hanno presentato stack software in grado di rilevare gli oggetti, nonché di leggere, interpretare e ragionare su ciò che appare in un'immagine o in un documento.
- Strumenti open source e per la community: Ultralytics e Datawhale hanno coinvolto gli sviluppatori con demo dal vivo dei modelli, consigli sull'addestramento e indicazioni pratiche, ribadendo come la condivisione delle conoscenze acceleri l'innovazione.

Fig. 7. Uno sguardo allo stand di M5Stack a YV25 Shenzhen.
Connettersi con la community dell'AI per la visione#
Oltre a tutte le tecnologie entusiasmanti, uno degli aspetti migliori di YV25 Shenzhen è stato riunire nuovamente di persona la community della computer vision e il team di Ultralytics. Durante la giornata, le persone si sono riunite intorno alle demo, hanno condiviso idee durante le pause caffè e hanno continuato a conversare a lungo dopo la fine degli interventi.
Ricercatori, ingegneri, studenti e sviluppatori hanno confrontato esperienze, posto domande e condiviso esperienze reali, dalla distribuzione all'addestramento dei modelli. E grazie a Cinco Jotas di Grupo Osborne, abbiamo portato all'evento anche un tocco di cultura spagnola con jamón tagliato al momento, creando un caldo momento di condivisione. Una location splendida, un pubblico entusiasta e un senso comune di slancio hanno reso la giornata davvero speciale.
Punti chiave#
Dai keynote ispiratori alle demo pratiche, YOLO Vision 2025 Shenzhen ha catturato lo spirito di innovazione che definisce la community di Ultralytics. Durante la giornata, speaker e partecipanti hanno scambiato idee, esplorato nuove tecnologie e condiviso una visione comune del futuro dell'AI. Insieme, hanno concluso la giornata pieni di energia e pronti per ciò che verrà con Ultralytics YOLO.
Reimmagina ciò che è possibile con l'AI e la computer vision. Unisciti alla nostra community e al nostro repository GitHub per scoprire di più. Scopri di più su applicazioni come la computer vision in agricoltura e l'AI nel retail. Esplora le nostre opzioni di licenza e inizia oggi stesso con la computer vision!









