I 5 consigli principali per eseguire il deployment di YOLO26 in modo efficiente su edge e cloud
Scopri i 5 consigli pratici principali per eseguire il deployment di Ultralytics YOLO26 in modo efficiente su edge e cloud: dalla scelta del workflow e del formato di esportazione alla quantizzazione.

Il mese scorso, Ultralytics ha lanciato ufficialmente Ultralytics YOLO26, definendo un nuovo standard per l'IA per la visione, un ramo dell'intelligenza artificiale che consente alle macchine di interpretare e comprendere le informazioni visive contenute in immagini e video. Invece di limitarsi a registrare filmati, i modelli di visione artificiale come i modelli Ultralytics YOLO supportano attività di visione come il rilevamento di oggetti, la segmentazione di istanze, la stima della posa e la classificazione di immagini.
Progettato per gli ambienti in cui la visione artificiale viene effettivamente utilizzata, come dispositivi, telecamere, robot e sistemi di produzione, Ultralytics YOLO26 è un modello all'avanguardia che offre inferenza più rapida sull'unità di elaborazione centrale (CPU), distribuzione semplificata e prestazioni efficienti dall'inizio alla fine negli ambienti reali. I modelli YOLO26 sono stati progettati anche per facilitare il passaggio delle soluzioni di visione artificiale dalla sperimentazione alla produzione.

Fig. 1. Il modello nano YOLO26 offre un'inferenza su CPU fino al 43% più rapida rispetto a YOLO11. (Fonte)
La distribuzione di un modello comporta in genere diverse considerazioni, come la scelta dell'hardware giusto, del formato di esportazione appropriato, l'ottimizzazione delle prestazioni e la convalida dei risultati in condizioni reali. Grazie al pacchetto Python di Ultralytics, che semplifica l'addestramento, l'inferenza e l'esportazione dei modelli verso diverse piattaforme di distribuzione, seguire questi passaggi per distribuire YOLO26 è semplice.
Tuttavia, anche con flussi di lavoro semplificati, è fondamentale prendere le decisioni giuste per la distribuzione. In questo articolo vedremo cinque consigli pratici per distribuire Ultralytics YOLO26 in modo efficiente in ambienti edge e cloud, garantendo prestazioni affidabili e scalabili dell'IA per la visione in produzione. Iniziamo!
Che cos'è la distribuzione dei modelli nella visione artificiale?#
Prima di approfondire le strategie di distribuzione per Ultralytics YOLO26, facciamo un passo indietro e vediamo cosa si intende per distribuzione dei modelli nella visione artificiale.
La distribuzione di un modello è il processo che consiste nel trasferire un modello di deep learning addestrato da un ambiente di sviluppo a un'applicazione reale, dove può elaborare nuove immagini o flussi video e generare previsioni in modo continuo. Anziché eseguire esperimenti su dataset statici, il modello diventa parte di un sistema operativo.
Nella visione artificiale, spesso questo significa integrare il modello con telecamere, dispositivi edge AI, API o infrastrutture cloud. Il modello deve operare entro i limiti dell'hardware, rispettare i requisiti di latenza e mantenere prestazioni costanti in condizioni reali variabili.
Comprendere questo passaggio dalla sperimentazione alla produzione è fondamentale, perché le decisioni relative alla distribuzione influiscono direttamente sulle prestazioni del modello al di fuori di un laboratorio o di un ambiente sperimentale.
Comprendere i flussi di lavoro di distribuzione di Ultralytics YOLO26#
Ora vediamo in cosa consiste un flusso di lavoro tipico per la distribuzione di Ultralytics YOLO26. In breve, è la sequenza di passaggi che porta un'immagine dall'acquisizione all'analisi e alla generazione di una previsione.
In una configurazione tipica, una telecamera acquisisce un'immagine o un fotogramma video. I dati vengono quindi preelaborati, ad esempio ridimensionandoli o convertendoli nel formato corretto, prima di passarli a Ultralytics YOLO26 per l'inferenza.
Il modello analizza l'input e genera risultati come riquadri di delimitazione, maschere di segmentazione o punti chiave. Questi risultati possono quindi essere usati per attivare azioni, come inviare avvisi, aggiornare una dashboard o guidare un sistema robotico.
Il luogo in cui viene eseguito questo flusso di lavoro dipende dalla tua strategia di distribuzione. Ad esempio, con una distribuzione edge l'inferenza avviene direttamente sul dispositivo o vicino alla telecamera, contribuendo a ridurre la latenza e migliorare la privacy dei dati.
Con una distribuzione cloud, invece, le immagini o i fotogrammi video vengono inviati a server remoti per l'elaborazione, consentendo una maggiore scalabilità e una gestione centralizzata. Alcuni sistemi adottano un approccio ibrido, eseguendo elaborazioni leggere all'edge e carichi di lavoro più pesanti nel cloud.
Esplorare le varianti dei modelli Ultralytics YOLO26#
Per prendere decisioni consapevoli sulla distribuzione, è importante anche sapere che sono disponibili diverse varianti dei modelli Ultralytics YOLO26.
I modelli Ultralytics YOLO sono disponibili fin da subito in diverse dimensioni, per scegliere facilmente la versione più adatta alle tue esigenze di hardware e prestazioni. YOLO26 è disponibile in cinque varianti: Nano (n), Small (s), Medium (m), Large (l) ed Extra Large (x).
I modelli più piccoli, come YOLO26n, sono ottimizzati per l'efficienza e sono ideali per dispositivi edge, dispositivi Internet delle cose (IoT), sistemi embedded e sistemi basati su CPU, dove sono importanti la bassa latenza e i consumi ridotti. Offrono prestazioni elevate mantenendo al minimo l'uso delle risorse.
I modelli più grandi, come YOLO26l e YOLO26x, sono progettati per offrire una maggiore precisione e gestire scene più complesse. In genere, queste varianti offrono le prestazioni migliori sui sistemi dotati di unità di elaborazione grafica (GPUs) o negli ambienti cloud con maggiori risorse di calcolo.
La scelta della dimensione giusta del modello dipende dai tuoi obiettivi di distribuzione. Se le tue priorità sono la velocità e l'efficienza su hardware con risorse limitate, una variante più piccola potrebbe essere l'ideale. Se la tua applicazione richiede la massima precisione e hai accesso a hardware più potente, potrebbe essere preferibile un modello più grande.
Consigli per distribuire Ultralytics YOLO26 in modo efficiente#
Ora che abbiamo una visione più chiara delle varianti dei modelli Ultralytics YOLO26 e dei flussi di lavoro di distribuzione, vediamo alcuni consigli pratici per distribuire YOLO26 in modo efficiente negli ambienti edge e cloud.
Consiglio 1: valuta le opzioni di distribuzione del modello#
Una delle prime decisioni da prendere per distribuire Ultralytics YOLO26 riguarda l'ambiente in cui verrà eseguito il modello. L'ambiente di distribuzione influisce direttamente su prestazioni, latenza, privacy e scalabilità.
Inizia valutando il tuo flusso di lavoro. La tua applicazione richiede una latenza bassa, cioè previsioni generate quasi immediatamente dopo l'acquisizione di un'immagine?
Ad esempio, nella robotica o nei sistemi di sicurezza, anche piccoli ritardi possono incidere sulle prestazioni. In questi casi, una distribuzione edge è spesso la scelta migliore. Eseguire l'inferenza direttamente sul dispositivo o vicino alla telecamera riduce il tempo necessario per elaborare i dati ed evita di inviare le immagini su Internet, migliorando anche la privacy.
La distribuzione cloud, invece, offre maggiore scalabilità e potenza di calcolo. I server cloud possono elaborare grandi quantità di immagini, gestire più flussi video e supportare una velocità di elaborazione maggiore.
Ad esempio, in agricoltura un agricoltore potrebbe raccogliere migliaia di immagini di foglie e analizzarle in batch per determinare se le colture presentano segni di malattia. In questo scenario, potrebbero non servire prestazioni immediate in tempo reale, rendendo l'elaborazione cloud una scelta pratica e scalabile.

Fig. 2. Esempio di analisi di immagini di foglie con Ultralytics YOLO26
Tuttavia, l'invio dei dati a server remoti introduce latenza di rete, ovvero il ritardo causato dalla trasmissione delle immagini su Internet e dalla ricezione delle previsioni. Per le applicazioni in cui il fattore tempo non è critico, questo compromesso potrebbe essere accettabile.
Esistono anche soluzioni intermedie tra l'edge puro e il cloud puro. Alcune aziende utilizzano infrastrutture on-premise, situate vicino al luogo in cui vengono generati i dati. Altre creano pipeline ibride, applicando filtri leggeri all'edge e inviando al cloud i dati selezionati per un'analisi più approfondita.
La scelta dell'opzione di distribuzione più adatta dipende dai requisiti della tua applicazione. Definendo chiaramente le tue esigenze in termini di velocità, privacy e scalabilità, puoi scegliere una strategia che garantisca prestazioni affidabili di Ultralytics YOLO26 nelle condizioni reali.
Consiglio 2: scegli il formato di esportazione adatto al tuo hardware#
Dopo aver deciso dove eseguire il modello, il passaggio successivo consiste nello scegliere il formato di esportazione più adatto. Esportare un modello significa convertirlo dal formato usato durante l'addestramento a un formato ottimizzato per la distribuzione.
I modelli Ultralytics YOLO26 sono realizzati e addestrati nativamente in PyTorch, ma gli ambienti di produzione si affidano spesso a runtime specializzati, più adatti a specifici hardware. Questi runtime sono progettati per aumentare la velocità di inferenza, ridurre l'uso della memoria e garantire la compatibilità con il dispositivo di destinazione.
Convertire YOLO26 nel formato appropriato consente di eseguirlo in modo efficiente al di fuori dell'ambiente di addestramento. Il pacchetto Python di Ultralytics semplifica questo processo e supporta un'ampia gamma di integrazioni per creare e distribuire progetti di visione artificiale.
Se vuoi approfondire queste integrazioni, puoi consultare la documentazione ufficiale di Ultralytics. Include tutorial passo dopo passo, indicazioni specifiche per l'hardware ed esempi pratici per aiutarti a passare con sicurezza dallo sviluppo alla produzione.

Fig. 3. Ultralytics supporta diverse integrazioni (Fonte)
In particolare, il pacchetto Python di Ultralytics supporta l'esportazione di Ultralytics YOLO26 in diversi formati, pensati per varie piattaforme hardware. Ad esempio, il formato di esportazione ONNX garantisce la compatibilità multipiattaforma, quello TensorRT è ottimizzato per le GPU NVIDIA e i dispositivi edge NVIDIA Jetson, mentre il formato di esportazione OpenVINO è progettato per l'hardware Intel.
Alcuni dispositivi supportano più di un formato di esportazione, ma le prestazioni possono variare a seconda di quello scelto. Invece di selezionare un formato per abitudine, chiediti: quale opzione è più efficiente per il tuo dispositivo?
Un formato potrebbe offrire un'inferenza più rapida, mentre un altro potrebbe usare la memoria in modo più efficiente o integrarsi più facilmente nella pipeline esistente. Per questo è importante adattare il formato di esportazione al tuo hardware specifico e al tuo ambiente di distribuzione.
Dedicare del tempo a testare diverse opzioni di esportazione sul dispositivo di destinazione può fare una differenza notevole nelle prestazioni reali. Un formato di esportazione ben scelto contribuisce a garantire che Ultralytics YOLO26 funzioni in modo efficiente e affidabile, alla velocità richiesta dalla tua applicazione.
Suggerimento 3: chiediti se il tuo modello necessita di quantizzazione#
Dopo aver selezionato un formato di esportazione, è inoltre consigliabile valutare se quantizzare il modello.
La quantizzazione del modello riduce la precisione numerica dei pesi e dei calcoli di un modello, convertendoli in genere da virgola mobile a 32 bit a formati a precisione inferiore, come 16 o 8 bit. Questo aiuta a ridurre le dimensioni del modello e l’utilizzo della memoria e a migliorare la velocità di inferenza, soprattutto sui dispositivi edge o sui sistemi basati su CPU.
A seconda dell’hardware, del formato di esportazione e delle dipendenze di runtime, la quantizzazione può migliorare sensibilmente le prestazioni. Alcuni runtime sono ottimizzati per i modelli a precisione inferiore, consentendo loro di funzionare più velocemente e in modo più efficiente.
Tuttavia, se non viene applicata con attenzione, la quantizzazione può influire leggermente sulla precisione. Quando esegui la quantizzazione post-training, assicurati di passare le immagini di validazione. Queste immagini vengono utilizzate durante la calibrazione per aiutare il modello ad adattarsi alla precisione inferiore e a mantenere predizioni stabili.
Suggerimento 4: considera il data drift#
Anche il modello addestrato meglio può perdere prestazioni nel tempo a causa del data drift. Il data drift si verifica quando i dati che il modello incontra in produzione sono diversi da quelli su cui è stato addestrato.
In altre parole, il mondo reale cambia, ma il tuo modello no. Di conseguenza, la precisione può diminuire gradualmente.
Ad esempio, potresti addestrare il tuo modello Ultralytics YOLO26 con immagini acquisite di giorno. Se in seguito lo stesso modello viene utilizzato di notte, in condizioni di illuminazione diverse, le prestazioni potrebbero diminuire. Lo stesso problema può verificarsi con cambiamenti negli angoli di ripresa, nelle condizioni meteorologiche, negli sfondi o nell’aspetto degli oggetti.
Il data drift è comune nei sistemi di IA per la visione usati nel mondo reale. Gli ambienti raramente sono statici e anche piccoli cambiamenti possono influire sulla precisione del rilevamento. Per ridurre l’impatto del drift, puoi assicurarti che il dataset di addestramento rispecchi il più possibile le condizioni reali.
Includi immagini acquisite in diversi momenti della giornata, con condizioni di illuminazione diverse e in vari ambienti. Dopo la distribuzione, puoi continuare a monitorare le prestazioni e aggiornare o perfezionare il modello quando necessario.
Suggerimento 5: esegui benchmark in condizioni reali#
Prima di distribuire completamente il modello, puoi eseguire benchmark in condizioni reali.

Fig. 4. Uno sguardo al confronto delle prestazioni di YOLO26 con altri modelli (Fonte)
È comune testare le prestazioni in ambienti controllati, usando immagini campione o piccoli dataset. Tuttavia, i sistemi reali spesso si comportano in modo diverso. I limiti hardware, i ritardi di rete, i flussi video multipli e l’input continuo possono influire sulle prestazioni.
Il benchmarking consiste nel misurare le prestazioni del modello sul dispositivo e nella configurazione in cui verrà effettivamente eseguito. Include il controllo della velocità di inferenza, della latenza complessiva, dell’utilizzo della memoria e della stabilità del sistema. È importante testare non solo il modello in sé, ma l’intera pipeline, compresi il pre-processing e gli eventuali passaggi di post-processing.
Un modello può funzionare bene in un test su una singola immagine, ma avere difficoltà nell’elaborazione continua di video in diretta. Allo stesso modo, le prestazioni su una potente macchina di sviluppo potrebbero non rispecchiare il comportamento del modello su un dispositivo edge a basso consumo.
Eseguendo benchmark in condizioni realistiche, puoi individuare tempestivamente i colli di bottiglia e apportare modifiche prima della messa in produzione. Testare nello stesso ambiente in cui opererà Ultralytics YOLO26 aiuta a garantire prestazioni affidabili, stabili e coerenti in produzione.
Altri aspetti chiave da considerare per la distribuzione del modello#
Ecco alcuni altri fattori da tenere presenti quando distribuisci Ultralytics YOLO26:
- Monitoraggio e logging: configura strumenti di monitoraggio per tenere traccia di metriche come latenza, precisione e stato del sistema dopo la distribuzione.
- Sicurezza e privacy: implementa misure di protezione per tutelare i dati visivi sensibili, soprattutto quando utilizzi infrastrutture cloud o remote.
- Ottimizzazione dei colli di bottiglia della pipeline: valuta l’intera pipeline, inclusi moduli come pre-processing, inferenza, post-processing e trasferimento dei dati, poiché i ritardi possono verificarsi al di fuori del modello stesso.
- Pianificazione della scalabilità: pianifica in anticipo la crescita, assicurandoti che il sistema possa gestire un aumento del traffico, telecamere aggiuntive o carichi di lavoro più ampi.
Punti chiave#
Una distribuzione efficiente di YOLO26 parte dalla comprensione di dove verrà eseguito il modello e delle reali esigenze dell’applicazione. Scegliendo l’approccio di distribuzione giusto, abbinando il formato di esportazione all’hardware e testando le prestazioni in condizioni reali, puoi creare sistemi di IA per la visione affidabili e reattivi. Con la configurazione giusta, Ultralytics YOLO26 semplifica l’implementazione di soluzioni di visione artificiale veloci e pronte per la produzione, sia all’edge sia nel cloud.
Unisciti alla nostra community ed esplora il nostro repository GitHub. Dai un’occhiata alle nostre pagine dedicate alle soluzioni per scoprire diverse applicazioni, come l’AI in agricoltura e la visione artificiale in ambito sanitario. Scopri le nostre opzioni di licenza e inizia oggi a usare l’AI per la visione!









