Migliora la robustezza dei modelli AI con la data augmentation
Scopri come aggiungere variazioni realistiche ai dati di training tramite l'augmentation dei dati aiuta a migliorare la robustezza dei modelli AI e le prestazioni nel mondo reale.

Il testing è una parte fondamentale della realizzazione di qualsiasi soluzione tecnologica. Permette ai team di capire come funziona realmente un sistema prima della sua messa in produzione e di risolvere tempestivamente i problemi. Questo vale in molti ambiti, inclusa l'AI, dove ci si aspetta che i modelli gestiscano condizioni imprevedibili del mondo reale una volta distribuiti.
Ad esempio, la computer vision è un ramo dell'AI che insegna alle macchine a comprendere immagini e video. I modelli di computer vision come Ultralytics YOLO26 supportano attività come il rilevamento degli oggetti, la segmentazione delle istanze e la classificazione delle immagini.
Possono essere utilizzati in molti settori per applicazioni come il monitoraggio dei pazienti, l'analisi del traffico, il checkout automatizzato e il controllo qualità nella produzione. Tuttavia, anche con modelli avanzati e dati di training di alta qualità, le soluzioni di AI per la computer vision possono incontrare difficoltà quando affrontano variazioni del mondo reale, come cambiamenti nell'illuminazione, movimento o oggetti parzialmente ostruiti.
Questo accade perché i modelli apprendono dagli esempi forniti durante il training. Se non hanno già incontrato condizioni come riflessi, motion blur o visibilità parziale, è meno probabile che riconoscano correttamente gli oggetti in questi scenari.
Un modo per migliorare la robustezza dei modelli consiste nell'utilizzare la data augmentation. Invece di raccogliere grandi quantità di nuovi dati, gli ingegneri possono apportare modifiche piccole ma significative alle immagini esistenti, ad esempio regolando l'illuminazione, ritagliando o combinando le immagini. Questo aiuta il modello a imparare a riconoscere gli stessi oggetti in una gamma più ampia di situazioni.
In questo articolo esploreremo come la data augmentation migliori la robustezza dei modelli e l'affidabilità dei sistemi di AI per la computer vision quando vengono distribuiti al di fuori di ambienti controllati. Iniziamo!
Come verificare la robustezza di un modello#
Prima di approfondire la data augmentation, vediamo come capire se un modello di computer vision è davvero pronto per l'uso nel mondo reale.
Un modello robusto continua a funzionare bene anche quando cambiano le condizioni, invece di funzionare solo su immagini pulite e perfettamente annotate. Ecco alcuni fattori pratici da considerare quando si valuta la robustezza di un modello di AI:
- Cambiamenti nell'illuminazione: i modelli possono comportarsi diversamente se esposti a luce intensa, scarsa illuminazione, riflessi o ombre, fattori che possono influire sulla sicurezza con cui vengono rilevati gli oggetti.
- Occlusione parziale: nelle scene quotidiane, gli oggetti sono spesso coperti da altri elementi o sono visibili solo in parte. Un modello più robusto riesce a riconoscerli anche in presenza di informazioni visive mancanti.
- Scene affollate: gli ambienti con molti oggetti sovrapposti possono rendere più complesso il rilevamento. I modelli che funzionano bene in questi casi sono generalmente più affidabili in contesti complessi.
Buoni risultati su immagini pulite e acquisite perfettamente non si traducono sempre in prestazioni elevate nel mondo reale. Test regolari in condizioni diverse aiutano a mostrare quanto bene un modello riesca a mantenere le proprie prestazioni una volta distribuito.
Che cos'è la data augmentation?#
Il modo in cui un oggetto appare in una foto può cambiare a seconda dell'illuminazione, dell'angolazione, della distanza o dello sfondo. Quando si addestra un modello di computer vision, il dataset da cui apprende deve includere questo tipo di variazioni, così da poter funzionare bene in ambienti imprevedibili.
La data augmentation amplia un dataset di training creando esempi aggiuntivi a partire dalle immagini già disponibili. Questo avviene applicando modifiche intenzionali, come ruotare o capovolgere un'immagine, regolarne la luminosità o ritagliarne una parte.
Ad esempio, immagina di avere una sola foto di un gatto. Se ruoti l'immagine o ne modifichi la luminosità, puoi creare diverse nuove versioni a partire da quella singola foto. Ogni versione ha un aspetto leggermente diverso, ma rappresenta comunque lo stesso gatto. Queste variazioni aiutano a insegnare al modello che un oggetto può avere un aspetto diverso pur rimanendo lo stesso.

Fig. 1. Esempio di augmentation di un'immagine di un gatto (Fonte)
Come la data augmentation migliora le prestazioni dei modelli#
Durante il training del modello, la data augmentation può essere integrata direttamente nella pipeline di training. Invece di creare e archiviare manualmente nuove copie delle immagini, è possibile applicare trasformazioni casuali ogni volta che un'immagine viene caricata.
Questo significa che il modello vede una versione leggermente diversa dell'immagine ogni volta: più luminosa, capovolta o parzialmente nascosta. Tecniche come la cancellazione casuale possono persino rimuovere piccole aree dell'immagine per simulare situazioni del mondo reale in cui un oggetto è coperto o visibile solo in parte.

Fig. 2. Esempi di augmentation basata sulla cancellazione casuale (Fonte)
Vedere molte versioni diverse della stessa immagine permette al modello di imparare quali caratteristiche sono importanti, invece di dipendere da un unico esempio perfetto. Questa varietà rafforza la robustezza del modello di AI, consentendogli di funzionare in modo più affidabile in condizioni reali.
Tecniche comuni di data augmentation#
Ecco alcune tecniche di data augmentation utilizzate per introdurre variazioni nelle immagini di training:
- Trasformazioni geometriche: queste tecniche modificano la posizione e l'aspetto spaziale di un oggetto all'interno di un'immagine. Ruotare, capovolgere, ridimensionare, ritagliare o spostare un'immagine permette al modello di comprendere come un oggetto possa essere visto da angolazioni o distanze diverse.
- Regolazioni del colore e dell'illuminazione: l'illuminazione del mondo reale è raramente uniforme. Le immagini possono essere troppo luminose, troppo scure o presentare colori leggermente alterati, a seconda dell'ambiente o della fotocamera utilizzata. Regolare luminosità, contrasto, tonalità e saturazione permette ai modelli di gestire questi cambiamenti visivi e funzionare bene in scene diverse.
- Variazioni della qualità dell'immagine: il blur o il rumore visivo possono rendere le immagini poco nitide. Aggiungere blur o rumore durante il training aiuta il modello a gestire il motion blur, le immagini con scarsa illuminazione o i risultati di fotocamere di qualità inferiore, rendendolo meno sensibile agli elementi visivi imperfetti.
- Augmentation basata sull'occlusione: negli ambienti reali, gli oggetti sono spesso parzialmente coperti da altri oggetti. Questo fenomeno è definito occlusione dell'immagine. Nascondere o mascherare piccole aree di un'immagine durante il training aiuta il modello a imparare a rilevare gli oggetti anche quando solo una parte di essi è visibile.
- Augmentation multi-immagine: queste tecniche combinano parti di più immagini in un unico esempio di training, aumentando il numero di oggetti visibili e migliorando la capacità del modello di gestire scene complesse o affollate.

Fig. 3. Esempio di augmentation multi-immagine (Fonte)
Data augmentation semplificata con il pacchetto Python di Ultralytics#
La gestione dei dataset, la creazione di variazioni delle immagini e la scrittura del codice per le trasformazioni possono aggiungere passaggi alla realizzazione di un'applicazione di computer vision. Il pacchetto Python di Ultralytics semplifica questo processo fornendo un'unica interfaccia per addestrare, eseguire e distribuire i modelli Ultralytics YOLO, come YOLO26. Per semplificare i workflow di training, il pacchetto include funzionalità di data augmentation integrate, testate da Ultralytics e ottimizzate per i modelli YOLO.
Supporta inoltre integrazioni utili che eliminano la necessità di strumenti separati o codice personalizzato. In particolare, per la data augmentation, il pacchetto si integra con Albumentations, una libreria di uso comune per l'augmentation delle immagini. Questa integrazione consente di applicare automaticamente le augmentation durante il training, senza dover ricorrere a script aggiuntivi o codice personalizzato.
Gestione delle annotazioni e dei dataset sottoposti ad augmentation#
Un altro fattore che influisce sulla robustezza dei modelli è la qualità delle annotazioni. Etichette precise e corrette, create e gestite con strumenti di annotazione come Roboflow, aiutano il modello a capire dove si trovano gli oggetti e che aspetto hanno.
Durante il training, le augmentation dei dati come capovolgimenti, ritagli e rotazioni vengono applicate dinamicamente, mentre le annotazioni vengono adattate automaticamente per riflettere queste modifiche. Quando le etichette sono precise, questo processo funziona senza problemi e fornisce al modello molti esempi realistici della stessa scena.
Se le annotazioni sono imprecise o incoerenti, questi errori possono essere replicati nelle immagini sottoposte ad augmentation, rendendo il training meno efficace. Partire da annotazioni accurate impedisce la propagazione di questi errori e contribuisce a migliorare la robustezza del modello.
Migliorare le applicazioni di AI per la computer vision con la data augmentation#
Vediamo ora alcuni esempi di come la data augmentation contribuisca alla robustezza dei modelli di AI nelle applicazioni del mondo reale.
Aumentare la precisione del rilevamento degli oggetti in ambienti reali#
Le immagini sintetiche vengono spesso utilizzate per addestrare sistemi di rilevamento degli oggetti quando i dati reali sono limitati, sensibili o difficili da raccogliere. Consentono ai team di generare rapidamente esempi di prodotti, ambienti e angolazioni della fotocamera senza dover acquisire ogni scenario nella vita reale.
Tuttavia, i dataset sintetici possono talvolta apparire troppo puliti rispetto ai filmati del mondo reale, in cui l'illuminazione cambia, gli oggetti si sovrappongono e le scene includono elementi di disturbo sullo sfondo. La data augmentation aiuta a colmare questo divario introducendo variazioni realistiche, come diverse condizioni di illuminazione, rumore o posizionamento degli oggetti, affinché il modello impari a gestire i tipi di condizioni che incontrerà una volta distribuito.
Ad esempio, in uno studio recente, un modello Ultralytics YOLO11 è stato addestrato interamente su immagini sintetiche e la data augmentation è stata aggiunta per introdurre ulteriore varietà. Questo ha contribuito all'apprendimento di un riconoscimento più ampio degli oggetti da parte del modello. Il modello ha ottenuto buoni risultati quando è stato testato su immagini reali, nonostante non avesse mai visto dati del mondo reale durante il training.
Rendere più affidabili le soluzioni di imaging medico#
I dataset di imaging medico sono spesso limitati e le scansioni stesse possono variare in base al tipo di apparecchiatura, alle impostazioni di acquisizione o all'ambiente clinico. Le differenze nell'anatomia dei pazienti, nelle angolazioni, nell'illuminazione o nel rumore visivo possono rendere difficile per i modelli di computer vision apprendere pattern che si generalizzino bene tra pazienti e ospedali diversi.
La data augmentation aiuta ad affrontare questo problema creando molteplici variazioni della stessa scansione durante il training, ad esempio aggiungendo rumore, spostando leggermente l'immagine o applicando piccole distorsioni. Queste modifiche rendono i dati di training più rappresentativi delle condizioni cliniche reali.
Ad esempio, in uno studio di imaging pediatrico, i ricercatori hanno utilizzato Ultralytics YOLO11 per la segmentazione anatomica e lo hanno addestrato su dati medici sottoposti ad augmentation. Hanno introdotto variazioni come rumore aggiuntivo, lievi spostamenti di posizione e piccole distorsioni per rendere le immagini più realistiche.

Fig. 4. Immagini mediche pediatriche originali e sottoposte ad augmentation (Fonte)
Imparando da queste variazioni, il modello si è concentrato su caratteristiche anatomiche significative invece che su differenze superficiali. Questo ha reso più stabili i risultati della segmentazione tra scansioni e casi clinici diversi.
Punti chiave#
Raccogliere dati diversificati è difficile, ma la data augmentation permette ai modelli di apprendere da una gamma più ampia di condizioni visive. Ne deriva una maggiore robustezza del modello nella gestione di occlusioni, cambiamenti nell'illuminazione e scene affollate. Nel complesso, questo li aiuta a funzionare in modo più affidabile al di fuori degli ambienti di training controllati.
Unisciti alla nostra community ed esplora le ultime novità nella vision AI sul nostro repository GitHub. Visita le nostre pagine dedicate alle soluzioni per scoprire come applicazioni come l'AI nella produzione e la computer vision nel settore sanitario favoriscano il progresso, e consulta le nostre opzioni di licenza per dare impulso alla tua prossima soluzione di AI.









