Che cos’è l’overfitting nella computer vision e come prevenirlo?
Scopri cos’è l’overfitting nella computer vision e come prevenirlo utilizzando l’aumento dei dati, la regolarizzazione e i modelli pre-addestrati.

I modelli di computer vision sono progettati per riconoscere pattern, rilevare oggetti e analizzare immagini. Tuttavia, le loro prestazioni dipendono dalla capacità di generalizzare a dati non visti. La generalizzazione è la capacità del modello di funzionare bene su nuove immagini, non solo su quelle con cui è stato addestrato. Un problema comune nell'addestramento di questi modelli è il sovradattamento, in cui un modello apprende troppo dai dati di addestramento, incluso rumore non necessario, invece di identificare pattern significativi.
Quando accade, il modello funziona bene sui dati di addestramento, ma ha difficoltà con le nuove immagini. Ad esempio, un modello di rilevamento degli oggetti addestrato solo su immagini ad alta risoluzione e ben illuminate potrebbe fallire quando gli vengono presentate immagini sfocate o con ombre in condizioni reali. Il sovradattamento limita l'adattabilità di un modello, riducendone l'utilità in applicazioni del mondo reale come la guida autonoma, l'imaging medico e i sistemi di sicurezza.
In questo articolo analizzeremo cos'è il sovradattamento, perché si verifica e come prevenirlo. Vedremo anche come i modelli di computer vision come Ultralytics YOLO11 aiutano a ridurre il sovradattamento e a migliorare la generalizzazione.
Che cos'è il sovradattamento?#
Il sovradattamento si verifica quando un modello memorizza i dati di addestramento invece di apprendere pattern applicabili in generale a nuovi input. Il modello si concentra troppo sui dati di addestramento e ha quindi difficoltà con nuove immagini o situazioni che non ha mai visto prima.
Nella computer vision, il sovradattamento può influire su diverse attività. Un modello di classificazione addestrato solo su immagini luminose e nitide potrebbe avere difficoltà in condizioni di scarsa illuminazione. Un modello di rilevamento degli oggetti che apprende da immagini perfette potrebbe fallire in scene affollate o disordinate. Analogamente, un modello di segmentazione delle istanze può funzionare bene in ambienti controllati, ma avere problemi con le ombre o con oggetti sovrapposti.
Questo diventa un problema nelle applicazioni di AI del mondo reale, dove i modelli devono poter generalizzare oltre le condizioni di addestramento controllate. Per esempio, le auto a guida autonoma devono riuscire a rilevare i pedoni in condizioni diverse di illuminazione, meteo e ambiente. Un modello che presenta sovradattamento sul proprio set di addestramento non funzionerà in modo affidabile in scenari così imprevedibili.
Quando e perché si verifica il sovradattamento?#
Il sovradattamento si verifica solitamente a causa di dataset sbilanciati, di un'eccessiva complessità del modello e di un addestramento prolungato. Ecco le cause principali:
- Dati di addestramento limitati: i dataset di piccole dimensioni spingono i modelli a memorizzare i pattern invece di generalizzarli. Un modello addestrato su sole 50 immagini di uccelli potrebbe avere difficoltà a rilevare specie di uccelli al di fuori di quel dataset.
- Modelli complessi con troppi parametri: le reti profonde con un numero eccessivo di strati e neuroni tendono a memorizzare i dettagli più fini invece di concentrarsi sulle caratteristiche essenziali.
- Mancanza di aumento dei dati: senza trasformazioni come ritaglio, riflessione o rotazione, un modello potrebbe apprendere solo dalle immagini esatte usate per l'addestramento.
- Addestramento prolungato: se un modello analizza i dati di addestramento troppe volte, in cicli noti come epoche, memorizza i dettagli invece di apprendere pattern generali, diventando meno adattabile.
- Etichette incoerenti o rumorose: i dati etichettati in modo errato inducono il modello ad apprendere pattern sbagliati. Questo è comune nei dataset etichettati manualmente.
Un approccio equilibrato alla complessità del modello, alla qualità del dataset e alle tecniche di addestramento garantisce una migliore generalizzazione.
Sovradattamento e sottoadattamento#
Il sovradattamento e il sottoadattamento sono due problemi completamente opposti nel deep learning.

Fig. 1 Confronto tra sottoadattamento, apprendimento ottimale e sovradattamento nei modelli di computer vision.
Il sovradattamento si verifica quando un modello è troppo complesso e si concentra eccessivamente sui dati di addestramento. Invece di apprendere pattern generali, memorizza piccoli dettagli, persino quelli irrilevanti come il rumore di fondo. Di conseguenza, il modello funziona bene sui dati di addestramento, ma ha difficoltà con le nuove immagini: ciò significa che non ha realmente imparato a riconoscere pattern applicabili in situazioni diverse.
Il sottoadattamento si verifica quando un modello è troppo semplice e non coglie i pattern importanti nei dati. Può accadere quando il modello ha troppo pochi strati, quando il tempo di addestramento non è sufficiente o quando i dati sono limitati. Di conseguenza, non riesce a riconoscere i pattern importanti e produce previsioni inaccurate. Questo porta a prestazioni scarse sia sui dati di addestramento sia su quelli di test, perché il modello non ha appreso abbastanza per comprendere correttamente l'attività.
Un modello ben addestrato trova il giusto equilibrio tra complessità e generalizzazione. Deve essere abbastanza complesso da apprendere i pattern pertinenti, ma non così complesso da memorizzare i dati invece di riconoscere le relazioni sottostanti.
Come identificare il sovradattamento#
Ecco alcuni segnali che indicano che un modello presenta sovradattamento:
- Se l'accuratezza sull'addestramento è significativamente superiore a quella sulla validazione, è probabile che il modello presenti sovradattamento.
- Un divario crescente tra la perdita di addestramento e la perdita di validazione è un altro indicatore importante.
- Il modello è troppo sicuro di risposte errate, segno che ha memorizzato i dettagli invece di comprendere i pattern.
Per garantire che un modello generalizzi bene, è necessario testarlo su dataset diversificati che riflettano le condizioni del mondo reale.
Come prevenire il sovradattamento nella computer vision#
Il sovradattamento non è inevitabile e può essere prevenuto. Con le tecniche giuste, i modelli di computer vision possono apprendere pattern generali invece di memorizzare i dati di addestramento, diventando più affidabili nelle applicazioni del mondo reale.
Ecco cinque strategie chiave per prevenire il sovradattamento nella computer vision.
Aumentare la diversità dei dati con l'aumento dei dati e i dati sintetici#
Il modo migliore per aiutare un modello a funzionare bene su nuovi dati consiste nell'ampliare il dataset usando l'aumento dei dati e i dati sintetici. I dati sintetici sono generati dal computer invece di essere raccolti da immagini del mondo reale. Aiutano a colmare le lacune quando non sono disponibili abbastanza dati reali.

Fig. 2 La combinazione di dati del mondo reale e dati sintetici riduce il sovradattamento e migliora l'accuratezza del rilevamento degli oggetti.
L'aumento dei dati modifica leggermente le immagini esistenti riflettendole, ruotandole, ritagliandole o regolando la luminosità, in modo che il modello non si limiti a memorizzare i dettagli, ma impari a riconoscere gli oggetti in situazioni diverse.
I dati sintetici sono utili quando è difficile ottenere immagini reali. Ad esempio, i modelli per auto a guida autonoma possono essere addestrati su scene stradali generate dal computer per imparare a rilevare gli oggetti in condizioni diverse di meteo e illuminazione. In questo modo il modello diventa più flessibile e affidabile senza aver bisogno di migliaia di immagini del mondo reale.
Ottimizzare la complessità e l'architettura del modello#
Una rete neurale profonda, ovvero un tipo di modello di machine learning con molti strati che elaborano i dati invece di un singolo strato, non è sempre migliore. Quando un modello ha troppi strati o parametri, memorizza i dati di addestramento invece di riconoscere pattern più ampi. Ridurre la complessità non necessaria può aiutare a prevenire il sovradattamento.
A questo scopo, un approccio consiste nel pruning, che rimuove neuroni e connessioni ridondanti, rendendo il modello più snello ed efficiente.
Un altro consiste nel semplificare l'architettura riducendo il numero di strati o neuroni. I modelli pre-addestrati come Ultralytics YOLO11 sono progettati per generalizzare bene tra diverse attività con un numero inferiore di parametri, risultando più resistenti al sovradattamento rispetto all'addestramento di un modello profondo da zero.
Trovare il giusto equilibrio tra profondità ed efficienza del modello lo aiuta ad apprendere pattern utili senza limitarsi a memorizzare i dati di addestramento.
Applicare tecniche di regolarizzazione#
Le tecniche di regolarizzazione impediscono ai modelli di diventare troppo dipendenti da caratteristiche specifiche dei dati di addestramento. Ecco alcune tecniche comunemente utilizzate:
- Dropout disattiva parti casuali del modello durante l'addestramento, affinché impari a riconoscere pattern diversi invece di dipendere eccessivamente da alcune caratteristiche.
- Decadimento dei pesi (regolarizzazione L2) scoraggia valori estremi dei pesi, mantenendo sotto controllo la complessità del modello.
- Normalizzazione dei batch contribuisce a stabilizzare l'addestramento, assicurando che il modello sia meno sensibile alle variazioni del dataset.
Queste tecniche aiutano a mantenere la flessibilità e l'adattabilità del modello, riducendo il rischio di sovradattamento e preservando l'accuratezza.
Monitorare l'addestramento con la validazione e l'arresto anticipato#
Per prevenire il sovradattamento, è importante monitorare il modo in cui il modello apprende e assicurarsi che generalizzi bene a nuovi dati. Ecco un paio di tecniche utili:
- Arresto anticipato: termina automaticamente l'addestramento quando il modello smette di migliorare, così non continua ad apprendere dettagli non necessari.
- Cross-validation: divide i dati in parti e addestra il modello su ciascuna di esse. Questo lo aiuta ad apprendere i pattern invece di memorizzare immagini specifiche.
Queste tecniche aiutano il modello a mantenere un equilibrio, così apprende abbastanza per essere accurato senza concentrarsi eccessivamente solo sui dati di addestramento.
Usare modelli pre-addestrati e migliorare l'etichettatura del dataset#
Invece di addestrare un modello da zero, usare modelli pre-addestrati come Ultralytics YOLO11 può ridurre il sovradattamento. YOLO11 è stato addestrato su dataset su larga scala, consentendogli di generalizzare bene in condizioni diverse.

Fig. 3 I modelli di computer vision pre-addestrati migliorano l'accuratezza e prevengono il sovradattamento.
Il fine-tuning di un modello pre-addestrato lo aiuta a conservare ciò che già conosce mentre apprende nuove attività, evitando che si limiti a memorizzare i dati di addestramento.
Inoltre, è essenziale garantire un'etichettatura di alta qualità del dataset. Dati etichettati erroneamente o sbilanciati possono indurre i modelli ad apprendere pattern errati. La pulizia dei dataset, la correzione delle immagini etichettate erroneamente e il bilanciamento delle classi migliorano l'accuratezza e riducono il rischio di sovradattamento. Un altro approccio efficace è l'addestramento avversario, in cui il modello viene esposto a esempi leggermente modificati o più difficili, progettati per metterne alla prova i limiti.
Punti chiave#
Il sovradattamento è un problema comune nella computer vision. Un modello potrebbe funzionare bene sui dati di addestramento, ma avere difficoltà con le immagini del mondo reale. Per evitarlo, tecniche come l'aumento dei dati, la regolarizzazione e l'uso di modelli pre-addestrati come Ultralytics YOLO11 aiutano a migliorare l'accuratezza e l'adattabilità.
Applicando questi metodi, i modelli di AI possono rimanere affidabili e funzionare bene in ambienti diversi. Con il miglioramento del deep learning, assicurarsi che i modelli generalizzino correttamente sarà fondamentale per il successo dell'AI nel mondo reale.
Unisciti alla nostra community in crescita! Esplora il nostro repository GitHub per saperne di più sull'AI. Vuoi iniziare i tuoi progetti di computer vision? Scopri le nostre opzioni di licenza. Scopri la vision AI nella guida autonoma e l'AI nell'assistenza sanitaria visitando le nostre pagine dedicate alle soluzioni!









