YOLO Vision 2026:
Torna al glossario Ultralytics

Computer Vision (CV)

Scopri come la computer vision consente alle macchine di interpretare immagini e video. Impara i compiti principali, le applicazioni industriali e come iniziare con Ultralytics YOLO.

La visione artificiale (CV) è il campo dell'intelligenza artificiale (AI) che consente a computer e sistemi di ricavare informazioni significative da immagini digitali, video e altri input visivi. Se l'intelligenza artificiale permette alle macchine di pensare, la visione artificiale permette loro di vedere, osservare e comprendere. A differenza degli strumenti di elaborazione delle immagini basati su regole, i sistemi moderni apprendono direttamente dai dati: non viene mai detto esplicitamente cosa sia un'automobile o un tumore, ma identificano invece i modelli sottostanti attraverso migliaia di esempi etichettati e generalizzano tale conoscenza a immagini mai incontrate prima. Applicando l'apprendimento automatico (ML) e il deep learning (DL), la visione artificiale trasforma dati visivi non strutturati in decisioni su cui il software può agire.

Come funziona la Computer Vision#

Un computer vede un'immagine come una matrice di valori numerici che rappresentano i pixel. La trasformazione di tale matrice in un'azione segue una pipeline in cinque fasi.

Le cinque fasi di una pipeline di visione artificiale: acquisizione delle immagini, pre-elaborazione, estrazione delle caratteristiche, inferenza del modello e output o azione

Acquisizione delle immagini. Il flusso di lavoro inizia con l'hardware — sensori CMOS, telecamere a infrarossi o scanner LiDAR — che cattura la luce e la converte in una griglia di pixel digitali. La calibrazione della fotocamera tiene conto della geometria della lente prima che l'analisi abbia inizio.

Pre-elaborazione. I dati catturati vengono normalizzati affinché il modello riceva un input coerente: ridimensionamento, riduzione del rumore e regolazione del contrasto.

Estrazione delle caratteristiche. Il sistema identifica caratteristiche di basso livello come bordi, gradienti e angoli. Man mano che i dati si muovono più in profondità nella rete, queste primitive si combinano in caratteristiche di alto livello — texture, pattern e geometrie complesse. Un sistema potrebbe rilevare linee verticali, riconoscerle come pali di una recinzione, e quindi comprendere la scena come un confine perimetrale. Questo processo è noto come estrazione delle caratteristiche.

Inferenza del modello. Il motore della moderna visione artificiale è la rete neurale convoluzionale (CNN). A differenza di una rete neurale standard che tratta un'immagine come un elenco piatto di numeri, le CNN preservano la relazione spaziale tra i pixel, utilizzando filtri che scorrono sull'immagine per rilevare pattern indipendentemente da dove compaiono nel fotogramma. Più recentemente, i Vision Transformers (ViTs) sono emersi come una potente alternativa, applicando il meccanismo di attenzione proveniente dall'elaborazione del linguaggio naturale ai dati di immagine.

Output e azione. Il modello restituisce un risultato strutturato — un'etichetta, un insieme di bounding box o una maschera di pixel — su cui il sistema circostante agisce: rifiutando un pezzo difettoso, frenando un veicolo o attivando un avviso.

Come apprende un modello#

Un modello vale tanto quanto i dati che consuma. L'apprendimento supervisionato richiede grandi volumi di dati di addestramento, e benchmark come ImageNet e COCO forniscono milioni di esempi annotati. Durante l'addestramento il modello fa previsioni, confronta la sua previsione con l'etichetta di verità di fondo e regola i suoi pesi interni per ridurre l'errore. Una volta addestrato, quello stesso modello esegue la fase di inferenza sopra descritta.

Il passaggio dai sistemi basati su regole al deep learning#

Cronologia della visione artificiale dai sistemi basati su regole negli anni '60 attraverso l'apprendimento automatico e il deep learning fino ai transformer e ai modelli di fondazione

La prima visione artificiale dipendeva dall'ingegneria manuale delle caratteristiche: gli ingegneri definivano rigidi parametri geometrici per aiutare le macchine a riconoscere gli oggetti. Quei sistemi erano fragili, fallendo ogni volta che l'illuminazione cambiava o un oggetto appariva a un'angolazione sconosciuta. La pubblicazione nel 2012 di AlexNet, addestrato su oltre un milione di immagini ImageNet etichettate, ha segnato il punto di svolta dimostrando che le reti convoluzionali potevano superare gli approcci ingegnerizzati a mano su larga scala. Il deep learning ha sostituito le regole messe a punto manualmente con architetture che apprendono le proprie caratteristiche — abbastanza flessibili da resistere in condizioni del mondo reale che non sono mai perfettamente controllate.

Visione artificiale vs. Elaborazione delle immagini vs. Visione industriale#

È importante distinguere la visione artificiale dai campi adiacenti con cui viene regolarmente confusa.

  • L'elaborazione delle immagini manipola un'immagine per migliorarla o estrarre segnale: regolando luminosità, contrasto o applicando filtri. Il suo output è solitamente un'altra immagine. La visione artificiale prende un'immagine come input e produce un'interpretazione ("ci sono tre persone in questa stanza"). La visione artificiale utilizza regolarmente l'elaborazione delle immagini come fase di preparazione.
  • La visione industriale si riferisce a sistemi di ispezione industriale che operano in ambienti strettamente controllati con illuminazione fissa e posizioni dei pezzi note. La visione artificiale è la disciplina più ampia, creata per gestire condizioni imprevedibili e non controllate.
  • L'elaborazione del linguaggio naturale gestisce testo e parlato. La visione artificiale si concentra interamente sui dati visivi, sebbene i modelli di linguaggio visivo stiano sempre più unendo i due mondi.

Principali attività di visione artificiale#

La visione artificiale non è una singola funzione ma un insieme di attività distinte, ognuna delle quali risolve un problema diverso. Per una panoramica più approfondita di ciascuna, consulta la guida completa ai computer vision tasks.

Scelta dell'attività giusta#

Allineare l'attività tecnica con l'obiettivo aziendale fin dall'inizio evita costose rilavorazioni.

Obiettivo aziendaleAttività da utilizzare
Smistare i prodotti in categorieClassificazione immagini
Contare gli articoli o localizzare la loro posizioneObject detection
Analizzare la forma esatta o il confine di un oggettoInstance segmentation
Seguire il movimento attraverso i fotogrammi videoObject tracking
Misurare la posizione del corpo o gli angoli delle articolazioniPose estimation
Rilevare oggetti ruotati nelle immagini aereeBounding box orientati
Leggere il testo da documenti o etichetteRiconoscimento ottico dei caratteri

Applicazioni nel mondo reale#

La visione artificiale sostiene ora i sistemi di produzione nella maggior parte dei principali settori industriali.

Grafico che confronta l'adozione della visione artificiale nei vari settori, con la manifattura come segmento più grande davanti a sanità e vendita al dettaglio

  • Manifattura e controllo qualità. Le linee di produzione moderne funzionano più velocemente della capacità visiva umana. I sistemi di visione eseguono ispezioni di qualità istantanee, identificando micro-crepe o componenti disallineati alla velocità della linea senza la fatica che un ispettore umano accumula. Il monitoraggio dei modelli di usura sui macchinari consente inoltre la manutenzione predittiva, individuando le firme di guasto prima che un'interruzione causi tempi di inattività non pianificati. Vedi visione artificiale nella manifattura e rilevamento dei difetti.
  • Sanità e diagnostica. Gli algoritmi di analisi delle immagini mediche elaborano radiografie, risonanze magnetiche e TAC per rilevare tumori in fase precoce, micro-fratture e anomalie retiniche facili da perdere sotto pressione temporale. Nella sala operatoria, i sistemi di visione forniscono mappatura spaziale in tempo reale durante procedure minimamente invasive. Vedi visione artificiale nella sanità.
  • Vendita al dettaglio. I negozi senza casse utilizzano la fusione di sensori e algoritmi di visione per tracciare gli articoli che lasciano gli scaffali e fatturare automaticamente ai clienti. Gli stessi sistemi monitorano i livelli degli scaffali in tempo reale per attivare avvisi di riassortimento, supportando la gestione dell'inventario e la prevenzione delle perdite nella vendita al dettaglio. Vedi visione artificiale nella vendita al dettaglio.
  • Trasporti autonomi. Il livello di percezione è il componente più critico per la sicurezza di un'auto a guida autonoma. I sistemi di visione identificano segnaletica orizzontale, cartelli stradali, pedoni e altri veicoli in tempo reale, combinando l'input della telecamera con radar e LiDAR per costruire un modello a 360 gradi dell'ambiente circostante del veicolo attraverso il rilevamento di oggetti 3D. Vedi veicoli autonomi.
  • Sicurezza e monitoraggio. L'infrastruttura di sicurezza è passata dalla registrazione passiva all'intervento proattivo: rilevando lo stanziamento in zone ristrette, segnalando modelli di comportamento insoliti man mano che si verificano e supportando la gestione delle code negli spazi pubblici. Il rilevamento delle anomalie è la capacità sottostante.
  • Agricoltura. Droni e trattori valutano la salute delle colture a livello di singola pianta, analizzando immagini multispettrali per disidratazione, infestazione da parassiti o carenza di nutrienti. Acqua, pesticidi e fertilizzanti vengono quindi applicati solo dove necessario anziché su interi campi. Vedi visione artificiale in agricoltura.

Visione artificiale all'edge#

L'analisi visiva in tempo reale viene eseguita sempre più spesso all'edge — direttamente sulla telecamera o su un gateway locale — anziché instradare il video verso un server cloud centralizzato. Questo è importante per due motivi.

La latenza scende quasi a zero, il che è irrinunciabile per la robotica autonoma o l'ispezione di linee industriali dove un ritardo di pochi millisecondi produce errori. E poiché attraverso la rete viaggiano solo metadati anziché video grezzi, i requisiti di larghezza di banda diminuiscono drasticamente mentre la privacy migliora, poiché filmati sensibili non lasciano mai il dispositivo locale. Edge AI e inferenza in tempo reale rendono tutto ciò pratico, e opzioni di distribuzione dei modelli come ONNX e TensorRT consentono a un singolo modello addestrato di essere eseguito su hardware diversi.

Sfide e limitazioni#

Qualità dei dati. Un modello riflette la qualità dei suoi dati di addestramento. Dataset a bassa risoluzione, etichettati male o non rappresentativi producono modelli inaffidabili, e la costruzione di un dataset annotato diversificato richiede spesso più lavoro rispetto alla progettazione dell'algoritmo. Vedi etichettatura dei dati.

Variabili ambientali. Forti piogge, riflessi delle lenti, occlusione parziale e scala variabile degli oggetti degradano le prestazioni. I sistemi robusti si affidano all'aumento dei dati durante l'addestramento per simulare queste condizioni e costruire resilienza prima della distribuzione, e a un'attenta validazione per evitare l'overfitting.

Considerazioni etiche e bias. Un modello addestrato su un dataset privo di diversità demografica si comporterà in modo disomogeneo tra i gruppi di popolazione. Le organizzazioni che distribuiscono sistemi di analisi delle persone — nell'imaging medico, nella sicurezza sul lavoro o negli spazi pubblici — devono verificare l'equità dei propri dataset e conformarsi alle normative emergenti sul processo decisionale automatizzato.

Il futuro della visione artificiale#

I Vision Transformers stanno ridefinendo ciò che è realizzabile su attività che richiedono la comprensione delle relazioni tra parti distanti di un'immagine. Oltre a ciò, l'apprendimento multimodale combina dati visivi con testo, audio e profondità per costruire sistemi con una comprensione contestuale più ricca: i modelli di linguaggio visivo che rispondono a domande sulle immagini ne sono un primo esempio.

L'IA generativa sta affrontando direttamente la scarsità di dati. I dati sintetici rendono possibile creare immagini Iper-realistiche di scenari rari — modalità di guasto specifiche, presentazioni di malattie non comuni — che non possono essere raccolti in volume sufficiente nel mondo reale. Nel frattempo, le telecamere di rilevamento della profondità e il LiDAR stanno spingendo i sistemi oltre l'analisi di immagini bidimensionali verso il computing spaziale, dove le informazioni digitali vengono sovrapposte al mondo fisico per applicazioni come la manutenzione guidata da AR e la mappatura strutturale.

Implementazione della visione artificiale con Ultralytics#

Per i team che sperimentano un progetto di visione artificiale, Ultralytics YOLO26 rappresenta un punto di partenza pratico per il rilevamento degli oggetti in tempo reale: open-source, ampiamente documentato e abbastanza veloce da essere eseguito all'edge. I dati di accuratezza e latenza sui vari tipi di hardware sono pubblicati sulla pagina dei benchmark, con confronti tra modelli affiancati nella documentazione. L'ecosistema più ampio include OpenCV per l'elaborazione classica delle immagini e PyTorch come framework di addestramento primario.

from ultralytics import YOLO

# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")

# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
results[0].show()

Questo script utilizza un modello pre-addestrato per eseguire l'inferenza in poche righe. I team che passano da un progetto pilota alla produzione possono utilizzare la Piattaforma Ultralytics per annotare i dataset, addestrare modelli nel cloud e gestire la distribuzione, oppure applicare il transfer learning per adattare un modello pre-addestrato a un dataset personalizzato con molti meno dati etichettati rispetto all'addestramento da zero.

Domande frequenti#

Qual è la differenza tra visione artificiale e machine learning? Il machine learning è la disciplina più ampia che consiste nel costruire sistemi che apprendono dai dati. La visione artificiale è l'applicazione di tale disciplina — solitamente tramite deep learning — a input visivi come immagini e video. Quasi tutta la moderna visione artificiale è basata sul machine learning, ma il machine learning copre anche dati testuali, audio e tabulari.

La visione artificiale è la stessa cosa del riconoscimento delle immagini? No. Il riconoscimento delle immagini è un'attività all'interno della visione artificiale, ovvero l'identificazione di ciò che compare in un'immagine. La visione artificiale copre anche il rilevamento degli oggetti, la segmentazione, la stima della posa, il tracciamento e la comprensione della scena.

Quanti dati servono per addestrare un modello di computer vision? Dipende dalla complessità del task e dalla variabilità che il modello deve gestire. Il transfer learning da un modello pre-addestrato come Ultralytics YOLO26 riduce notevolmente il requisito e spesso è possibile addestrare rilevatori personalizzati utili con poche centinaia o migliaia di immagini etichettate per classe, anziché i milioni necessari per addestrare i modelli fondamentali.

La visione artificiale può funzionare senza una connessione a Internet? Sì. I modelli possono essere distribuiti direttamente su dispositivi edge ed eseguiti interamente offline, il che rappresenta la prassi standard laddove latenza, larghezza di banda o norme sulla privacy dei dati escludono l'invio di video al cloud.

Quale linguaggio di programmazione viene utilizzato per la visione artificiale? Python domina, grazie alla maturità del suo ecosistema: il pacchetto ultralytics, PyTorch e OpenCV. C++ viene utilizzato dove sono richieste le massime prestazioni di inferenza, tipicamente nei sistemi embedded e automobilistici.

Explore solutions

Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo viaggio con il futuro del machine learning