Computer Vision (CV)
Esplora come la computer vision consente alle macchine di interpretare immagini e video. Scopri le attività principali, le applicazioni industriali e come iniziare con Ultralytics YOLO.
La computer vision (CV) è il campo dell'intelligenza artificiale (AI) che consente a computer e sistemi di ricavare informazioni significative da immagini digitali, video e altri input visivi. Se l'AI permette alle macchine di pensare, la computer vision consente loro di vedere, osservare e comprendere. A differenza degli strumenti di elaborazione delle immagini basati su regole, i sistemi moderni apprendono direttamente dai dati: non viene mai detto loro esplicitamente che aspetto abbia un'auto o un tumore, ma identificano i pattern sottostanti in migliaia di esempi etichettati e generalizzano questa conoscenza a immagini che non hanno mai incontrato. Applicando il machine learning (ML) e il deep learning (DL), la computer vision trasforma dati visivi non strutturati in decisioni su cui il software può agire.
Come funziona la computer vision#
Un computer vede un'immagine come un array di valori numerici che rappresentano i pixel. La trasformazione di questo array in un'azione segue una pipeline in cinque fasi.

Acquisizione dell'immagine. Il flusso di lavoro inizia con l'hardware — sensori CMOS, telecamere a infrarossi o scanner LiDAR — che cattura la luce e la converte in una griglia digitale di pixel. La calibrazione della telecamera tiene conto della geometria dell'obiettivo prima dell'inizio dell'analisi.
Pre-elaborazione. I dati acquisiti vengono normalizzati affinché il modello riceva un input coerente: ridimensionamento, riduzione del rumore e regolazione del contrasto.
Estrazione delle caratteristiche. Il sistema identifica caratteristiche di basso livello come bordi, gradienti e angoli. Man mano che i dati avanzano nella rete, questi elementi primitivi si combinano in caratteristiche di alto livello — trame, pattern e geometrie complesse. Un sistema potrebbe rilevare linee verticali, riconoscerle come pali di una recinzione e poi interpretare la scena come il confine di un perimetro. Questo processo è noto come estrazione delle caratteristiche.
Inferenza del modello. Il motore della computer vision moderna è la rete neurale convoluzionale (CNN). A differenza di una rete neurale standard, che tratta un'immagine come un elenco piatto di numeri, le CNN preservano la relazione spaziale tra i pixel, usando filtri che scorrono sull'immagine per rilevare pattern indipendentemente dalla loro posizione nel fotogramma. Più recentemente, i Transformer per la visione (ViTs) sono emersi come una potente alternativa, applicando il meccanismo di attenzione dell'elaborazione del linguaggio naturale ai dati delle immagini.
Output e azione. Il modello restituisce un risultato strutturato — un'etichetta, un insieme di riquadri di delimitazione o una maschera di pixel — su cui agisce il sistema circostante: scartando un componente difettoso, frenando un veicolo o generando un avviso.
Come apprende un modello#
Un modello è valido tanto quanto i dati che utilizza. L'apprendimento supervisionato richiede grandi volumi di dati di addestramento, mentre benchmark come ImageNet e COCO forniscono milioni di esempi annotati. Durante l'addestramento, il modello fa una previsione, la confronta con l'etichetta di riferimento e regola i propri pesi interni per ridurre l'errore. Una volta addestrato, lo stesso modello esegue la fase di inferenza descritta sopra.
Il passaggio dai sistemi basati su regole al deep learning#

Le prime applicazioni di computer vision dipendevano dall'ingegneria manuale delle caratteristiche: gli ingegneri definivano parametri geometrici rigidi per aiutare le macchine a riconoscere gli oggetti. Questi sistemi erano fragili e fallivano quando cambiava l'illuminazione o un oggetto appariva da un'angolazione insolita. La pubblicazione di AlexNet nel 2012, addestrata su oltre un milione di immagini ImageNet etichettate, ha segnato una svolta dimostrando che le reti convoluzionali potevano superare su larga scala gli approcci progettati manualmente. Il deep learning ha sostituito le regole messe a punto manualmente con architetture che apprendono autonomamente le proprie caratteristiche, abbastanza flessibili da funzionare in condizioni reali mai perfettamente controllate.
Computer vision vs. elaborazione delle immagini vs. machine vision#
È importante distinguere la computer vision dai campi adiacenti con cui viene regolarmente confusa.
- L'elaborazione delle immagini manipola un'immagine per migliorarla o estrarne il segnale, regolando la luminosità e il contrasto oppure applicando filtri. Il suo output è generalmente un'altra immagine. La computer vision riceve un'immagine in input e restituisce un'interpretazione ("in questa stanza ci sono tre persone"). La computer vision utilizza regolarmente l'elaborazione delle immagini come fase di preparazione.
- La machine vision indica i sistemi di ispezione industriale che operano in ambienti rigidamente controllati, con illuminazione fissa e posizioni note dei componenti. La computer vision è la disciplina più ampia, progettata per gestire condizioni imprevedibili e non controllate.
- L'elaborazione del linguaggio naturale gestisce testo e voce. La computer vision si concentra interamente sui dati visivi, anche se i modelli linguaggio-visione stanno creando sempre più un ponte tra i due ambiti.
Attività fondamentali della computer vision#
La computer vision non è una singola funzione, ma un insieme di attività distinte, ognuna delle quali risolve un problema diverso. Per una spiegazione più approfondita di ciascuna, consulta la guida completa alle attività di computer vision.
- Classificazione delle immagini: assegna una singola etichetta a un'immagine intera, rispondendo alla domanda "cosa c'è in questa immagine?", ad esempio classificando i prodotti come difettosi o non difettosi. Strettamente correlato è il riconoscimento delle immagini, che identifica ciò che è presente.
- Rilevamento degli oggetti: identifica gli oggetti distinti e traccia un riquadro di delimitazione intorno a ciascuno, consentendo ai sistemi di contare e localizzare più oggetti in un singolo fotogramma.
- Segmentazione delle istanze: produce una maschera a livello di pixel per ogni oggetto rilevato, separando le singole istanze della stessa classe. La segmentazione semantica, invece, assegna una classe a ogni pixel senza distinguere le istanze.
- Stima della posa: rileva i punti chiave di un oggetto, come le articolazioni del corpo umano, per monitorare movimento e postura.
- Riquadri di delimitazione orientati: adattano riquadri ruotati agli oggetti non allineati agli assi, una funzione essenziale nelle immagini aeree e satellitari.
- Tracciamento degli oggetti: segue un oggetto lungo un flusso video, mantenendo un ID coerente tra i fotogrammi. Il flusso ottico estende questa funzione analizzando il movimento apparente tra fotogrammi consecutivi.
- Riconoscimento ottico dei caratteri (OCR): converte le immagini di testo stampato o scritto a mano in dati leggibili dalle macchine, automatizzando l'elaborazione dei documenti su larga scala.
Scegliere l'attività giusta#
Allineare fin dall'inizio l'attività tecnica all'obiettivo aziendale evita costose rilavorazioni.
| Obiettivo aziendale | Attività da utilizzare |
|---|---|
| Ordinare i prodotti in categorie | Classificazione delle immagini |
| Contare gli elementi o individuarne la posizione | Rilevamento degli oggetti |
| Analizzare la forma o il contorno esatto di un oggetto | Segmentazione delle istanze |
| Seguire il movimento tra i fotogrammi video | Tracciamento degli oggetti |
| Misurare la posizione del corpo o gli angoli delle articolazioni | Stima della posa |
| Rilevare oggetti ruotati nelle immagini aeree | Riquadri di delimitazione orientati |
| Leggere il testo da documenti o etichette | Riconoscimento ottico dei caratteri |
Applicazioni nel mondo reale#
Oggi la computer vision è alla base dei sistemi di produzione nella maggior parte dei principali settori.

- Produzione e controllo qualità. Le moderne linee di produzione funzionano più velocemente delle capacità visive umane. I sistemi di visione eseguono ispezioni di qualità istantanee, identificando crepe microscopiche o componenti disallineati alla velocità della linea, senza la fatica accumulata da un ispettore umano. Il monitoraggio dei modelli di usura dei macchinari consente inoltre la manutenzione predittiva, individuando i segnali di guasto prima che un malfunzionamento causi un fermo non pianificato. Consulta computer vision nella produzione e rilevamento dei difetti.
- Sanità e diagnostica. Gli algoritmi di analisi delle immagini mediche elaborano radiografie, risonanze magnetiche e scansioni TC per rilevare tumori allo stadio iniziale, microfratture e anomalie retiniche che possono sfuggire facilmente sotto pressione. In sala operatoria, i sistemi di visione forniscono una mappatura spaziale in tempo reale durante le procedure mini-invasive. Consulta computer vision nella sanità.
- Vendita al dettaglio. I negozi senza casse utilizzano la fusione dei sensori e algoritmi di visione per monitorare gli articoli prelevati dagli scaffali e addebitare automaticamente i clienti. Gli stessi sistemi controllano in tempo reale i livelli sugli scaffali per attivare avvisi di rifornimento, supportando la gestione dell'inventario e la prevenzione delle perdite nella vendita al dettaglio. Consulta computer vision nella vendita al dettaglio.
- Trasporti autonomi. Il livello di percezione è il componente più critico per la sicurezza di un'auto a guida autonoma. I sistemi di visione identificano in tempo reale segnaletica orizzontale, segnali stradali, pedoni e altri veicoli, combinando l'input delle telecamere con radar e LiDAR per costruire un modello a 360 gradi dell'ambiente circostante il veicolo attraverso il rilevamento 3D degli oggetti. Consulta veicoli autonomi.
- Sicurezza e monitoraggio. Le infrastrutture di sicurezza sono passate dalla registrazione passiva all'intervento proattivo: rilevano la permanenza in zone soggette a restrizioni, segnalano pattern comportamentali insoliti mentre si verificano e supportano la gestione delle code negli spazi pubblici. Il rilevamento delle anomalie è la capacità alla base di tutto questo.
- Agricoltura. Droni e trattori valutano lo stato di salute delle colture a livello di singola pianta, analizzando immagini multispettrali per individuare disidratazione, infestazioni di parassiti o carenze nutritive. Acqua, pesticidi e fertilizzanti vengono quindi applicati solo dove necessario, anziché su interi campi. Consulta computer vision nell'agricoltura.
La computer vision all'edge#
L'analisi visiva in tempo reale viene eseguita sempre più spesso all'edge, direttamente sulla telecamera o su un gateway locale, anziché instradare il video verso un server cloud centralizzato. Questo è importante per due motivi.
La latenza scende quasi a zero, una condizione irrinunciabile per la robotica autonoma o l'ispezione di linee industriali, dove un ritardo di pochi millisecondi produce errori. Inoltre, poiché attraverso la rete passa solo metadato e non il video grezzo, i requisiti di banda diminuiscono drasticamente e la privacy migliora, perché le riprese sensibili non lasciano mai il dispositivo locale. Edge AI e inferenza in tempo reale rendono tutto questo pratico, mentre le opzioni di distribuzione dei modelli come ONNX e TensorRT consentono di eseguire un singolo modello addestrato su hardware diversi.
Sfide e limitazioni#
Qualità dei dati. Un modello riflette la qualità dei propri dati di addestramento. Dataset a bassa risoluzione, etichettati male o non rappresentativi producono modelli inaffidabili, e costruire un dataset annotato e diversificato richiede spesso più lavoro che progettare l'algoritmo. Consulta l'etichettatura dei dati.
Variabili ambientali. Pioggia intensa, riflessi dell'obiettivo, occlusioni parziali e variazioni nella scala degli oggetti riducono le prestazioni. I sistemi robusti si affidano all'aumento dei dati durante l'addestramento per simulare queste condizioni e sviluppare resilienza prima della distribuzione, oltre che a una validazione accurata per evitare l'overfitting.
Considerazioni etiche e bias. Un modello addestrato su un dataset privo di diversità demografica avrà prestazioni non uniformi tra i gruppi della popolazione. Le organizzazioni che distribuiscono sistemi per analizzare le persone — nell'imaging medico, nella sicurezza sul lavoro o negli spazi pubblici — devono verificare l'equità dei propri dataset e rispettare le normative emergenti sul processo decisionale automatizzato.
Il futuro della computer vision#
I Vision Transformer stanno ridefinendo ciò che è possibile ottenere nelle attività che richiedono la comprensione delle relazioni tra parti distanti di un'immagine. Inoltre, l'apprendimento multimodale combina dati visivi con testo, audio e profondità per costruire sistemi con una comprensione contestuale più ricca: i modelli linguaggio-visione che rispondono a domande sulle immagini ne sono un primo esempio.
La Generative AI affronta direttamente la scarsità di dati. I dati sintetici permettono di creare immagini iperrealistiche di scenari rari — specifiche modalità di guasto o manifestazioni insolite di malattie — che nel mondo reale non possono essere raccolte in quantità sufficiente. Nel frattempo, le telecamere per il rilevamento della profondità e LiDAR spingono i sistemi oltre l'analisi di immagini piatte, verso il calcolo spaziale, in cui le informazioni digitali vengono sovrapposte al mondo fisico per applicazioni come la manutenzione guidata dall'AR e la mappatura strutturale.
Implementare la computer vision con Ultralytics#
Per i team che stanno sperimentando un progetto di computer vision, Ultralytics YOLO26 è un punto di partenza pratico per il rilevamento degli oggetti in tempo reale: open source, ampiamente documentato e abbastanza veloce da funzionare all'edge. I dati su accuratezza e latenza tra i diversi hardware sono pubblicati nella pagina dei benchmark, mentre la documentazione include confronti affiancati tra modelli. L'ecosistema più ampio comprende OpenCV per l'elaborazione classica delle immagini e PyTorch come framework principale per l'addestramento.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Questo script utilizza un modello pre-addestrato per eseguire l'inferenza in poche righe. I team che passano da un progetto pilota alla produzione possono usare la Ultralytics Platform per annotare dataset, addestrare modelli nel cloud e gestire la distribuzione, oppure applicare il transfer learning per adattare un modello pre-addestrato a un dataset personalizzato con molti meno dati etichettati rispetto all'addestramento da zero.
Domande frequenti
Il machine learning è la disciplina più ampia che si occupa di costruire sistemi capaci di apprendere dai dati. La computer vision è l'applicazione di questa disciplina — generalmente tramite deep learning — a input visivi come immagini e video. Quasi tutta la computer vision moderna si basa sul machine learning, ma il machine learning comprende anche testo, audio e dati tabellari.
No. Il riconoscimento delle immagini è un'attività della computer vision e identifica ciò che appare in un'immagine. La computer vision comprende anche rilevamento degli oggetti, segmentazione, stima della posa, tracciamento e comprensione della scena.
Dipende dalla complessità dell'attività e dalla quantità di variazioni che il modello deve gestire. Il transfer learning da un modello pre-addestrato come Ultralytics YOLO26 riduce sostanzialmente il requisito; spesso è possibile addestrare rilevatori personalizzati efficaci con poche centinaia o poche migliaia di immagini etichettate per classe, anziché con i milioni utilizzati per addestrare i foundation model.
Sì. I modelli possono essere distribuiti direttamente sui dispositivi edge ed eseguiti interamente offline, una pratica standard quando latenza, banda o normative sulla privacy dei dati impediscono l'invio dei video al cloud.
Python è predominante grazie alla maturità del suo ecosistema: il pacchetto
ultralytics, PyTorch e OpenCV. C++ viene utilizzato quando sono necessarie prestazioni di inferenza massime, in genere nei sistemi embedded e automobilistici.






