Comprendere il ruolo degli FPS nella computer vision
Scopri perché gli FPS sono importanti nella computer vision e come influiscono sul rilevamento degli oggetti in tempo reale, sull’analisi video e sulle applicazioni basate sull’AI.

Guardare il replay al rallentatore del tuo momento sportivo preferito, in cui ogni dettaglio è nitido, è molto diverso dal guardare un filmato di videosorveglianza, che di solito appare a scatti e difficile da seguire. Il dettaglio tecnico fondamentale alla base di queste differenze è rappresentato dagli FPS, ovvero dai fotogrammi al secondo, che indicano il numero di fotogrammi mostrati ogni secondo in un video. Un FPS più elevato produce movimenti fluidi e realistici, mentre un FPS più basso può generare filmati a scatti e con meno dettagli.
Questo concetto influisce direttamente sulla computer vision, un ramo dell'AI che consente alle macchine di interpretare e analizzare i dati visivi in modo simile agli esseri umani. Nella computer vision, un FPS più elevato significa che i sistemi possono acquisire più informazioni ogni secondo, migliorando la precisione del rilevamento e del tracciamento degli oggetti in tempo reale.
In questo articolo analizzeremo gli aspetti tecnici degli FPS e il loro rapporto con le applicazioni di computer vision. Iniziamo!
Che cosa significa FPS nella computer vision?#
Supponiamo che tu stia giocando a un gioco di corse: a 60 FPS, ogni curva risulta fluida e reattiva, ma a 20 FPS i comandi hanno un ritardo, rendendo più difficile evitare gli ostacoli. In poche parole, puoi considerare gli FPS come il numero di immagini fisse mostrate ogni secondo. Un numero maggiore di immagini al secondo rende il movimento fluido e naturale, mentre un numero minore può farlo apparire a scatti.
Come nei videogiochi, gli FPS sono una componente fondamentale delle applicazioni di computer vision. Un FPS più elevato consente di tracciare gli oggetti con la Vision AI in modo fluido, mentre un FPS più basso può causare la perdita di dettagli.
Ad esempio, nell'analisi sportiva, le telecamere basate sull'AI hanno bisogno di un FPS più elevato per riuscire a tracciare passaggi rapidi, movimenti dei giocatori e traiettorie della palla. Un FPS più basso potrebbe far perdere un importante contatto tra piede e pallone o un rapido cambio di direzione, compromettendo la precisione dell'analisi.
Analogamente, nel monitoraggio del traffico, i sistemi si affidano a FPS elevati per rilevare i veicoli che superano i limiti di velocità e i cambi di corsia in tempo reale. La scelta dell'FPS corretto dipende dai requisiti specifici di ogni applicazione di computer vision, bilanciando prestazioni, efficienza e chiarezza visiva.

Fig. 1. Confronto tra diverse frequenze dei fotogrammi.
Aspetti tecnici degli FPS nella computer vision#
Ora che abbiamo spiegato che cosa sono gli FPS e come vengono utilizzati nella computer vision, analizziamone gli aspetti tecnici, iniziando da come calcolare gli FPS di un video.
Dividendo il numero totale di fotogrammi per la durata in secondi ottieni gli FPS di un video. Ad esempio, se un video contiene 96 fotogrammi in 4 secondi, il risultato è 24 FPS, ovvero 24 immagini visualizzate ogni secondo, mentre 32 fotogrammi in 4 secondi corrispondono a 8 FPS. Le librerie Python come OpenCV possono essere utilizzate per estrarre i metadati del video, contare i fotogrammi e calcolare automaticamente gli FPS, semplificando il processo di analisi video.

Fig. 2. 24 FPS vs 8 FPS vs 4 FPS.
Fattori che influenzano gli FPS di un video#
Tuttavia, calcolare gli FPS da soli non è sufficiente per prendere decisioni tecniche durante lo sviluppo di soluzioni di computer vision. È inoltre importante considerare i vari fattori che possono influire sulla frequenza effettiva dei fotogrammi, come le capacità hardware, le ottimizzazioni software e le condizioni ambientali.
Ecco un'analisi più dettagliata di questi fattori:
- Capacità hardware: La qualità del sensore della fotocamera e la potenza di elaborazione del dispositivo possono determinare quanti fotogrammi vengono acquisiti ogni secondo. Un hardware migliore generalmente supporta un FPS più elevato e video più fluidi.
- Ottimizzazioni software: I software efficienti per la codifica e l'elaborazione video aiutano a estrarre e analizzare rapidamente i fotogrammi. In questo modo il video viene elaborato senza ritardi superflui.
- Condizioni ambientali: L'illuminazione e il movimento in una scena influenzano la nitidezza con cui vengono acquisiti i fotogrammi. Una buona illuminazione e un movimento moderato possono migliorare gli FPS, mentre condizioni sfavorevoli potrebbero richiedere un FPS più elevato per mantenere la chiarezza.
- Esigenze di archiviazione: Un FPS più elevato acquisisce più fotogrammi al secondo, aumentando le dimensioni dei file. Ciò incrementa i requisiti di archiviazione e richiede un'elaborazione dei dati più rapida per garantire una riproduzione fluida.
Esplorare gli FPS nelle applicazioni di computer vision#
I modelli di AI come Ultralytics YOLO11, che supportano attività di computer vision in tempo reale, possono essere utilizzati per analizzare video con frequenze dei fotogrammi elevate. Questa capacità in tempo reale è fondamentale per applicazioni come la guida autonoma, la videosorveglianza e la robotica, dove anche piccoli ritardi possono causare errori significativi.
Vediamo alcune applicazioni reali della Vision AI in cui un FPS elevato è essenziale per garantire precisione e prestazioni.
Una frequenza dei fotogrammi più elevata per le soluzioni di videosorveglianza e sicurezza#
I sistemi di videosorveglianza che monitorano aree ad alta intensità di traffico, come le autostrade, utilizzano un FPS elevato per acquisire dettagli minimi, assicurando che i veicoli in rapido movimento siano documentati chiaramente. Questa nitidezza è essenziale per i sistemi di riconoscimento automatico delle targhe (ANPR), che si affidano a filmati di buona qualità per identificare con precisione i veicoli.
In questi sistemi, modelli come Ultralytics YOLO11 possono essere utilizzati per rilevare le targhe direttamente dal flusso video. Una volta rilevata una targa, si utilizza il riconoscimento ottico dei caratteri (OCR), che converte le immagini contenenti testo in caratteri leggibili dalla macchina, per leggere i dati della targa. Questo processo consente un'identificazione dei veicoli rapida e precisa, migliorando l'applicazione delle norme sul traffico e la sicurezza generale.

Fig. 3. Utilizzo di YOLO11 per rilevare le targhe.
Comprendere i requisiti degli FPS per i sistemi autonomi#
Immagina una auto a guida autonoma ferma a un segnale di stop, intenta ad analizzare attentamente l'ambiente circostante per decidere se può procedere in sicurezza. L'auto deve prendere decisioni quasi istantanee, il che richiede l'acquisizione e l'elaborazione dei dati visivi in tempo reale.
Se il veicolo autonomo è dotato di telecamere in grado di acquisire filmati a un FPS più elevato, riceve un flusso di immagini più continuo e dettagliato. Questo input visivo migliorato consente all'auto di rilevare rapidamente ostacoli, pedoni e altri veicoli. In questo modo il veicolo può reagire tempestivamente a qualsiasi cambiamento nell'ambiente circostante.
Se le telecamere elaborassero le immagini a un FPS più basso, il veicolo potrebbe ricevere una visuale più frammentata e meno dettagliata. Ciò potrebbe ritardarne i tempi di risposta, aumentando il rischio di perdere informazioni critiche e compromettendo potenzialmente la sicurezza.
Il rapporto tra FPS e analisi sportiva#
Acquisire ogni movimento con precisione è fondamentale nello sport, dove decisioni prese in una frazione di secondo possono fare la differenza tra vincere e perdere. La tecnologia che supporta un FPS più elevato consente di registrare ogni minimo dettaglio del movimento, mentre allenatori, analisti e atleti possono rivedere le azioni al rallentatore senza perdere alcun momento. Aiuta inoltre gli arbitri a prendere decisioni più accurate in sport come tennis, calcio e cricket, fornendo una visualizzazione chiara dell'azione fotogramma per fotogramma.
Ad esempio, un interessante studio sulla pallavolo ha analizzato come l'utilizzo di un FPS più elevato migliori la valutazione delle prestazioni. L'aumento degli FPS da 30 a 240 ha migliorato significativamente la nitidezza dei movimenti e il tracciamento degli oggetti. È migliorata anche la precisione dell'analisi degli attacchi, aiutando gli allenatori a comprendere con maggiore precisione il posizionamento delle mani, i punti di contatto con la palla e la meccanica del salto. Inoltre, lo studio ha rilevato che un FPS più elevato riduceva la sfocatura del movimento, facilitando l'analisi delle battute e delle reazioni difensive.

Fig. 4. Confronto tra FPS basso e alto in relazione alla nitidezza dei movimenti.
Quando l'utilizzo di un FPS basso è efficace nell'analisi video#
Non tutte le applicazioni di computer vision richiedono la registrazione dei filmati a un FPS elevato. In molti casi, un FPS più basso è sufficiente per ottenere risultati accurati, a seconda dell'attività. Ecco alcune aree chiave in cui è preferibile un FPS più basso:
- Post-elaborazione e analisi offline: Per applicazioni come il monitoraggio del traffico e l'analisi della folla, non è sempre necessario acquisire ogni fotogramma a un FPS elevato. Un FPS più basso può comunque fornire dati sufficienti per analizzare i modelli di movimento, come il flusso dei veicoli, la densità dei pedoni e le tendenze della congestione. Riducendo i fotogrammi ridondanti, questo approccio minimizza i requisiti di archiviazione e il carico computazionale, mantenendo al contempo analisi accurate.
- Monitoraggio ambientale time-lapse: Per monitorare cambiamenti lenti come la crescita delle piante, l'avanzamento dei lavori di costruzione o il movimento dei ghiacciai, è sufficiente acquisire un fotogramma ogni pochi minuti o una volta al giorno, documentando efficacemente le trasformazioni a lungo termine e risparmiando spazio di archiviazione.
- Ambienti con risorse limitate: Nel monitoraggio della fauna selvatica e nella sicurezza in aree remote, un FPS più basso aiuta a preservare la durata della batteria e lo spazio di archiviazione. Le telecamere attivate dal movimento che operano a 5–10 FPS possono acquisire eventi essenziali per periodi prolungati, risultando ideali per installazioni non collegate alla rete elettrica.
Scegliere gli FPS corretti per le applicazioni di deep learning#
La selezione dell'FPS ideale richiede un equilibrio tra prestazioni e limitazioni del sistema. Ecco alcuni aspetti da considerare quando ottimizzi gli FPS per le applicazioni di deep learning:
- Bilanciamento tra prestazioni e risorse: Un FPS più elevato migliora la reattività, ma aumenta anche il consumo energetico e i requisiti di elaborazione. La regolazione dinamica degli FPS, l'utilizzo dell'interpolazione dei fotogrammi e l'ottimizzazione dell'hardware possono aiutare a mantenere prestazioni fluide senza sovraccaricare il sistema.
- Esigenze specifiche dell'applicazione: Applicazioni diverse hanno requisiti di FPS diversi. I dispositivi alimentati a batteria dovrebbero utilizzare FPS più bassi per risparmiare energia, mentre i sistemi in tempo reale come droni e veicoli autonomi necessitano di FPS più elevati per risposte rapide e precise.
- Test e ottimizzazione: Le impostazioni degli FPS dovrebbero idealmente essere testate in condizioni diverse di illuminazione e movimento. Valutare la latenza e confrontare affiancati diversi livelli di FPS aiuta a determinare il miglior equilibrio tra reattività, qualità visiva ed efficienza delle risorse.
Innovazioni future e ottimizzazione degli FPS per i modelli di AI#
I progressi nell'AI e nell'ottimizzazione hardware rendono più raggiungibili frequenze dei fotogrammi elevate, anche in ambienti con risorse limitate. Ad esempio, settori come cinema, sport e robotica possono trarre vantaggio da una gestione più intelligente della frequenza dei fotogrammi, in cui i sistemi regolano dinamicamente gli FPS in base alla complessità del movimento e alla potenza di elaborazione. L'interpolazione dei fotogrammi basata sull'AI migliora inoltre la fluidità dei video generando fotogrammi aggiuntivi in tempo reale.
Nel frattempo, una recente innovazione di NVIDIA sta spingendo ancora oltre le prestazioni degli FPS. DLSS 4 (sovracampionamento tramite deep learning) introduce la generazione di più fotogrammi, utilizzando l'AI per prevedere e creare fotogrammi aggiuntivi. In questo modo aumenta la frequenza dei fotogrammi fino a 8 volte, riducendo al contempo il carico di lavoro del sistema.
Affidando all'AI una parte del rendering, DLSS 4 rende le immagini più fluide senza sottoporre l'hardware a un carico aggiuntivo, migliorando sia le prestazioni sia l'efficienza.
Punti chiave#
Gli FPS sono più di una semplice misura della fluidità delle immagini: guidano il processo decisionale in tempo reale nell'AI e nella computer vision. Ogni fotogramma di un video acquisisce dati critici, consentendo alle macchine di tracciare gli oggetti, analizzare i movimenti e rispondere agli ambienti dinamici. Che si tratti di auto a guida autonoma che evitano gli ostacoli o di sistemi di videosorveglianza che rilevano istantaneamente le minacce, gli FPS corretti garantiscono precisione ed efficienza.
Il futuro degli FPS non riguarda solo l'aumento della frequenza dei fotogrammi, ma anche la loro ottimizzazione intelligente. Questa evoluzione renderà i sistemi di computer vision più veloci, innovativi ed efficienti nell'uso delle risorse in diversi settori.
Vuoi saperne di più sull'AI? Esplora il nostro repository GitHub e unisciti alla nostra community. Pronto a iniziare i tuoi progetti di computer vision? Scopri le nostre opzioni di licenza. Scopri come la computer vision nel settore sanitario sta migliorando l'efficienza ed esplora l'impatto dell'AI nel settore manifatturiero visitando le nostre pagine dedicate alle soluzioni!









