Ultralytics YOLO27:
AI per la visione

FastVLM: Apple presenta il suo nuovo modello veloce di visione e linguaggio

Apple presenta FastVLM al CVPR 2025. Questo modello open source di visione e linguaggio integra l'encoder FastViTHD e offre una velocità di generazione del primo token fino a 85 × superiore.

ABAbirami Vina9 min read
Il modello veloce di visione e linguaggio FastVLM di Apple

Alla conferenza CVPR 2025, Apple ha presentato un nuovo modello di AI open source chiamato FastVLM. È progettato per comprendere sia le immagini sia il linguaggio e funziona su dispositivi Apple come iPhone, iPad e Mac. Questo significa che può fornire risultati intelligenti rapidamente, senza inviare i tuoi dati al cloud.

Ciò che rende FastVLM particolarmente interessante è la sua velocità ed efficienza. Apple ha sviluppato un nuovo encoder di visione chiamato FastViTHD, che aiuta il modello a interpretare immagini di alta qualità usando meno memoria ed energia. Tutta l'elaborazione avviene localmente sul dispositivo, con tempi di risposta più rapidi e nel rispetto della privacy degli utenti.

In questo articolo vedremo come funziona FastVLM, cosa lo distingue e perché questa novità di Apple potrebbe rappresentare un passo avanti significativo per le applicazioni di AI di uso quotidiano sui tuoi dispositivi.

Capire i modelli di visione e linguaggio (VLMs)#

Prima di entrare nel merito di ciò che rende speciale FastVLM, vediamo cosa significa “VLM” nel suo nome. Si riferisce a un modello di visione e linguaggio, progettato per comprendere e collegare i contenuti visivi al linguaggio.

I VLMs combinano la comprensione visiva e il linguaggio, consentendo di svolgere attività come descrivere una foto, rispondere a domande su uno screenshot o estrarre testo da un documento. I modelli di visione e linguaggio funzionano generalmente in due parti: una elabora l'immagine e la converte in dati, mentre l'altra interpreta tali dati per generare una risposta che puoi leggere o ascoltare.

Potresti aver già utilizzato questo tipo di innovazione nell'AI senza rendertene conto. Le app che scansionano ricevute, leggono documenti d'identità, generano didascalie per le immagini o aiutano le persone ipovedenti a interagire con gli schermi spesso si affidano a modelli di visione e linguaggio che funzionano silenziosamente in background.

Che cos'è FastVLM?#

Apple ha sviluppato FastVLM per svolgere le stesse attività degli altri modelli di visione e linguaggio, ma con maggiore velocità, una privacy più solida e prestazioni ottimizzate sui propri dispositivi. Può comprendere il contenuto di un'immagine e rispondere con del testo, ma a differenza di molti modelli che si affidano ai server cloud, FastVLM può funzionare interamente sul tuo iPhone, iPad o Mac.

In genere, i VLMs offrono prestazioni migliori con immagini ad alta risoluzione. Ad esempio, come mostrato di seguito, FastVLM è riuscito a identificare correttamente un cartello stradale con la scritta “Do Not Enter” solo quando gli è stata fornita una versione ad alta risoluzione dell'immagine. Tuttavia, gli input ad alta risoluzione di solito rallentano i modelli. È qui che FastViTHD fa la differenza.

Prestazioni di FastVLM su immagini a bassa e alta risoluzione

Fig. 1. Prestazioni di FastVLM su immagini a bassa e alta risoluzione. (Fonte)

Il nuovo encoder di visione di Apple, FastViTHD, aiuta FastVLM a elaborare le immagini di alta qualità in modo più efficiente, utilizzando meno memoria ed energia. In particolare, FastViTHD è abbastanza leggero da funzionare senza problemi anche sui dispositivi più piccoli.

Inoltre, FastVLM è disponibile pubblicamente nel repository FastVLM su GitHub, dove gli sviluppatori possono accedere al codice sorgente, apportare modifiche e utilizzarlo nelle proprie app in conformità con i termini della licenza di Apple.

Confronto tra FastVLM e altri modelli VLM#

Rispetto ad altri modelli di visione e linguaggio, FastVLM è ottimizzato per funzionare su dispositivi di uso quotidiano come smartphone e laptop. Nei test delle prestazioni, FastVLM ha generato la prima parola o il primo output fino a 85 volte più velocemente di modelli come LLaVA-OneVision-0.5B.

Confronto delle prestazioni di FastVLM con altri modelli

Fig. 2. Confronto delle prestazioni di FastVLM con altri modelli. (Fonte)

Ecco una panoramica di alcuni benchmark standard su cui FastVLM è stato valutato:

  • DocVQA (domande e risposte visive sui documenti): questo benchmark valuta quanto bene il modello riesca a leggere e comprendere le informazioni testuali nei documenti, come moduli scansionati o pagine.
  • TextVQA (domande e risposte visive basate sul testo): valuta la capacità del modello di interpretare immagini contenenti testo incorporato e rispondere con precisione alle domande correlate.
  • GQA (domande e risposte sui grafi): questa attività verifica le capacità di ragionamento del modello, richiedendogli di comprendere le relazioni tra oggetti e scene all'interno di un'immagine.
  • MMMU (comprensione multimodale di molteplici discipline): misura le prestazioni del modello in un'ampia gamma di materie e formati accademici, combinando la comprensione visiva e testuale.
  • SeedBench (valutazione standard dei dati migliorati per il benchmarking): questo benchmark analizza le capacità generali del modello nella comprensione visiva e nel ragionamento in molteplici ambiti.

Su questi benchmark, FastVLM ha ottenuto risultati competitivi utilizzando meno risorse. Porta l'AI visiva pratica su dispositivi di uso quotidiano come telefoni, tablet e laptop.

L'encoder di visione efficiente di FastVLM: FastViTHD#

Ora esaminiamo più da vicino FastViTHD, l'encoder di visione che svolge un ruolo fondamentale nelle prestazioni di elaborazione delle immagini di FastVLM.

La maggior parte dei modelli di visione e linguaggio suddivide un'immagine in migliaia di piccole porzioni chiamate token. Più token ci sono, maggiore è il tempo e l'energia di cui il modello ha bisogno per comprendere l'immagine. Questo può rallentare il processo, soprattutto su telefoni o laptop.

Come un encoder di visione elabora un'immagine

Fig. 3. Come un encoder di visione elabora un'immagine. (Fonte)

FastViTHD evita il rallentamento dovuto all'elaborazione di un numero eccessivo di token utilizzandone meno, pur comprendendo l'immagine completa. Combina due approcci: i transformer, efficaci nel modellare schemi e relazioni, e gli strati convoluzionali, efficienti nell'elaborazione dei dati visivi. Il risultato è un sistema più veloce e con un minore utilizzo di memoria.

Secondo Apple, FastViTHD è fino a 3,4 volte più piccolo di alcuni encoder di visione tradizionali, mantenendo comunque un'elevata accuratezza. Anziché affidarsi a tecniche di ottimizzazione del modello come il token pruning (la rimozione delle porzioni di immagine meno importanti per velocizzare l'elaborazione), raggiunge l'efficienza grazie a un'architettura più semplice e ottimizzata.

Le varianti del modello FastVLM e la pipeline di training#

Apple ha rilasciato FastVLM in tre dimensioni diverse: 0.5B, 1.5B e 7B parametri (dove "B" sta per miliardi e si riferisce al numero di pesi addestrabili nel modello). Ogni versione è progettata per adattarsi a diversi tipi di dispositivi. I modelli più piccoli possono funzionare su telefoni e tablet, mentre il modello 7B più grande è più adatto ai computer desktop o alle attività più impegnative.

Questo offre agli sviluppatori la flessibilità di scegliere la soluzione più adatta alle proprie app. Possono realizzare qualcosa di veloce e leggero per dispositivi mobili oppure qualcosa di più complesso per sistemi più grandi, utilizzando comunque la stessa architettura di base del modello.

Apple ha addestrato le varianti del modello FastVLM utilizzando la pipeline LLaVA‑1.5, un framework per l'allineamento dei modelli di visione e linguaggio. Per il componente linguistico, ha valutato FastVLM usando modelli open source esistenti come Qwen e Vicuna, noti per la generazione di testi naturali e coerenti. Questa configurazione consente a FastVLM di elaborare immagini semplici e complesse e produrre risposte leggibili e pertinenti.

L'importanza di FastVLM: l'approccio efficiente di Apple all'AI#

Potresti chiederti perché l'elaborazione efficiente delle immagini di FastVLM sia importante. La risposta sta nella possibilità di far funzionare le app in tempo reale senza dipendere dal cloud. FastVLM può gestire immagini ad alta risoluzione, fino a 1152 × 1152 pixel, rimanendo abbastanza veloce e leggero da funzionare direttamente sul tuo dispositivo.

Questo significa che le app possono descrivere ciò che vede la fotocamera, scansionare le ricevute mentre vengono acquisite o rispondere ai cambiamenti sullo schermo, mantenendo tutto in locale. È particolarmente utile in ambiti come l'istruzione, l'accessibilità, la produttività e la fotografia.

Poiché FastViTHD è efficiente anche con le immagini di grandi dimensioni, contribuisce a mantenere i dispositivi reattivi e freschi. Funziona con tutte le dimensioni del modello, inclusa la più piccola, che può essere eseguita sugli iPhone entry-level. Questo significa che le stesse funzionalità di AI possono essere utilizzate su telefoni, tablet e Mac.

Applicazioni di FastVLM#

FastVLM può supportare un'ampia gamma di applicazioni grazie a vantaggi fondamentali come velocità, efficienza e privacy sul dispositivo. Ecco alcuni possibili utilizzi:

  • Lettura dei documenti: può scansionare ricevute, moduli o documenti d'identità ed estrarre solo le informazioni rilevanti. Può concentrarsi su aree specifiche di un'immagine, una funzione utile per le app che richiedono una rapida estrazione del testo accurata.

  • Didascalie per le immagini: analizzando una foto, può generare una descrizione chiara di ciò che contiene. Questo supporta le funzionalità delle app per fotocamere, delle gallerie fotografiche o di qualsiasi strumento che tragga vantaggio dalla comprensione visiva in tempo reale.

  • Supporto all'accessibilità: FastVLM può descrivere i contenuti sullo schermo per gli utenti non vedenti o ipovedenti, rendendo più semplici da esplorare e utilizzare pulsanti, menu ed elementi del layout.

  • Assistenti AI sul dispositivo: FastVLM può funzionare bene con gli assistenti AI che devono comprendere rapidamente ciò che appare sullo schermo. Poiché funziona direttamente sul dispositivo e mantiene privati i dati, può aiutare in attività come leggere testi, identificare pulsanti o icone e guidare gli utenti in tempo reale senza dover inviare informazioni al cloud.

FastVLM può essere utilizzato per il riconoscimento del testo e le domande e risposte visive

Fig. 4. FastVLM può essere utilizzato per il riconoscimento del testo e le domande e risposte visive. (Fonte)

Punti chiave#

FastVLM porta l'AI di visione e linguaggio direttamente sui dispositivi Apple, combinando velocità, privacy ed efficienza. Grazie al design leggero e al rilascio open source, consente la comprensione delle immagini in tempo reale nelle app mobili e desktop.

Questo contribuisce a rendere l'AI più pratica e accessibile nell'uso quotidiano e offre agli sviluppatori una solida base per creare applicazioni utili e incentrate sulla privacy. Guardando al futuro, è probabile che i modelli di visione e linguaggio svolgano un ruolo importante nel modo in cui interagiamo con la tecnologia, rendendo l'AI più reattiva, consapevole del contesto e utile nelle situazioni quotidiane.

Esplora il nostro repository su GitHub per saperne di più sull'AI. Unisciti alla nostra community attiva e scopri le innovazioni in settori come l'AI nel settore automobilistico e l'AI visiva nella produzione industriale. Per iniziare oggi stesso con la computer vision, dai un'occhiata alle nostre opzioni di licenza.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning