Vision Language Model (VLM)
Scopri i modelli linguistici visivi (VLM) con Ultralytics. Approfondisci come collegano la visione artificiale e gli LLM per VQA e il rilevamento a vocabolario aperto usando Ultralytics YOLO26.
Un modello visione-linguaggio (VLM) è un tipo di intelligenza artificiale in grado di elaborare e interpretare simultaneamente informazioni visive (immagini o video) e testuali. A differenza dei modelli tradizionali di visione artificiale, che si concentrano esclusivamente sui dati dei pixel, o dei modelli linguistici di grandi dimensioni (LLM), che comprendono solo il testo, i VLM colmano il divario tra queste due modalità. Addestrati su enormi set di dati contenenti coppie immagine-testo, questi modelli imparano ad associare caratteristiche visive a concetti linguistici, consentendo loro di descrivere immagini, rispondere a domande su scene visive e persino eseguire comandi in base a ciò che «vedono».
Come funzionano i modelli visione-linguaggio#
In genere, i VLM sono composti da due componenti principali: un codificatore visivo e un codificatore testuale. Il codificatore visivo elabora le immagini per estrarre mappe di caratteristiche e rappresentazioni visive, mentre quello testuale gestisce l'input linguistico. Questi flussi di dati distinti vengono poi fusi con meccanismi come la cross-attention, per allineare le informazioni visive e testuali in uno spazio di embedding condiviso.
I progressi recenti del 2024 e del 2025 si stanno orientando verso architetture più unificate, in cui un unico backbone Transformer gestisce entrambe le modalità. Ad esempio, modelli come Google PaliGemma 2 mostrano quanto l'integrazione efficace di questi flussi possa migliorare le prestazioni in attività complesse di ragionamento. Questo allineamento consente al modello di comprendere il contesto, ad esempio riconoscendo che la parola «mela» si riferisce a un frutto nell'immagine di un negozio di alimentari, ma a un'azienda tecnologica quando compare in un logo.
Applicazioni nel mondo reale#
La capacità di comprendere il mondo sia con la vista sia con il linguaggio apre diverse possibilità applicative in numerosi settori:
- Risposta a domande visive (VQA): i VLM sono ampiamente utilizzati nella diagnostica sanitaria per assistere i radiologi. Un medico potrebbe chiedere a un sistema: «C'è una frattura in questa radiografia?»; il modello analizza l'immagine medica e fornisce una valutazione preliminare, riducendo gli errori diagnostici.
- Ricerca intelligente nell'e-commerce: negli ambienti di vendita al dettaglio, i VLM consentono agli utenti di cercare prodotti usando descrizioni in linguaggio naturale abbinate a immagini. Un acquirente potrebbe caricare la foto dell'abbigliamento di una celebrità e chiedere: «Trovami un vestito con questo motivo, ma blu»; il sistema utilizza la ricerca semantica per trovare corrispondenze accurate.
- Generazione automatica di didascalie e accessibilità: i VLM generano automaticamente testi alternativi descrittivi per le immagini sul web, rendendo i contenuti digitali più accessibili agli utenti con disabilità visive che usano lettori di schermo.
Differenze tra VLM e concetti correlati#
Per comprendere il ruolo specifico dei VLM, è utile distinguerli da altre categorie di IA:
- VLM e LLM: un modello linguistico di grandi dimensioni (come le versioni solo testuali di GPT-4) elabora esclusivamente dati testuali. Può generare storie creative o codice, ma non può «vedere» un'immagine. Un VLM fornisce di fatto la vista a un LLM.
- VLM e rilevamento degli oggetti: i modelli tradizionali di rilevamento degli oggetti, come le prime versioni di YOLO, identificano dove si trovano gli oggetti e a quale classe appartengono (ad esempio, «Auto: 99%»). Un VLM va oltre, comprendendo le relazioni e gli attributi, come in «un'auto sportiva rossa parcheggiata accanto a un idrante».
- VLM e IA multimodale: l'IA multimodale è un termine ombrello più ampio. Tutti i VLM sono multimodali (combinano visione e linguaggio), ma non tutti i modelli multimodali sono VLM: alcuni possono combinare audio e testo (come nella conversione da parlato a testo) oppure video e dati dei sensori, senza includere una componente linguistica.
Rilevamento a vocabolario aperto con YOLO#
I VLM moderni permettono il rilevamento «a vocabolario aperto», in cui puoi rilevare oggetti usando prompt testuali liberi anziché classi predefinite. Questa è una caratteristica fondamentale di modelli come Ultralytics YOLO-World, che consente di definire dinamicamente le classi senza dover ripetere l'addestramento.
L'esempio seguente mostra come usare il pacchetto ultralytics per rilevare oggetti specifici descritti tramite testo:
from ultralytics import YOLOWorld
# Carica un modello in grado di comprendere la relazione tra visione e linguaggio
model = YOLOWorld("yolov8s-world.pt")
# Definisci classi personalizzate usando prompt testuali in linguaggio naturale
model.set_classes(["person wearing sunglasses", "red backpack"])
# Esegui l'inferenza per individuare in un'immagine gli oggetti definiti dal testo
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Mostra i risultati del rilevamento
results[0].show()Sfide e sviluppi futuri#
Nonostante la loro potenza, i modelli visione-linguaggio devono affrontare sfide significative. Un problema importante sono le allucinazioni, in cui il modello descrive con sicurezza oggetti o testo in un'immagine che in realtà non ci sono. I ricercatori lavorano attivamente a tecniche come l'apprendimento per rinforzo dal feedback umano (RLHF) per migliorare il radicamento e la precisione.
Un'altra sfida è il costo computazionale. L'addestramento di questi modelli enormi richiede notevoli risorse GPU. Tuttavia, il rilascio di architetture efficienti come Ultralytics YOLO26 contribuisce a portare capacità di visione avanzate sui dispositivi edge. In futuro, ci aspettiamo che i VLM svolgano un ruolo fondamentale negli agenti robotici, consentendo ai robot di spostarsi e manipolare oggetti sulla base di istruzioni verbali complesse.
Per chi è interessato ai fondamenti teorici, l'articolo originale CLIP di OpenAI offre ottimi spunti sul preaddestramento contrastivo linguaggio-immagine. Inoltre, seguire gli articoli delle conferenze CVPR è fondamentale per monitorare la rapida evoluzione di queste architetture. Per sperimentare l'addestramento dei tuoi modelli di visione, puoi usare la Ultralytics Platform per semplificare la gestione dei set di dati e la distribuzione dei modelli.









