Ultralytics YOLO27:
AI per la visione

Comprendere i modelli di visione e linguaggio e le loro applicazioni

Scopri i modelli di visione e linguaggio, il loro funzionamento e le loro diverse applicazioni nell’AI. Scopri come questi modelli combinano capacità visive e linguistiche.

ABAbirami Vina9 min read
Modelli di visione e linguaggio che combinano la comprensione di immagini e testo

In un articolo precedente, abbiamo esplorato come GPT-4o possa comprendere e descrivere le immagini usando le parole. Stiamo osservando questa capacità anche in altri nuovi modelli, come Google Gemini e Claude 3. Oggi approfondiremo questo concetto per spiegare come funzionano i modelli di visione e linguaggio e come combinano dati visivi e testuali.

Questi modelli possono essere utilizzati per svolgere una vasta gamma di attività straordinarie, come generare didascalie dettagliate per le foto, rispondere a domande sulle immagini e persino creare nuovi contenuti visivi basati su descrizioni testuali. Integrando perfettamente informazioni visive e linguistiche, i modelli di visione e linguaggio stanno cambiando il modo in cui interagiamo con la tecnologia e comprendiamo il mondo che ci circonda.

Come funzionano i modelli di visione e linguaggio#

Prima di esaminare dove possono essere utilizzati i modelli di visione e linguaggio (VLM), cerchiamo di capire cosa sono e come funzionano. I VLM sono modelli avanzati di intelligenza artificiale che combinano le capacità dei modelli di visione e linguaggio per gestire sia immagini sia testo. Questi modelli ricevono immagini insieme alle relative descrizioni testuali e imparano a collegare i due elementi. La parte visiva del modello acquisisce i dettagli dalle immagini, mentre la parte linguistica comprende il testo. Questa collaborazione consente ai VLM di comprendere e analizzare sia le immagini sia il testo.

Ecco le funzionalità principali dei modelli di visione e linguaggio:

  • Didascalie delle immagini: generazione di testo descrittivo basato sul contenuto delle immagini.
  • Risposta a domande visive (VQA): risposta a domande relative al contenuto di un'immagine.
  • Generazione da testo a immagine: creazione di immagini basate su descrizioni testuali.
  • Recupero immagine-testo: ricerca di immagini pertinenti per una determinata query testuale e viceversa.
  • Creazione di contenuti multimodali: combinazione di immagini e testo per generare nuovi contenuti.
  • Comprensione della scena e rilevamento degli oggetti: identificazione e categorizzazione di oggetti e dettagli all'interno di un'immagine.

Esempio delle funzionalità di un modello di visione e linguaggio

Fig. 1 Un esempio delle funzionalità di un modello di visione e linguaggio.

Ora esploriamo le architetture e le tecniche di apprendimento comuni dei VLM utilizzate da modelli noti come CLIP, SimVLM e VisualGPT.

Apprendimento contrastivo#

L'apprendimento contrastivo è una tecnica che aiuta i modelli a imparare confrontando le differenze tra i punti dati. Calcola quanto le istanze siano simili o diverse e mira a ridurre al minimo la perdita contrastiva, che misura queste differenze. È particolarmente utile nell'apprendimento semi-supervisionato, in cui un piccolo insieme di esempi etichettati guida il modello nell'etichettatura di dati nuovi e non osservati. Ad esempio, per comprendere l'aspetto di un gatto, il modello lo confronta con immagini simili di gatti e di cani. Identificando caratteristiche come la struttura del volto, le dimensioni del corpo e il pelo, le tecniche di apprendimento contrastivo possono distinguere un gatto da un cane.

Diagramma del funzionamento dell'apprendimento contrastivo

Fig. 2 Come funziona l'apprendimento contrastivo.

CLIP è un modello di visione e linguaggio che utilizza l'apprendimento contrastivo per associare descrizioni testuali alle immagini. Funziona in tre semplici passaggi. Innanzitutto, addestra le parti del modello che comprendono sia il testo sia le immagini. In secondo luogo, converte le categorie di un dataset in descrizioni testuali. Infine, identifica la descrizione più adatta a una determinata immagine. Grazie a questo metodo, il modello CLIP può effettuare previsioni accurate anche per attività per le quali non è stato addestrato specificamente.

PrefixLM#

PrefixLM è una tecnica di elaborazione del linguaggio naturale (NLP) utilizzata per addestrare i modelli. Inizia con una parte della frase (un prefisso) e impara a prevedere la parola successiva. Nei modelli di visione e linguaggio, PrefixLM aiuta il modello a prevedere le parole successive in base a un'immagine e a una parte di testo fornita. Utilizza un Transformer per la visione (ViT), che suddivide un'immagine in piccole patch, ciascuna delle quali rappresenta una parte dell'immagine, e le elabora in sequenza.

Esempio di addestramento di un VLM utilizzando la tecnica PrefixLM

Fig. 3 Un esempio di addestramento di un VLM che utilizza la tecnica PrefixLM.

SimVLM è un VLM che utilizza la tecnica di apprendimento PrefixLM. Utilizza un'architettura Transformer più semplice rispetto ai modelli precedenti, ma ottiene risultati migliori in vari test. La sua architettura prevede l'apprendimento dell'associazione tra immagini e prefissi testuali mediante un encoder Transformer, seguito dalla generazione del testo tramite un decoder Transformer.

Fusione multimodale con attenzione incrociata#

La fusione multimodale con attenzione incrociata è una tecnica che migliora la capacità di un modello di visione e linguaggio preaddestrato di comprendere ed elaborare i dati visivi. Funziona aggiungendo al modello livelli di attenzione incrociata, che gli consentono di prestare attenzione contemporaneamente alle informazioni visive e testuali.

Ecco come funziona:

  • Gli oggetti principali di un'immagine vengono identificati ed evidenziati.
  • Gli oggetti evidenziati vengono elaborati da un encoder visivo, che traduce le informazioni visive in un formato comprensibile al modello.
  • Le informazioni visive vengono trasferite a un decoder, che interpreta l'immagine utilizzando le conoscenze del modello linguistico preaddestrato.

VisualGPT è un buon esempio di modello che utilizza questa tecnica. Include una funzionalità speciale chiamata unità di attivazione auto-resuscitante (SRAU), che aiuta il modello a evitare un problema comune chiamato gradiente evanescente. I gradienti evanescenti possono causare la perdita di informazioni importanti durante l'addestramento, ma SRAU mantiene elevate le prestazioni del modello.

Diagramma dell'architettura del modello VisualGPT

Fig. 4 Architettura del modello VisualGPT.

Applicazioni dei modelli di visione e linguaggio#

I modelli di visione e linguaggio stanno avendo un impatto su numerosi settori. Dal miglioramento delle piattaforme di commercio elettronico alla maggiore accessibilità di Internet, i potenziali utilizzi dei VLM sono entusiasmanti. Esploriamo alcune di queste applicazioni.

Generazione di descrizioni dei prodotti#

Quando fai acquisti online, visualizzi descrizioni dettagliate di ogni prodotto, ma crearle può richiedere molto tempo. I VLM semplificano questo processo automatizzando la generazione di tali descrizioni. I rivenditori online possono generare direttamente descrizioni dettagliate e accurate a partire dalle immagini dei prodotti utilizzando i modelli di visione e linguaggio.

Descrizioni dei prodotti di alta qualità aiutano i motori di ricerca a identificare i prodotti in base agli attributi specifici menzionati nella descrizione. Ad esempio, una descrizione contenente "manica lunga" e "collo in cotone" aiuta i clienti a trovare più facilmente una "camicia di cotone a maniche lunghe". Inoltre, consente ai clienti di trovare rapidamente ciò che cercano, aumentando a sua volta le vendite e la soddisfazione dei clienti.

Esempio di descrizione di un prodotto generata dall'intelligenza artificiale

Fig. 5 Un esempio di descrizione di un prodotto generata dall'intelligenza artificiale.

I modelli di intelligenza artificiale generativa, come BLIP-2, sono esempi di VLM sofisticati in grado di prevedere gli attributi dei prodotti direttamente dalle immagini. BLIP-2 utilizza diversi componenti per comprendere e descrivere accuratamente i prodotti del commercio elettronico. Inizia elaborando e comprendendo gli aspetti visivi del prodotto tramite un encoder di immagini. Successivamente, un Transformer interrogativo interpreta queste informazioni visive nel contesto di domande o attività specifiche. Infine, un modello linguistico di grandi dimensioni genera descrizioni dei prodotti dettagliate e accurate.

Rendere Internet più accessibile#

I modelli di visione e linguaggio possono rendere Internet più accessibile tramite la generazione di didascalie per le immagini, soprattutto per le persone con disabilità visive. Tradizionalmente, gli utenti devono inserire descrizioni dei contenuti visivi sui siti web e sui social media. Ad esempio, quando pubblichi un contenuto su Instagram, puoi aggiungere un testo alternativo per gli screen reader. I VLM, tuttavia, possono automatizzare questo processo.

Quando un VLM vede l'immagine di un gatto seduto su un divano, può generare la didascalia "Un gatto seduto su un divano", rendendo chiara la scena agli utenti con disabilità visive. I VLM utilizzano tecniche come il prompting few-shot, in cui imparano da alcuni esempi di coppie immagine-didascalia, e il prompting chain-of-thought, che li aiuta a scomporre logicamente le scene complesse. Queste tecniche rendono le didascalie generate più coerenti e dettagliate.

Utilizzo dell'intelligenza artificiale per generare didascalie per le immagini

Fig. 6 Utilizzo dell'intelligenza artificiale per generare didascalie per le immagini.

A questo proposito, la funzionalità di Google "Ottieni descrizioni delle immagini da Google" in Chrome genera automaticamente descrizioni per le immagini prive di testo alternativo. Sebbene queste descrizioni generate dall'intelligenza artificiale possano non essere dettagliate quanto quelle scritte dagli esseri umani, forniscono comunque informazioni preziose.

Vantaggi e limitazioni dei modelli di visione e linguaggio#

I modelli di visione e linguaggio (VLM) offrono numerosi vantaggi combinando dati visivi e testuali. Tra i principali vantaggi troviamo:

  • Migliore interazione uomo-macchina: consentono ai sistemi di comprendere e rispondere sia agli input visivi sia a quelli testuali, migliorando assistenti virtuali, chatbot e robotica.
  • Diagnostica e analisi avanzate: assistono in ambito medico analizzando immagini e generando descrizioni, supportando gli operatori sanitari con seconde opinioni e nel rilevamento delle anomalie.
  • Narrazione interattiva e intrattenimento: generano narrazioni coinvolgenti combinando input visivi e testuali per migliorare l'esperienza degli utenti nei videogiochi e nella realtà virtuale.

Nonostante le loro straordinarie capacità, i modelli di visione e linguaggio presentano anche alcune limitazioni. Ecco alcuni aspetti da tenere presenti riguardo ai VLM:

  • Elevati requisiti computazionali: l'addestramento e la distribuzione dei VLM richiedono risorse computazionali considerevoli, rendendoli costosi e meno accessibili.
  • Dipendenza dai dati e distorsioni: i VLM possono produrre risultati distorti se vengono addestrati su dataset non diversificati o distorti, perpetuando stereotipi e disinformazione.
  • Comprensione limitata del contesto: i VLM possono avere difficoltà a comprendere il quadro generale o il contesto e generare output eccessivamente semplificati o errati.

Punti chiave#

I modelli di visione e linguaggio hanno un potenziale straordinario in numerosi ambiti, come il commercio elettronico e la sanità. Combinando dati visivi e testuali, possono promuovere l'innovazione e trasformare interi settori. Tuttavia, è essenziale sviluppare queste tecnologie in modo responsabile ed etico per garantire che vengano utilizzate equamente. Con la continua evoluzione dei VLM, miglioreranno attività come la ricerca basata sulle immagini e le tecnologie assistive.

Per continuare a imparare sull'intelligenza artificiale, entra in contatto con la nostra community! Esplora il nostro repository GitHub per scoprire come utilizziamo l'intelligenza artificiale per creare soluzioni innovative in settori come la produzione e la sanità. 🚀

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning