Ultralytics YOLO27:
AI per la visione

PaliGemma 2 di Google: approfondimenti sui modelli VLM avanzati

Scopri con noi i nuovi modelli linguistici per la visione di Google: PaliGemma 2. Questi modelli possono aiutare a comprendere e analizzare immagini e testo.

ABAbirami Vina9 min read
Il modello linguistico per la visione PaliGemma 2 di Google

Il 5 dicembre 2024, Google ha presentato PaliGemma 2, la versione più recente del suo innovativo modello di visione-linguaggio (VLM). PaliGemma 2 è progettato per gestire attività che combinano immagini e testo, come la generazione di didascalie, la risposta a domande visive e il rilevamento di oggetti nelle immagini.

Basato sul PaliGemma originale, che era già uno strumento efficace per la generazione multilingue di didascalie e il riconoscimento degli oggetti, PaliGemma 2 introduce diversi miglioramenti importanti. Tra questi figurano dimensioni maggiori dei modelli, il supporto per immagini a risoluzione più elevata e prestazioni migliori nelle attività visive complesse. Questi aggiornamenti lo rendono ancora più flessibile ed efficace per un'ampia gamma di utilizzi.

In questo articolo analizzeremo più da vicino PaliGemma 2, spiegando come funziona, quali sono le sue caratteristiche principali e in quali applicazioni dà il meglio di sé. Iniziamo!

Da Gemma 2 a PaliGemma 2#

PaliGemma 2 si basa su due tecnologie fondamentali: l'encoder visivo SigLIP e il modello linguistico Gemma 2. L'encoder SigLIP elabora i dati visivi, come immagini o video, e li scompone in caratteristiche che il modello può analizzare. Nel frattempo, Gemma 2 gestisce il testo, consentendo al modello di comprendere e generare contenuti linguistici multilingue. Insieme, formano un VLM progettato per interpretare e collegare senza soluzione di continuità le informazioni visive e testuali.

Ciò che rende PaliGemma 2 un importante passo avanti sono la sua scalabilità e versatilità. A differenza della versione originale, PaliGemma 2 è disponibile in tre dimensioni: 3 miliardi (3B), 10 miliardi (10B) e 28 miliardi (28B) di parametri. Questi parametri sono simili alle impostazioni interne del modello e lo aiutano ad apprendere ed elaborare i dati in modo efficace. Supporta inoltre diverse risoluzioni delle immagini, ad esempio 224 x 224 pixel per le attività rapide e 896 x 896 per le analisi dettagliate, adattandosi così a diverse applicazioni.

Una panoramica di PaliGemma 2

Fig. 1. Una panoramica di PaliGemma 2.

L'integrazione delle avanzate capacità linguistiche di Gemma 2 con l'elaborazione delle immagini di SigLIP rende PaliGemma 2 significativamente più intelligente. Può gestire attività come:

  • Generazione di didascalie per immagini o video: il modello può generare descrizioni testuali dettagliate dei contenuti visivi, risultando utile per creare automaticamente didascalie.
  • Risposta a domande visive: PaliGemma 2 può rispondere a domande basate sulle immagini, ad esempio identificando oggetti, persone o azioni presenti in una scena.
  • Riconoscimento degli oggetti: identifica ed etichetta gli oggetti all'interno di un'immagine, distinguendo ad esempio tra un gatto, un tavolo o un'auto in una foto.

PaliGemma 2 va oltre l'elaborazione separata di immagini e testo: li combina in modi significativi. Ad esempio, può comprendere le relazioni in una scena, riconoscendo che «Il gatto è seduto sul tavolo», oppure identificare oggetti aggiungendo il contesto, come nel riconoscimento di un monumento famoso.

Come funzionano i modelli VLM PaliGemma 2 di Google#

Ora esamineremo un esempio usando il grafico mostrato nell'immagine qui sotto, per comprendere meglio come PaliGemma 2 elabora i dati visivi e testuali. Supponiamo di caricare questo grafico e chiedere al modello: «Che cosa rappresenta questo grafico?»

Un esempio delle capacità di PaliGemma 2

Fig. 2. Un esempio delle capacità di PaliGemma 2.

Il processo inizia con l'encoder visivo SigLIP di PaliGemma 2, che analizza le immagini ed estrae le caratteristiche principali. Nel caso di un grafico, ciò include l'identificazione di elementi come assi, punti dati ed etichette. L'encoder è addestrato per acquisire sia gli schemi generali sia i dettagli più fini. Utilizza inoltre il riconoscimento ottico dei caratteri (OCR) per rilevare ed elaborare il testo incorporato nell'immagine. Queste caratteristiche visive vengono convertite in token, ovvero rappresentazioni numeriche che il modello può elaborare. I token vengono quindi adattati usando un livello di proiezione lineare, una tecnica che garantisce la loro combinazione fluida con i dati testuali.

Contemporaneamente, il modello linguistico Gemma 2 elabora la query associata per determinarne il significato e l'intento. Il testo della query viene convertito in token, che vengono combinati con i token visivi di SigLIP per creare una rappresentazione multimodale, un formato unificato che collega dati visivi e testuali.

Usando questa rappresentazione integrata, PaliGemma 2 genera una risposta passo dopo passo tramite la decodifica autoregressiva, un metodo in cui il modello predice una parte della risposta alla volta, basandosi sul contesto già elaborato.

Capacità principali di PaliGemma 2#

Ora che abbiamo compreso come funziona, esploriamo le caratteristiche principali che rendono PaliGemma 2 un modello di visione-linguaggio affidabile:

  • Flessibilità del fine-tuning: si adatta facilmente a dataset e attività specifici, ottenendo buone prestazioni in applicazioni come la generazione di didascalie per immagini, il ragionamento spaziale e l'imaging medico.
  • Dati di addestramento diversificati: addestrato su dataset come WebLI e OpenImages, offre solide capacità di riconoscimento degli oggetti e di generazione di output multilingue.
  • Integrazione dell'OCR: include il riconoscimento ottico dei caratteri per estrarre e interpretare il testo dalle immagini, risultando ideale per l'analisi dei documenti e altre attività basate sul testo.
  • Output multilingue: genera didascalie e risposte in più lingue, risultando ideale per applicazioni globali.
  • Integrazione con gli strumenti: è compatibile con framework come Hugging Face Transformers, PyTorch e Keras, consentendo una distribuzione e una sperimentazione semplici.

Confronto tra PaliGemma 2 e PaliGemma: che cosa è migliorato?#

Esaminare l'architettura della prima versione di PaliGemma è un buon modo per osservare i miglioramenti di PaliGemma 2. Uno dei cambiamenti più rilevanti è la sostituzione del modello linguistico Gemma originale con Gemma 2, che introduce miglioramenti sostanziali sia nelle prestazioni sia nell'efficienza.

Gemma 2, disponibile nelle versioni con 9B e 27B parametri, è stato progettato per offrire accuratezza e velocità ai vertici della categoria, riducendo al contempo i costi di distribuzione. Ci riesce grazie a un'architettura riprogettata e ottimizzata per l'efficienza dell'inferenza su diverse configurazioni hardware, dalle GPU più potenti alle configurazioni più accessibili.

Uno sguardo alla prima versione di PaliGemma

Fig. 3. Uno sguardo alla prima versione di PaliGemma 2.

Di conseguenza, PaliGemma 2 è un modello altamente accurato. La versione 10B di PaliGemma 2 raggiunge un punteggio Non-Entailment Sentence (NES) più basso, pari a 20,3, rispetto al 34,3 del modello originale, indicando un numero inferiore di errori fattuali negli output. Questi progressi rendono PaliGemma 2 più scalabile, preciso e adattabile a una gamma più ampia di applicazioni, dalla generazione di didascalie dettagliate alla risposta a domande visive.

Applicazioni di PaliGemma 2: utilizzi concreti dei modelli VLM#

PaliGemma 2 ha il potenziale per ridefinire interi settori combinando senza soluzione di continuità la comprensione visiva e linguistica. Per esempio, nell'ambito dell'accessibilità, può generare descrizioni dettagliate di oggetti, scene e relazioni spaziali, offrendo un'assistenza fondamentale alle persone con disabilità visive. Questa capacità aiuta gli utenti a comprendere meglio l'ambiente circostante, offrendo maggiore autonomia nelle attività quotidiane.

PaliGemma 2 può rendere il mondo più accessibile

Fig. 4. PaliGemma 2 può rendere il mondo più accessibile.

Oltre all'accessibilità, PaliGemma 2 sta avendo un impatto in diversi settori, tra cui:

  • E-commerce: il modello migliora la categorizzazione dei prodotti analizzando e descrivendo gli articoli nelle immagini, semplificando la gestione dell'inventario e migliorando l'esperienza di ricerca degli utenti.
  • Assistenza sanitaria: supporta i professionisti sanitari interpretando immagini mediche, come radiografie e risonanze magnetiche, insieme alle note cliniche, per fornire diagnosi più accurate e informate.
  • Istruzione: PaliGemma 2 aiuta gli educatori a creare materiali didattici descrittivi e accessibili generando didascalie e fornendo informazioni contestuali per le immagini.
  • Creazione di contenuti: il modello automatizza il processo di generazione di didascalie e descrizioni visive per contenuti multimediali, facendo risparmiare tempo ai creatori.

Provalo tu stesso: PaliGemma 2#

Per provare PaliGemma 2, puoi iniziare con la demo interattiva di Hugging Face. Ti consente di esplorare le sue capacità in attività come la generazione di didascalie per immagini e la risposta a domande visive. Ti basta caricare un'immagine e porre al modello domande a riguardo, oppure chiedergli una descrizione della scena.

Una demo di PaliGemma 2

Fig. 5. Una demo di PaliGemma 2 (Fonte: Hugging Face).

Se vuoi approfondire, ecco come puoi passare alla pratica:

  • Modelli preaddestrati: puoi accedere a modelli preaddestrati e codice da piattaforme come Hugging Face e Kaggle. Queste risorse forniscono tutto ciò che ti serve per iniziare a lavorare con il modello.
  • Notebook: sono disponibili documentazione completa e notebook di esempio per acquisire familiarità con PaliGemma 2. Puoi iniziare con gli esempi di inferenza e sperimentare il fine-tuning del modello sul tuo dataset per attività specifiche.
  • Integrazioni: PaliGemma 2 è compatibile con framework ampiamente utilizzati come Hugging Face Transformers, Keras, PyTorch, JAX e Gemma.cpp, consentendoti di integrarlo facilmente nei workflow esistenti.

Vantaggi e svantaggi di PaliGemma 2 di Google#

Ora che abbiamo visto come iniziare a usare PaliGemma 2, esaminiamo più da vicino i suoi principali punti di forza e gli svantaggi da tenere presenti quando utilizzi questi modelli.

Ecco cosa distingue PaliGemma 2 come modello di visione-linguaggio:

  • Miglioramenti dell'efficienza: sfruttando l'architettura ottimizzata di Gemma 2, PaliGemma 2 offre prestazioni elevate riducendo al minimo i costi di distribuzione.
  • Funzionalità di sicurezza migliorate: PaliGemma 2 include importanti miglioramenti della sicurezza nel processo di addestramento, come un filtraggio robusto dei dati di preaddestramento per ridurre i bias e una valutazione rigorosa rispetto ai benchmark di sicurezza.
  • Bassa latenza per le configurazioni più piccole: il modello 3B offre tempi di inferenza più rapidi, risultando adatto ai casi d'uso in cui la velocità è fondamentale, come le raccomandazioni di prodotti per l'e-commerce o i sistemi di assistenza in tempo reale.

Ecco invece alcuni ambiti in cui PaliGemma 2 potrebbe presentare dei limiti:

  • Latenza: per quanto potenti, i modelli più grandi potrebbero presentare problemi di latenza, soprattutto quando vengono distribuiti per attività che richiedono risposte immediate, come i sistemi di IA interattivi in tempo reale.
  • Dipendenza da dataset di grandi dimensioni: le prestazioni di PaliGemma 2 sono strettamente legate alla qualità e alla diversità dei suoi dataset di addestramento, il che potrebbe limitarne l'efficacia in domini sottorappresentati o in lingue non incluse nei dati di addestramento.
  • Elevati requisiti di risorse: nonostante le ottimizzazioni, le versioni con 10B e 28B parametri richiedono una potenza di calcolo significativa, risultando meno accessibili alle organizzazioni più piccole con risorse limitate.

Punti chiave#

PaliGemma 2 rappresenta un interessante progresso nel campo dei modelli di visione-linguaggio e offre maggiore scalabilità, flessibilità nel fine-tuning e accuratezza. Può fungere da strumento prezioso per applicazioni che spaziano dalle soluzioni per l'accessibilità e dall'e-commerce alla diagnostica sanitaria e all'istruzione.

Sebbene presenti alcuni limiti, come i requisiti computazionali e la dipendenza da dati di alta qualità, i suoi punti di forza lo rendono una scelta pratica per affrontare attività complesse che integrano dati visivi e testuali. PaliGemma 2 può fornire una base solida a ricercatori e sviluppatori che vogliono esplorare e ampliare il potenziale dell'IA nelle applicazioni multimodali.

Partecipa alla conversazione sull'IA visitando il nostro repository GitHub e la nostra community. Scopri come l'IA sta facendo progressi nell'agricoltura e nell'assistenza sanitaria! 🚀

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning