YOLO Vision 2026:
Vision AI

Google PaliGemma 2: Approfondimenti sui modelli VLM avanzati

Unisciti a noi mentre esaminiamo da vicino i nuovi modelli vision-language di Google: PaliGemma 2. Questi modelli possono aiutare a comprendere e analizzare sia immagini che testo.

ABAbirami Vina4 min read
Il modello vision-language PaliGemma 2 di Google

Il 5 dicembre 2024, Google ha introdotto PaliGemma 2, l'ultima versione del suo modello di visione-linguaggio (VLM) all'avanguardia. PaliGemma 2 è progettato per gestire attività che combinano immagini e testo, come la generazione di didascalie, la risposta a domande visive e il rilevamento di oggetti nelle immagini.

Basandosi sul PaliGemma originale, che era già un solido strumento per la didascalia multilingue e il riconoscimento degli oggetti, PaliGemma 2 apporta diversi miglioramenti chiave. Questi includono dimensioni del modello maggiori, supporto per immagini a più alta risoluzione e prestazioni migliori su attività visive complesse. Questi aggiornamenti lo rendono ancora più flessibile ed efficace per un'ampia gamma di usi.

In questo articolo, esamineremo più da vicino PaliGemma 2, compreso il suo funzionamento, le caratteristiche principali e le applicazioni in cui eccelle. Iniziamo!

Da Gemma 2 a PaliGemma 2#

PaliGemma 2 si basa su due tecnologie chiave: il codificatore visivo SigLIP e il modello linguistico Gemma 2. Il codificatore SigLIP elabora dati visivi, come immagini o video, e li scompone in caratteristiche che il modello può analizzare. Nel frattempo, Gemma 2 gestisce il testo, consentendo al modello di comprendere e generare linguaggio multilingue. Insieme, formano un VLM, progettato per interpretare e collegare in modo fluido informazioni visive e testuali.

Ciò che rende PaliGemma 2 un importante passo avanti è la sua scalabilità e versatilità. A differenza della versione originale, PaliGemma 2 è disponibile in tre dimensioni: 3 miliardi (3B), 10 miliardi (10B) e 28 miliardi (28B) di parametri. Questi parametri sono come le impostazioni interne del modello e lo aiutano ad apprendere ed elaborare i dati in modo efficace. Supporta inoltre diverse risoluzioni di immagine (ad esempio, 224 x 224 pixel per attività rapide e 896 x 896 per analisi dettagliate), rendendolo adattabile a varie applicazioni.

Una panoramica di PaliGemma 2

Fig 1. Una panoramica di PaliGemma 2.

L'integrazione delle avanzate capacità linguistiche di Gemma 2 con l'elaborazione delle immagini di SigLIP rende PaliGemma 2 significativamente più intelligente. Può gestire attività come:

  • Didascalie per immagini o video: Il modello può generare descrizioni testuali dettagliate di elementi visivi, rendendolo utile per creare automaticamente didascalie.
  • Visual question answering: PaliGemma 2 può rispondere a domande basate su immagini, come identificare oggetti, persone o azioni in una scena.
  • Riconoscimento degli oggetti: Identifica ed etichetta gli oggetti all'interno di un'immagine, come distinguere tra un gatto, un tavolo o un'auto in una foto.

PaliGemma 2 va oltre l'elaborazione separata di immagini e testo: li unisce in modi significativi. Ad esempio, può comprendere le relazioni in una scena, come riconoscere che "Il gatto è seduto sul tavolo", o identificare oggetti aggiungendo contesto, come riconoscere un monumento famoso.

Come funzionano i modelli VLM PaliGemma 2 di Google#

Successivamente, esamineremo un esempio utilizzando il grafico mostrato nell'immagine seguente per comprendere meglio come PaliGemma 2 elabora dati visivi e testuali. Supponiamo che tu carichi questo grafico e chieda al modello: "Cosa rappresenta questo grafico?"

Un esempio delle capacità di PaliGemma 2

Fig 2. Un esempio delle capacità di PaliGemma 2.

Il processo inizia con il codificatore visivo SigLIP di PaliGemma 2 per analizzare le immagini ed estrarre le caratteristiche chiave. Per un grafico, questo include l'identificazione di elementi come assi, punti dati ed etichette. Il codificatore è addestrato a catturare sia modelli generali che dettagli fini. Utilizza anche il riconoscimento ottico dei caratteri (OCR) per rilevare ed elaborare qualsiasi testo incorporato nell'immagine. Queste caratteristiche visive vengono convertite in token, che sono rappresentazioni numeriche che il modello può elaborare. Questi token vengono quindi regolati utilizzando un livello di proiezione lineare, una tecnica che assicura che possano essere combinati senza problemi con i dati testuali.

Allo stesso tempo, il modello linguistico Gemma 2 elabora la query di accompagnamento per determinarne il significato e l'intento. Il testo della query viene convertito in token, e questi vengono combinati con i token visivi di SigLIP per creare una rappresentazione multimodale, un formato unificato che collega dati visivi e testuali.

Utilizzando questa rappresentazione integrata, PaliGemma 2 genera una risposta passo dopo passo attraverso la decodifica autoregressiva, un metodo in cui il modello prevede una parte della risposta alla volta in base al contesto che ha già elaborato.

Capacità chiave di PaliGemma 2#

Ora che abbiamo capito come funziona, esploriamo le caratteristiche chiave che rendono PaliGemma 2 un modello di visione-linguaggio affidabile:

  • Flessibilità di fine-tuning: Si adatta facilmente a set di dati e attività specifici, ottenendo ottimi risultati in applicazioni come la generazione di didascalie di immagini, il ragionamento spaziale e l'imaging medico.
  • Dati di addestramento diversi: Addestrato su set di dati come WebLI e OpenImages, il che gli conferisce forti capacità di riconoscimento degli oggetti e capacità di output multilingue.
  • Integrazione OCR: include il riconoscimento ottico dei caratteri per estrarre e interpretare il testo dalle immagini, rendendolo ideale per l'analisi di documenti e altre attività basate sul testo.
  • Output multilingue: genera didascalie e risposte in più lingue, ideale per applicazioni globali.
  • Integrazione con gli strumenti: È compatibile con framework come Hugging Face Transformers, PyTorch e Keras, consentendo una facile distribuzione e sperimentazione.

Confronto tra PaliGemma 2 e PaliGemma: cosa è migliorato?#

Dare un'occhiata all'architettura della prima versione di PaliGemma è un buon modo per vedere i miglioramenti di PaliGemma 2. Uno dei cambiamenti più notevoli è la sostituzione del modello linguistico originale Gemma con Gemma 2, che apporta sostanziali miglioramenti sia in termini di prestazioni che di efficienza.

Gemma 2, disponibile in dimensioni di parametri da 9B e 27B, è stato progettato per offrire precisione e velocità leader della categoria riducendo al contempo i costi di distribuzione. Ci riesce attraverso un'architettura ridisegnata ottimizzata per l'efficienza dell'inferenza su varie configurazioni hardware, da potenti GPU a configurazioni più accessibili.

Uno sguardo alla prima versione di PaliGemma

Fig 3. Uno sguardo alla prima versione di PaliGemma 2.

Di conseguenza, PaliGemma 2 è un modello altamente preciso. La versione da 10B di PaliGemma 2 ottiene un punteggio NES (Non-Entailment Sentence) inferiore di 20,3, rispetto al 34,3 del modello originale, il che significa meno errori fattuali nei suoi output. Questi progressi rendono PaliGemma 2 più scalabile, preciso e adattabile a una gamma più ampia di applicazioni, dalle didascalie dettagliate alla risposta a domande visive.

Applicazioni di PaliGemma 2: utilizzi nel mondo reale per i modelli VLM#

PaliGemma 2 ha il potenziale per ridefinire i settori combinando perfettamente la comprensione visiva e linguistica. Ad esempio, per quanto riguarda l'accessibilità, può generare descrizioni dettagliate di oggetti, scene e relazioni spaziali, fornendo un aiuto fondamentale agli individui ipovedenti. Questa capacità aiuta gli utenti a comprendere meglio i loro ambienti, offrendo maggiore indipendenza quando si tratta di attività quotidiane.

PaliGemma 2 può rendere il mondo un luogo più accessibile

Fig 4. PaliGemma 2 può rendere il mondo un luogo più accessibile.

Oltre all'accessibilità, PaliGemma 2 sta avendo un impatto in vari settori, tra cui:

  • E-commerce: Il modello migliora la categorizzazione dei prodotti analizzando e descrivendo gli articoli nelle immagini, semplificando la gestione dell'inventario e migliorando l'esperienza di ricerca per gli utenti.
  • Sanità: Supporta i professionisti medici interpretando l'imaging medico, come radiografie e risonanze magnetiche, insieme alle note cliniche per fornire diagnosi più accurate e informate.
  • Istruzione: PaliGemma 2 aiuta gli educatori a creare materiali di apprendimento descrittivi e accessibili generando didascalie e fornendo informazioni contestuali per le immagini.
  • Creazione di contenuti: Il modello automatizza il processo di generazione di didascalie e descrizioni visive per contenuti multimediali, facendo risparmiare tempo ai creatori.

Provalo tu stesso: PaliGemma 2#

Per provare PaliGemma 2, puoi iniziare con la demo interattiva di Hugging Face. Ti consente di esplorare le sue capacità in attività come la didascalia di immagini e la risposta a domande visive. Carica semplicemente un'immagine e poni al modello domande al riguardo o richiedi una descrizione della scena.

Una demo di PaliGemma 2

Fig 5. Una demo di PaliGemma 2 (Fonte: Hugging Face).

Se vuoi approfondire, ecco come puoi iniziare a sperimentare:

  • Modelli pre-addestrati: Puoi accedere a modelli pre-addestrati e codice da piattaforme come Hugging Face e Kaggle. Queste risorse forniscono tutto il necessario per iniziare a lavorare con il modello.
  • Notebook: Sono disponibili documentazione completa e notebook di esempio per familiarizzare con PaliGemma 2. Puoi iniziare con esempi di inferenza e sperimentare il fine-tuning del modello sul tuo dataset per attività specifiche.
  • Integrazioni: PaliGemma 2 è compatibile con framework ampiamente utilizzati come Hugging Face Transformers, Keras, PyTorch, JAX e Gemma.cpp, consentendoti di integrarlo nei tuoi flussi di lavoro esistenti senza sforzo.

Pro e contro di PaliGemma 2 di Google#

Dopo aver capito come iniziare con PaliGemma 2, diamo un'occhiata più da vicino ai suoi principali punti di forza e limiti da tenere a mente quando si utilizzano questi modelli.

Ecco cosa rende PaliGemma 2 un modello di visione-linguaggio di spicco:

  • Guadagni in efficienza: Sfruttando l'architettura ottimizzata di Gemma 2, PaliGemma 2 offre prestazioni elevate minimizzando i costi di implementazione.
  • Funzionalità di sicurezza migliorate: PaliGemma 2 include significativi miglioramenti della sicurezza nel suo processo di addestramento, come un filtraggio robusto dei dati di pre-addestramento per ridurre i pregiudizi e una rigorosa valutazione rispetto ai benchmark di sicurezza.
  • Bassa latenza per configurazioni più piccole: Il modello 3B offre tempi di inferenza più rapidi, rendendolo adatto a casi d'uso in cui la velocità è fondamentale, come raccomandazioni di prodotti e-commerce o sistemi di supporto dal vivo.

Nel frattempo, ecco alcune aree in cui PaliGemma 2 potrebbe incontrare limitazioni:

  • Latenza: sebbene potenti, i modelli più grandi potrebbero affrontare problemi di latenza, specialmente quando distribuiti per attività che richiedono risposte immediate, come sistemi di AI interattivi in tempo reale.
  • Dipendenza da grandi dataset: le prestazioni di PaliGemma 2 sono strettamente legate alla qualità e alla diversità dei suoi dataset di addestramento, il che potrebbe limitarne l'efficacia in domini sottorappresentati o lingue non incluse nei dati di addestramento.
  • Elevati requisiti di risorse: Nonostante le ottimizzazioni, le versioni con parametri 10B e 28B richiedono una notevole potenza di calcolo, rendendole meno accessibili alle organizzazioni più piccole con risorse limitate.

Punti chiave#

PaliGemma 2 è un affascinante progresso nella modellazione visione-linguaggio, che offre scalabilità migliorata, flessibilità di fine-tuning e accuratezza. Può fungere da strumento prezioso per applicazioni che vanno dalle soluzioni di accessibilità all'e-commerce fino alla diagnostica sanitaria e all'istruzione.

Sebbene presenti limitazioni, come i requisiti computazionali e la dipendenza da dati di alta qualità, i suoi punti di forza lo rendono una scelta pratica per affrontare attività complesse che integrano dati visivi e testuali. PaliGemma 2 può fornire una solida base per ricercatori e sviluppatori per esplorare ed espandere il potenziale dell'AI nelle applicazioni multimodali.

Entra a far parte della conversazione sull'IA dando un'occhiata al nostro repository GitHub e alla nostra community. Leggi di come l'IA sta facendo passi da gigante nell'agricoltura e nella sanità! 🚀

Explore solutions

Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo viaggio con il futuro del machine learning