Scopri in modo pratico Google Gemini 2.5 per attività di computer vision
Scopri in modo pratico Google Gemini 2.5 per attività di computer vision come il rilevamento degli oggetti, la generazione di didascalie per immagini e l'OCR per soluzioni di Vision AI.

I progressi nell’AI procedono rapidamente e quasi ogni giorno nuove innovazioni conquistano i titoli delle notizie. Una di queste recenti svolte è Gemini 2.5, l’ultimo modello multimodale di Google DeepMind, lanciato il 26 marzo. Mentre i tradizionali grandi modelli linguistici (LLMs) possono apprendere da enormi quantità di dati per generare testo simile a quello umano, Gemini 2.5 va oltre.
È progettato come un “modello di ragionamento” in grado di elaborare immagini, audio e video. Offre capacità avanzate di ragionamento e programmazione. È interessante notare che offre prestazioni eccezionali anche nelle attività di visione artificiale, in cui le macchine interpretano e analizzano dati visivi, come il rilevamento degli oggetti, la descrizione delle immagini e il riconoscimento ottico dei caratteri (OCR).

Fig. 1. Un esempio di utilizzo di Gemini 2.5 per comprendere il contenuto di un’immagine.
In questo articolo analizzeremo uno dei notebook di Ultralytics che può aiutarti a sperimentare in prima persona le capacità di visione artificiale di Gemini 2.5. Esamineremo anche più da vicino le funzionalità principali di Gemini 2.5 e mostreremo come può essere utilizzato per creare soluzioni di visione artificiale per applicazioni reali. Iniziamo!
Panoramica di Gemini 2.5: funzionalità e capacità#
La prima versione della serie di modelli Gemini 2.5 appena rilasciata è una versione sperimentale di Gemini 2.5 Pro. È progettata per gestire problemi complessi ragionando sulle proprie risposte prima di fornire una risposta. Utilizza metodi come l’apprendimento per rinforzo (in cui il modello apprende dai feedback) e il prompting chain-of-thought (un approccio passo dopo passo alla risoluzione dei problemi).
Una delle sue funzionalità principali è la sua enorme finestra di contesto, che può contenere 1 milione di token (circa un milione di parole o parti di parole) e dovrebbe arrivare a 2 milioni. Ciò significa che il modello può acquisire una grande quantità di informazioni contemporaneamente, producendo risultati più dettagliati e accurati.
Oltre a elaborare il linguaggio, Gemini 2.5 può essere utilizzato per le seguenti attività di visione artificiale:
-
Rilevamento degli oggetti: è il processo di identificazione e localizzazione degli oggetti all’interno di un’immagine. Può essere utilizzato in applicazioni come la videosorveglianza o le auto a guida autonoma.
-
Descrizione delle immagini: questa attività consiste nel generare un testo descrittivo per un’immagine. Rende i contenuti visivi più accessibili e facili da comprendere.
-
Riconoscimento ottico dei caratteri: questa tecnologia converte il testo presente nelle immagini in testo modificabile e leggibile dalle macchine. È utile per digitalizzare i documenti e automatizzare l’inserimento dei dati.
Benchmark e confronto tra Google Gemini 2.5 e altri modelli#
Oggi sono disponibili diversi modelli multimodali nel settore dell’AI, quindi è importante capire come Gemini 2.5 Pro si confronta con essi. In base ai risultati dei benchmark condivisi da DeepMind di Google, Gemini 2.5 Pro mostra prestazioni impressionanti in un’ampia gamma di attività.
Ad esempio, in un test chiamato Humanity’s Last Exam, che simula un esame complesso su molte materie e valuta il ragionamento avanzato e la conoscenza generale, Gemini 2.5 Pro raggiunge circa il 18,8%, superando modelli come o3-mini di OpenAI, che ottiene circa il 14%.

Fig. 2. Panoramica delle prestazioni di Gemini 2.5 Pro nei benchmark.
Offre inoltre prestazioni molto elevate nelle sfide di matematica e programmazione, eguagliando o spesso superando le prestazioni di modelli come OpenAI GPT-4.5, Claude 3.7 Sonnet, Grok 3 Beta e DeepSeek R1, dimostrando la sua capacità di gestire attività complesse ed elaborare grandi quantità di dati.
Sperimentare Gemini 2.5: come utilizzare la Google Gemini API#
Gemini 2.5 Pro è disponibile su diverse piattaforme. Puoi sperimentarlo in Google AI Studio e accedervi tramite l’app Gemini se sei un utente Gemini Advanced. Nell’annuncio del lancio, Google DeepMind ha inoltre dichiarato che il modello sarà presto supportato su Vertex AI. Questi punti di accesso permettono agli sviluppatori di utilizzare facilmente Gemini 2.5 Pro per applicazioni di AI reali.
Tuttavia, se vuoi utilizzare la Google Gemini API e iniziare in pochi minuti senza configurazioni complicate, oltre ad approfondire le sue capacità di visione artificiale, puoi consultare il notebook di Ultralytics, che mostra attività come il rilevamento degli oggetti e la descrizione delle immagini con Gemini 2.5 Pro. Vediamo nel dettaglio cosa puoi aspettarti dal notebook.
Configurazione dell’inferenza con il notebook Google Gemini 2.5#
Per iniziare a utilizzare il notebook di Ultralytics e Google Gemini 2.5, dovrai prima generare una chiave API tramite Google AI Studio. Questa chiave ti dà accesso alla Gemini API, così puoi utilizzare il modello.
Dopo aver ottenuto la chiave API, assicurati che nel tuo ambiente siano installate le librerie necessarie, inclusi i pacchetti di Ultralytics e il toolkit AI di Google. Questo passaggio è illustrato chiaramente nel notebook, quindi puoi seguire facilmente le istruzioni per configurare il tuo workspace.
Dopo aver configurato tutto, puoi connetterti alla Gemini API inserendo la tua chiave API (come mostrato di seguito), creando un collegamento tra il tuo workspace e il modello. Dopodiché, sarai pronto a inviare immagini e prompt testuali a Gemini 2.5.
In sostanza, puoi fornire al modello un’immagine e una semplice istruzione (come “rileva gli oggetti in questa immagine” o “descrivi ciò che vedi”), che restituirà i risultati di cui hai bisogno. Questo processo intuitivo semplifica l’esplorazione delle capacità di visione artificiale di Gemini 2.5.
Rilevamento degli oggetti con Google Gemini 2.5#
Uno degli esempi principali del notebook è il rilevamento degli oggetti con Gemini 2.5 Pro. In questo esempio, fornisci al modello un’immagine e un semplice prompt per rilevare gli oggetti.
Il modello elabora l’immagine e restituisce un insieme di coordinate ed etichette per ogni oggetto individuato; queste coordinate sono fornite in forma normalizzata. Le funzioni del pacchetto Python di Ultralytics vengono quindi utilizzate per convertire questi valori normalizzati in modo che corrispondano alle dimensioni effettive dell’immagine e per disegnare riquadri di delimitazione chiari intorno a ogni oggetto, come mostrato di seguito.

Fig. 3. Utilizzo di Google Gemini 2.5 per il rilevamento degli oggetti.
Descrizione delle immagini con Gemini 2.5#
Un altro esempio interessante nel notebook è la descrizione delle immagini con Gemini 2.5 Pro. In questo esempio, fornisci al modello un’immagine e un prompt che gli chiede di generare una descrizione dettagliata di ciò che appare nell’immagine.
Il modello analizza quindi il contenuto visivo e restituisce una narrazione, spesso formattata come più frasi, che rappresenta sia il contenuto sia il contesto dell’immagine. Questa funzionalità è utile per migliorare l’accessibilità, riassumere le informazioni visive e persino arricchire la narrazione creativa.
Migliorare l’accuratezza dell’OCR con i modelli Google Gemini#
Un’attività di visione artificiale che sfrutta la capacità di Gemini 2.5 Pro di leggere il testo nelle immagini è l’OCR. Nel notebook, puoi fornire al modello un’immagine contenente del testo insieme a un prompt per estrarlo. Il modello elabora l’immagine e restituisce sia il testo rilevato sia le coordinate della posizione del testo, come mostrato di seguito.
Le funzioni del pacchetto Python di Ultralytics vengono quindi utilizzate per convertire queste coordinate normalizzate nelle dimensioni effettive dell’immagine e disegnare riquadri di delimitazione intorno alle aree di testo. Questo output annotato rende chiara la posizione del testo, risultando utile per digitalizzare i documenti, automatizzare l’inserimento dei dati e migliorare l’accessibilità.

Fig. 4. Estrazione di dati testuali da un’immagine con Google Gemini 2.5.
Applicazioni reali di Google Gemini 2.5#
Ora che abbiamo visto come Google Gemini 2.5 Pro può essere utilizzato per varie attività di visione artificiale, esploriamo alcune applicazioni reali in cui queste capacità possono essere impiegate.
La capacità di Gemini 2.5 Pro di rilevare gli oggetti, ad esempio, può aiutare a etichettare e organizzare automaticamente grandi raccolte di immagini, rendendo molto più rapide attività come la creazione di dataset o la gestione dei contenuti. Può inoltre essere utilizzato per analizzare immagini in settori come la vendita al dettaglio e l’agricoltura, ad esempio rilevando prodotti sugli scaffali o identificando segnali di stress delle colture nelle foto scattate nei campi.

Fig. 5. Gemini 2.5 Pro analizza lo stato di salute di una pianta.
Nel frattempo, la funzionalità di descrizione delle immagini del modello può aiutare gli utenti ipovedenti a comprendere cosa appare in un’immagine. Ad esempio, se hai una foto di una strada trafficata, il modello potrebbe produrre una descrizione dettagliata della scena, indicando i tipi di veicoli, l’attività dei pedoni e persino l’ora del giorno in base agli indizi forniti dall’illuminazione.
Inoltre, la funzionalità OCR di Gemini 2.5 può essere utilizzata in numerose applicazioni. Ad esempio, puoi digitalizzare documenti stampati scansionando pagine o ricevute. Questa capacità è ideale per automatizzare le attività di inserimento dei dati, elaborare moduli o persino leggere il testo da biglietti da visita e insegne.
Nel complesso, Google Gemini 2.5 Pro apre le porte a un’ampia gamma di applicazioni pratiche di AI.
Punti chiave#
Oltre a generare e analizzare testo, Google Gemini 2.5 Pro può essere utilizzato per attività di visione artificiale come il rilevamento degli oggetti, la descrizione delle immagini e l’OCR. Grazie alla sua enorme finestra di contesto e alle capacità avanzate di ragionamento, produce risultati dettagliati e consapevoli del contesto, efficaci negli scenari reali.
Con la continua evoluzione dei modelli di AI, strumenti come Gemini 2.5 Pro semplificano la risoluzione di problemi complessi in diversi settori. È probabile che l’adozione dell’AI si diffonda ulteriormente, poiché un numero crescente di organizzazioni cerca soluzioni flessibili e multimodali in grado di gestire un’ampia gamma di attività, dalla comprensione visiva all’elaborazione del linguaggio.
Entra a far parte della nostra community e scopri progetti di AI all’avanguardia nel nostro repository GitHub. Scopri le applicazioni della Vision AI nell’agricoltura e il ruolo dell’AI nel settore manifatturiero nelle nostre pagine dedicate alle soluzioni. Esplora i nostri piani di licenza e crea oggi stesso soluzioni di visione artificiale!









