Ultralytics YOLO27:
AI per la visione

I modelli Google Gemini Robotics stanno potenziando robot più intelligenti

Scopri come Google Gemini Robotics potenzia i robot basati sull'AI con intelligenza multimodale, migliorando adattabilità, destrezza e interazione fluida con le persone.

ABAbirami Vina9 min read
I modelli Google Gemini Robotics potenziano robot più intelligenti

Da decenni, i robot simboleggiano il futuro, comparendo nei laboratori di ricerca, nei film di fantascienza e nelle dimostrazioni di prototipi industriali all'avanguardia. Ora, grazie ai recenti progressi dell'intelligenza artificiale (AI), questi prototipi stanno andando oltre gli ambienti controllati per entrare nelle applicazioni del mondo reale.

In particolare, con Gemini Robotics, Google si avvicina alla tecnologia necessaria per costruire robot più intelligenti. Lanciati il 12 marzo 2025, il modello Gemini Robotics e il suo modello complementare, Gemini Robotics-ER (ragionamento incarnato), sono le ultime innovazioni di Google DeepMind.

Sono costruiti su Gemini 2.0, un modello linguistico di grandi dimensioni multimodale (LLM) in grado di elaborare e generare vari tipi di dati, tra cui testo, immagini, audio e video, facilitando interazioni più versatili e naturali. Questi modelli portano le capacità multimodali di Gemini 2.0 nel mondo fisico, consentendo di realizzare robot più agili, interattivi e intelligenti.

Per esempio, a differenza dei robot tradizionali che seguono istruzioni fisse, i robot integrati con i modelli Gemini Robotics possono elaborare informazioni visive e linguistiche. Questo permette loro di prendere decisioni in tempo reale e di adattarsi ai cambiamenti dell'ambiente.

In questo articolo esploreremo Gemini Robotics e Gemini Robotics-ER, il funzionamento di questi modelli e le loro principali funzionalità e applicazioni. Iniziamo!

Gemini Robotics aiuta i robot a eseguire più attività in modo efficiente

Fig. 1. Gemini Robotics aiuta i robot a eseguire più attività in modo efficiente.

Presentazione di Google Gemini Robotics#

Gemini Robotics di Google è un modello di AI avanzato progettato per dare ai robot la capacità di percepire, ragionare e interagire nel mondo fisico. In quanto modello visione-linguaggio-azione (VLA), consente ai robot di elaborare istruzioni, interpretare l'ambiente circostante ed eseguire attività complesse con elevata precisione.

Nel frattempo, il modello Gemini Robotics-ER migliora la capacità di un robot di comprendere le relazioni spaziali: come sono posizionati gli oggetti, come si muovono e come interagiscono. Questo aiuta i robot ad anticipare le azioni e ad adeguare di conseguenza i propri movimenti.

Per esempio, considera un'attività in cui un robot deve avvolgere un filo intorno a una cuffia. Gemini Robotics-ER lo aiuta a comprendere la scena, riconoscere la forma e la flessibilità del filo, identificare la struttura della cuffia e prevedere come il filo si piegherà durante il movimento. Gemini Robotics traduce quindi questa comprensione in azione, coordinando entrambe le mani per manipolare il filo senza intoppi, regolando la presa per evitare che si aggrovigli e assicurando un avvolgimento saldo.

Combinando percezione e azione, Gemini Robotics e Gemini Robotics-ER creano un sistema intelligente che consente ai robot di eseguire in modo efficiente attività agili in ambienti dinamici.

Panoramica della famiglia di modelli Gemini Robotics

Fig. 2. Panoramica della famiglia di modelli Gemini Robotics.

L'AI nella robotica: come funziona Gemini Robotics#

Diamo ora un'occhiata più da vicino a ciascun modello per comprendere meglio come Gemini Robotics e Gemini Robotics-ER collaborano, bilanciando flessibilità e rapidità d'azione.

Da un lato, Gemini Robotics-ER sfrutta due meccanismi chiave: la generazione di codice zero-shot e l'apprendimento in contesto con pochi esempi (ICL). Con la generazione di codice zero-shot, il modello può creare codice per controllare il robot sulla base delle istruzioni dell'attività, delle immagini e dei dati in tempo reale, senza richiedere ulteriore addestramento.

Analogamente, con il few-shot learning, il modello si adatta a nuove attività imparando da pochi esempi, riducendo la necessità di un addestramento esteso. Insieme, questi metodi consentono al robot di eseguire rapidamente attività complesse e di adattarsi a nuove sfide con il minimo sforzo.

Gemini Robotics, d'altra parte, è progettato per la velocità e l'efficienza. Utilizza un sistema ibrido costituito da un backbone basato sul cloud e da un decoder delle azioni integrato. Il backbone basato sul cloud elabora rapidamente le informazioni, con una latenza tra query e risposta inferiore a 160 millisecondi.

Il decoder integrato aiuta quindi a tradurre questi dati in azioni in tempo reale. Questo sistema combinato raggiunge un tempo di risposta complessivo di circa 250 millisecondi, con una velocità di controllo di 50 azioni al secondo.

Come Gemini Robotics supporta il controllo dei robot in tempo reale

Fig. 3. Come Gemini Robotics supporta il controllo dei robot in tempo reale.

Principali capacità di Gemini Robotics#

Ecco una rapida panoramica delle principali funzionalità di Gemini Robotics:

  • Generalità: può adattarsi ai cambiamenti nell'illuminazione, negli sfondi e negli oggetti mantenendo un'elevata accuratezza. Comprende inoltre comandi parafrasati o multilingue e può adeguare i movimenti a condizioni diverse.

  • Interattività: questo modello può elaborare un'ampia gamma di comandi in linguaggio naturale e rispondere in modo intuitivo. Adegua inoltre le proprie azioni in base ai cambiamenti dell'ambiente in tempo reale, risultando ideale per la collaborazione uomo-robot.

  • Agilità: un robot alimentato da questo modello può eseguire attività complesse e precise, come piegare origami o maneggiare oggetti delicati. Che si tratti di un processo passo dopo passo o di azioni rapide, il modello può aiutare a eseguirle in modo efficiente.

  • Molteplici embodiment: funziona su diverse piattaforme robotiche, come i sistemi bi-braccio e i robot umanoidi, con un fine-tuning minimo. Si adatta rapidamente a nuove attività mantenendo prestazioni elevate.

Google Gemini Robotics opera su diverse piattaforme robotiche

Fig. 4. Google Gemini Robotics opera su diverse piattaforme robotiche.

Principali capacità di Gemini Robotics-ER#

Ecco alcune delle principali funzionalità di Gemini Robotics-ER che aiutano i robot a comprendere e interagire con il mondo:

  • Rilevamento e tracciamento degli oggetti: può essere utilizzato per identificare e tracciare oggetti negli spazi 2D e 3D. Utilizzando query in linguaggio naturale, aiuta i robot a trovare gli oggetti e a prevederne la posizione, in base al tipo, alla posizione o alla funzione.

  • Pointing: questa funzionalità consente al modello di individuare con precisione oggetti o parti specifiche all'interno di un'immagine usando coordinate precise. Può aiutare i robot a localizzare oggetti interi, parti di oggetti o persino spazi vuoti.

  • Predizione della presa: Gemini Robotics-ER può essere utilizzato per determinare il modo migliore di afferrare gli oggetti in base alla loro forma e funzione. Prevede il punto di presa, che si tratti di una banana o del manico di una tazza, consentendo ai robot di maneggiare gli oggetti con cura.

  • Ragionamento sulla traiettoria: il modello può pianificare i percorsi di movimento prevedendo sequenze di azioni. Per esempio, può guidare la mano di un robot verso uno strumento o definire waypoint per un'attività specifica, aiutando il robot a completare le attività in modo efficiente.

  • Corrispondenza multi-vista: questa funzionalità aiuta il modello a comprendere le strutture 3D confrontando l'aspetto degli oggetti da angolazioni diverse. Può essere utilizzata per migliorare il ragionamento spaziale, consentendo ai robot di interagire meglio con gli oggetti negli ambienti dinamici.

Gemini Robotics-ER gestisce una varietà di attività

Fig. 5. Gemini Robotics-ER può gestire una varietà di attività.

Applicazioni dei modelli Google Gemini Robotics#

Ora che abbiamo discusso le principali capacità di Gemini Robotics e Gemini Robotics-ER, analizziamone le applicazioni nel mondo reale in vari settori.

Google Gemini Robotics può essere utilizzato nella produzione#

Quando si parla di produzione, precisione e velocità sono importanti, ma è l'adattabilità a far funzionare davvero tutto senza intoppi. Per esempio, un robot industriale alimentato da Gemini può assemblare un sistema di pulegge identificando i componenti corretti, posizionandoli correttamente e maneggiando un elastico con una forza precisa.

Può tendere l'elastico, avvolgerlo intorno alle pulegge e fissarlo senza romperlo o causare disallineamenti. Se la configurazione cambia o l'attività varia, il robot può adattarsi senza bisogno di una riprogrammazione estesa. Questa automazione intelligente riduce gli errori, migliora l'efficienza e mantiene fluidi i processi produttivi.

Un robot industriale bi-braccio inserisce un elastico in un sistema di pulegge

Fig. 6. Un robot industriale bi-braccio inserisce con precisione un elastico in un sistema di pulegge.

Case intelligenti abilitate da Gemini Robotics#

Gli impegni quotidiani possono rendere difficile stare al passo con le faccende domestiche. I robot intelligenti possono occuparsi di attività come pulire, ordinare la spesa e persino aiutare a preparare i pasti, rendendo la vita quotidiana più semplice.

Per esempio, un robot potrebbe preparare una borsa per il pranzo, selezionando e riponendo con cura gli alimenti al suo interno e regolando la presa per proteggere oggetti fragili come frutta o lattine. Anche se la disposizione cambia, il robot può adattarsi autonomamente, alleggerendo le faccende quotidiane con una supervisione minima.

Un robot umanoide prepara con cura una borsa per il pranzo

Fig. 7. Un robot umanoide prepara con cura una borsa per il pranzo.

Pro e contro dell'utilizzo di Gemini Robotics#

Gemini Robotics amplia ciò che i robot possono fare, dalla produzione precisa all'assistenza domestica intelligente. Ecco alcuni vantaggi chiave dell'utilizzo di Gemini Robotics in diverse applicazioni:

  • Requisiti di addestramento minimi: a differenza dei robot tradizionali, i robot basati su Gemini Robotics possono imparare da poche dimostrazioni, riducendo i costi di addestramento e rendendoli più facili da implementare.
  • Maggiore sicurezza: negli ambienti pericolosi, i robot integrati con Gemini Robotics possono eseguire attività rischiose, riducendo il rischio di lesioni per i lavoratori.
  • Funzionalità personalizzabili: la flessibilità di Gemini Robotics consente di adattarlo alle esigenze specifiche di diversi settori o singole aziende, permettendo applicazioni specializzate e soluzioni uniche.

Sebbene Gemini Robotics offra diversi vantaggi, è importante affrontare anche i seguenti limiti:

  • Difficoltà nelle relazioni spaziali: questi modelli possono avere difficoltà a tenere traccia delle relazioni spaziali nel corso di lunghe sequenze video, compromettendo la capacità di tracciare e comprendere gli oggetti nel tempo.
  • Mancanza di precisione numerica: le predizioni del modello, come punti e bounding box, potrebbero non essere sufficientemente precise per le attività che richiedono un controllo raffinato, come le attività robotiche delicate.
  • Attività complesse: Gemini Robotics può avere difficoltà a gestire attività complesse che richiedono ragionamento in più passaggi e movimenti precisi, soprattutto in situazioni nuove o non familiari.

Il futuro dell'AI nella robotica#

Con il continuo progresso dell'AI, modelli come Gemini Robotics e Gemini Robotics-ER stanno plasmando il futuro della robotica. I futuri miglioramenti si concentreranno probabilmente sul potenziamento del ragionamento in più passaggi, consentendo ai robot di suddividere le attività in passaggi logici per una maggiore precisione.

Un'altra area di sviluppo chiave su cui Google DeepMind prevede di lavorare è l'addestramento basato sulla simulazione. Imparando in ambienti virtuali prima dell'implementazione nel mondo reale, i robot possono perfezionare il processo decisionale e i movimenti, riducendo al minimo gli errori nelle applicazioni pratiche.

Con l'evolversi di queste tecnologie, potrebbero aprire la strada a un futuro in cui i robot saranno più autonomi, adattabili e capaci di lavorare perfettamente al fianco degli esseri umani nella vita quotidiana.

Punti chiave#

Gemini Robotics rappresenta un grande passo avanti nell'automazione basata sull'AI, collegando l'intelligenza digitale alle attività fisiche del mondo reale. Combinando visione, linguaggio e apprendimento basato sull'azione, questi robot possono gestire attività complesse con precisione e adattabilità.

Man mano che i robot diventano più intelligenti, probabilmente svolgeranno un ruolo sempre più importante nella vita quotidiana, trasformando il modo in cui esseri umani e macchine collaborano. Questo progresso ci avvicina a un mondo intelligente e più connesso, in cui l'automazione basata sull'AI migliora sia i settori industriali sia le attività quotidiane.

Entra a far parte della nostra community in crescita! Visita il nostro repository GitHub per approfondire l'AI. Vuoi iniziare i tuoi progetti di computer vision? Dai un'occhiata alle nostre opzioni di licenza. Scopri di più sull'AI nella produzione e sulla Vision AI nel settore automobilistico nelle nostre pagine dedicate alle soluzioni!

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning