YOLO Vision 2026:
Vision AI

Google Genie 3 dà vita al tuo mondo 3D con l'AI

Il modello mondiale AI Genie 3 di DeepMind converte prompt di testo o immagini in ambienti 3D. Questo progresso segna un altro passo verso un'intelligenza simile a quella umana.

ABAbirami Vina4 min read
Google DeepMind Genie 3 che genera un mondo 3D

Il 5 agosto 2025, Google DeepMind ha rilasciato la sua ultima versione del modello Genie, nota come Genie 3. È un nuovo modello di IA in grado di convertire i prompt testuali dell'utente in ambienti dinamici e interattivi.

Questi ambienti, o mondi IA, consentono all'utente di navigare e interagire con essi in tempo reale, proprio come in un videogioco. Puoi anche espandere o modificare l'ambiente fornendo ulteriori prompt testuali, consentendo cambiamenti immediati senza riavviare la simulazione.

Ciò che rende l'ultimo modello Google Genie particolarmente importante è che può essere utilizzato per train agenti AI. Questo comporta l'insegnamento agli AI agents a prendere decisioni o eseguire compiti utilizzando dati e feedback. Utilizzando un ambiente 3D simulato anziché il mondo reale, i ricercatori possono evitare molte delle sfide, dei costi e dei rischi dell'addestramento nel mondo reale.

Google Genie 3 può anche simulare scenari complessi, come il test di un autonomous car che guida in condizioni meteorologiche avverse o di una tuta alare che plana attraverso un terreno montuoso.

In questo articolo, esploreremo Google Genie 3 e le sue funzionalità. Iniziamo!

Frame from a Genie 3 simulation showing a wingsuit gliding

Fig 1. Un fotogramma di una simulazione di Genie 3 che mostra una tuta alare che plana. (Source)

Una breve storia dei modelli Genie di Google#

Prima di immergerci nei modelli Genie di Google DeepMind, cerchiamo di capire meglio cosa sono i modelli del mondo.

I modelli di mondo sono sistemi AI che apprendono le regole del mondo reale come la fisica, il movimento e le relazioni spaziali da datasets di testo, immagini, video e movimento. Questo consente loro di creare scene realistiche e predict come evolvono. I modelli Genie sono esempi di tali sistemi.

Ecco una rapida panoramica dei precedenti modelli Google Genie che hanno aperto la strada a Genie 3:

  • Genie 1: Genie 1, spesso chiamato semplicemente Google Genie, è stato il primo modello del mondo di IA di Google DeepMind in grado di creare ambienti virtuali interattivi. Gli utenti potevano descrivere un mondo con testo, immagini, foto o persino schizzi, e Genie lo generava, consentendo loro di controllare le azioni all'interno della scena. È stato progettato per elaborare dati video nel tempo, prevedere il fotogramma successivo e tradurre gli input dell'utente in azioni all'interno del mondo.

  • Genie 2: Basandosi sulle capacità di Google Genie, Genie 2 poteva creare una vasta gamma di mondi 3D dettagliati e interattivi. Come modello del mondo, simulava ambienti virtuali e rispondeva in modo realistico ad azioni come saltare, nuotare o spostare oggetti. Addestrato su una vasta collezione di video, presentava interazioni realistiche con gli oggetti e movimenti dei personaggi naturali.

Cos'è Genie 3? Il nuovo modello di IA di Google#

Basandosi sui modelli Genie precedenti, Genie 3 è il più recente e avanzato della serie. Si basa in particolare su Genie 2, che poteva generare nuovi ambienti virtuali, e Veo 3, l'ultimo modello di generazione video di Google DeepMind. Veo 3 dimostra una profonda comprensione della fisica e di come gli oggetti interagiscono nel mondo reale.

Mentre Veo 3 utilizza un motore fisico hard-coded, Google Genie 3 impara autonomamente come funziona la fisica utilizzando un metodo noto come apprendimento auto-supervisionato. È una AI learning technique in cui un modello AI apprende pattern e relazioni da dati non etichettati generando i propri segnali di apprendimento.

La capacità di apprendimento auto-supervisionato di Google Genie 3 è fondamentale per addestrare sistemi AI, come agenti AI o robot AI, a gestire vari compiti. Infatti, i ricercatori di Google DeepMind vedono Genie 3 come un passo importante verso la creazione di Artificial General Intelligence (AGI).

Genie 3 simulating control of a robotic rover

Fig 2. Un esempio di utilizzo di Google Genie 3 per simulare il controllo di un rover robotico. (Source)

L'AGI è una forma teorica di IA in grado di comprendere e apprendere qualsiasi compito o argomento e applicare tale conoscenza in situazioni diverse, proprio come un essere umano. A differenza degli attuali modelli di intelligenza artificiale, costruiti per compiti specifici e che faticano a trasferire le proprie competenze su nuovi problemi, l'AGI sarebbe in grado di adattarsi e apprendere in un'ampia gamma di contesti.

Caratteristiche chiave di Google Genie 3 relative alla costruzione di un mondo IA#

Ecco alcune delle caratteristiche chiave supportate da Genie 3:

  • Generazione di mondi Text-to-3D: Può trasformare un semplice prompt testuale (es. "un robot che cammina lungo la strada") in un ambiente simile al 3D giocabile con controlli di movimento di base.

  • Eventi del mondo basati su prompt: Gli utenti possono cambiare dinamicamente l'ambiente digitando nuovi comandi (es. aggiungi pioggia alla strada).

  • Memoria visiva: Genie 3 può ricordare gli oggetti lasciati nell'ambiente e consentirti di rivisitarli in seguito, con una durata di circa un minuto.

  • Output video fluido e coerente: Può mantenere un output video di 24 fps (frames per second) a una risoluzione di 720p, con un coinvolgimento maggiore rispetto a Genie 2.

Genie 3 generating longer-lasting outputs than Genie 2

Fig 3. Google Genie 3 può generare output che durano più a lungo rispetto a quelli prodotti da Genie 2. (Source)

Dall'istruzione al gaming: Applicazioni di Genie 3 di Google DeepMind#

Google Genie 3 può rendere l'apprendimento, la ricerca e l'addestramento più immersivi e coinvolgenti. Ad esempio, nelle classi, può dare vita a storia, scienza o geografia permettendo agli studenti di esplorare città antiche o viaggiare attraverso lo space. Allo stesso modo, per gli sviluppatori di intelligenza artificiale, offre mondi virtuali realistici per praticare strategie, affrontare sfide e migliorare le capacità decisionali.

Gli scienziati possono anche usarlo per creare simulazioni controllate per testare idee, studiare ecosistemi o osservare il comportamento degli oggetti. Un'altra applicazione interessante è nello sviluppo di game development. Gli sviluppatori di giochi possono trasformare prompt di testo in mondi di gioco dettagliati, accelerando lo sviluppo e riducendo la necessità di grandi team.

Colorful interactive game designed using Genie 3

Fig 4. Giochi divertenti, colorati e interattivi possono essere progettati utilizzando Genie 3. (Source)

Limitazioni di Google Genie 3 come modello del mondo#

Sebbene Google Genie 3 offra molte funzionalità e vantaggi, è importante considerare anche i suoi svantaggi.

Ecco alcune limitazioni da considerare:

  • Gamma di azioni limitata: Sebbene tu possa attivare molti eventi nel mondo virtuale, non tutti vengono eseguiti dall'agente stesso. Le azioni che un agente può eseguire direttamente sono ancora limitate.

  • Interazione con altri agenti: Creare interazioni realistiche tra più agenti indipendenti nello stesso ambiente è ancora un lavoro in corso.

  • Precisione nel mondo reale: Google Genie 3 non è ancora in grado di ricreare luoghi del mondo reale con una precisione geografica perfetta.

Punti chiave#

Google Genie 3 rappresenta un progresso significativo nella creazione di mondi 3D interattivi e realistici con l'IA. Può dare vita a idee da semplici prompt testuali, simulare la fisica e persino addestrare sistemi IA in spazi virtuali sicuri.

Sebbene abbia ancora dei limiti, apre molte possibilità per la ricerca, il gaming e lo sviluppo di IA. È anche un passo cruciale verso sistemi AGI in grado di pensare e apprendere più come gli umani.

Dai un'occhiata al nostro GitHub repository per scoprire di più sull'AI. Unisciti alla nostra community attiva e scopri le innovazioni in settori come AI in the retail e vision AI in manufacturing. Per iniziare subito con la computer vision, dai un'occhiata alle nostre licensing options.

Explore solutions

Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo viaggio con il futuro del machine learning