Google Genie 3 dá vida ao seu mundo 3D com IA
O modelo mundial de IA Genie 3 da DeepMind converte prompts de texto ou imagem em ambientes 3D. Este avanço representa mais um passo rumo a uma inteligência semelhante à humana.

A 5 de agosto de 2025, a Google DeepMind lançou a versão mais recente do modelo Genie, conhecida como Genie 3. É um novo modelo de IA que pode converter os prompts de texto de um utilizador em ambientes dinâmicos e interativos.
Estes ambientes, ou mundos de IA, permitem ao utilizador navegar e interagir com eles em tempo real, tal como num videojogo. Os utilizadores também podem expandir ou modificar o ambiente fornecendo prompts de texto adicionais, permitindo alterações imediatas sem reiniciar a simulação.
O que torna o modelo Google Genie mais recente particularmente impactante é o facto de poder ser utilizado para treinar agentes de IA. Isto envolve ensinar agentes de IA a tomar decisões ou executar tarefas utilizando dados e feedback. Ao utilizar um ambiente 3D simulado em vez do mundo real, os investigadores podem evitar muitos dos desafios, custos e riscos associados ao treino no mundo real.
O Google Genie 3 também pode simular cenários complexos, como testar um carro autónomo a conduzir sob condições meteorológicas adversas ou um praticante de wingsuit a planar por um terreno montanhoso.
Neste artigo, vamos explorar o Google Genie 3 e as suas capacidades. Vamos começar!

Fig. 1. Uma imagem de uma simulação do Genie 3 mostrando um praticante de wingsuit a planar. (Fonte)
Uma breve história dos modelos Genie da Google#
Antes de explorarmos os modelos Genie da Google DeepMind, vamos compreender melhor o que são modelos do mundo.
Os modelos do mundo são sistemas de IA que aprendem regras do mundo real, como a física, o movimento e as relações espaciais, a partir de conjuntos de dados de texto, imagens, vídeos e movimento. Isto permite-lhes criar cenas realistas e prever como estas evoluem. Os modelos Genie são exemplos deste tipo de sistemas.
Eis uma breve visão geral dos modelos Google Genie anteriores que abriram caminho para o Genie 3:
-
Genie 1: O Genie 1, frequentemente referido simplesmente como Google Genie, foi o primeiro modelo de mundo de IA da Google DeepMind capaz de criar ambientes virtuais interativos. Os utilizadores podiam descrever um mundo com texto, imagens, fotografias ou até esboços, e o Genie gerava-o, permitindo-lhes controlar as ações na cena. Foi concebido para processar dados de vídeo ao longo do tempo, prever a imagem seguinte e traduzir as entradas do utilizador em ações dentro do mundo.
-
Genie 2: Com base nas capacidades do Google Genie, o Genie 2 conseguia criar uma vasta gama de mundos 3D detalhados e interativos. Enquanto modelo do mundo, simulava ambientes virtuais e respondia de forma realista a ações como saltar, nadar ou mover objetos. Treinado com uma enorme coleção de vídeos, apresentava interações realistas entre objetos e movimentos de personagens semelhantes aos humanos.
O que é o Genie 3? O novo modelo de IA da Google#
Com base nos modelos Genie anteriores, o Genie 3 é o mais recente e avançado da série. Baseia-se especialmente no Genie 2, que conseguia gerar novos ambientes virtuais, e no Veo 3, o mais recente modelo de geração de vídeo da Google DeepMind. O Veo 3 demonstra uma compreensão profunda da física e da forma como os objetos interagem no mundo real.
Embora o Veo 3 utilize um motor de física codificado manualmente, o Google Genie 3 aprende por si próprio como funciona a física através de um método conhecido como aprendizagem auto-supervisionada. Trata-se de uma técnica de aprendizagem de IA na qual um modelo de IA aprende padrões e relações a partir de dados não anotados, gerando os seus próprios sinais de aprendizagem.
A capacidade de aprendizagem auto-supervisionada do Google Genie 3 é crucial para treinar sistemas de IA, como agentes de IA ou robôs de IA, para executarem várias tarefas. De facto, os investigadores da Google DeepMind veem o Genie 3 como um passo importante rumo à criação de Inteligência Artificial Geral (AGI).

Fig. 2. Um exemplo da utilização do Google Genie 3 para simular o controlo de um veículo robótico. (Fonte)
A AGI é uma forma teórica de IA capaz de compreender e aprender qualquer tarefa ou assunto e aplicar esse conhecimento em diferentes situações, tal como um ser humano. Ao contrário dos modelos de inteligência artificial atuais, que são desenvolvidos para tarefas específicas e têm dificuldade em transferir as suas competências para novos problemas, a AGI seria capaz de se adaptar e aprender numa vasta gama de contextos.
Principais funcionalidades do Google Genie 3 relacionadas com a criação de um mundo de IA#
Eis algumas das principais funcionalidades suportadas pelo Genie 3:
-
Geração de mundos 3D a partir de texto: Pode transformar um simples prompt de texto (por exemplo, “um robô a caminhar pela rua”) num ambiente semelhante a um mundo 3D jogável, com controlos básicos de movimento.
-
Eventos do mundo acionados por prompts: Os utilizadores podem alterar dinamicamente o ambiente escrevendo novos comandos (por exemplo, adicionar chuva à rua).
-
Memória visual: O Genie 3 consegue lembrar-se dos objetos deixados no ambiente e permitir que os revisites mais tarde, durante cerca de um minuto.
-
Saída de vídeo suave e consistente: Pode manter uma saída de vídeo de 24 fps (fotogramas por segundo) com resolução de 720p, permitindo interações mais longas em comparação com o Genie 2.

Fig. 3. O Google Genie 3 pode gerar saídas que duram mais tempo do que as produzidas pelo Genie 2. (Fonte)
Da educação aos videojogos: aplicações do Genie 3 da Google DeepMind#
O Google Genie 3 pode tornar a aprendizagem, a investigação e o treino mais imersivos e envolventes. Por exemplo, nas salas de aula, pode dar vida à história, à ciência ou à geografia, permitindo que os alunos explorem cidades antigas ou viajem pelo espaço. Do mesmo modo, para os programadores de inteligência artificial, oferece mundos virtuais realistas para praticar estratégias, enfrentar desafios e melhorar as capacidades de tomada de decisões.
Os cientistas também podem utilizá-lo para criar simulações controladas, testar ideias, estudar ecossistemas ou observar o comportamento de objetos. Outra aplicação interessante é no desenvolvimento de videojogos. Os programadores de jogos podem transformar prompts de texto em mundos de jogo detalhados, acelerando o desenvolvimento e reduzindo a necessidade de equipas numerosas.

Fig. 4. É possível criar jogos divertidos, coloridos e interativos com o Genie 3. (Fonte)
Limitações do Google Genie 3 enquanto modelo do mundo#
Embora o Google Genie 3 ofereça muitas funcionalidades e benefícios, também é importante considerar as suas desvantagens.
Eis algumas limitações a considerar:
-
Amplitude de ações limitada: Embora seja possível desencadear muitos eventos no mundo virtual, nem todos são executados pelo próprio agente. As ações que um agente pode executar diretamente continuam a ser limitadas.
-
Interação com outros agentes: A criação de interações realistas entre vários agentes independentes no mesmo ambiente ainda está em desenvolvimento.
-
Precisão em relação ao mundo real: O Google Genie 3 ainda não consegue recriar localizações do mundo real com precisão geográfica perfeita.
Principais conclusões#
O Google Genie 3 representa um avanço significativo na criação de mundos 3D realistas e interativos com IA. Pode dar vida a ideias a partir de simples prompts de texto, simular a física e até treinar sistemas de IA em espaços virtuais seguros.
Embora ainda tenha limitações, abre muitas possibilidades para a investigação, os videojogos e o desenvolvimento de IA. É também um passo crucial rumo a sistemas de AGI capazes de pensar e aprender mais como os seres humanos.
Consulta o nosso repositório no GitHub para descobrires mais sobre IA. Junta-te à nossa comunidade ativa e descobre inovações em setores como a IA no retalho e a IA de visão na indústria. Para começares hoje com visão computacional, consulta as nossas opções de licenciamento.









