O Google Genie 3 dá vida ao teu mundo 3D com IA
O modelo de mundo de IA Genie 3 da DeepMind converte prompts de texto ou imagem em ambientes 3D. Este avanço marca mais um passo em direção a uma inteligência semelhante à humana.

No dia 5 de agosto de 2025, o Google DeepMind lançou a sua versão mais recente do modelo Genie, conhecido como Genie 3. É um novo modelo de IA que consegue converter os prompts de texto de um utilizador em ambientes dinâmicos e interativos.
Estes ambientes, ou mundos de IA, tornam possível que o utilizador navegue e interaja com eles em tempo real, tal como num videojogo. Os utilizadores também podem expandir ou modificar o ambiente fornecendo prompts de texto adicionais, permitindo alterações imediatas sem reiniciar a simulação.
O que torna o modelo Genie mais recente da Google particularmente impactante é que ele pode ser usado para treinar agentes de IA. Isso envolve ensinar agentes de IA a tomar decisões ou executar tarefas usando dados e feedback. Ao usar um ambiente 3D simulado em vez do mundo real, os pesquisadores podem evitar muitos dos desafios, custos e riscos do treinamento no mundo real.
O Google Genie 3 também pode simular cenários complexos, como testar um carro autônomo dirigindo em condições climáticas severas ou um traje de asas planando por terreno montanhoso.
Neste artigo, vamos explorar o Google Genie 3 e as suas capacidades. Vamos começar!

Fig 1. Um frame de uma simulação do Genie 3 mostrando um traje de asas planando. (Source)
Uma breve história dos modelos Genie do Google#
Antes de mergulharmos nos modelos Genie do Google DeepMind, vamos compreender melhor o que são modelos de mundo.
Modelos de mundo são sistemas de IA que aprendem regras do mundo real, como física, movimento e relações espaciais a partir de conjuntos de dados de texto, imagens, vídeos e movimento. Isso permite que eles criem cenas realistas e prevejam como elas evoluem. Os modelos Genie são exemplos desses sistemas.
Aqui tens uma visão rápida dos modelos anteriores do Google Genie que abriram caminho para o Genie 3:
-
Genie 1: O Genie 1, frequentemente referido simplesmente como Google Genie, foi o primeiro modelo de mundo de IA do Google DeepMind capaz de criar ambientes virtuais interativos. Os utilizadores podiam descrever um mundo com texto, imagens, fotografias ou até esboços, e o Genie gerava-o, permitindo-lhes controlar ações dentro da cena. Foi concebido para processar dados de vídeo ao longo do tempo, prever o frame seguinte e traduzir as entradas do utilizador em ações no mundo.
-
Genie 2: Com base nas capacidades do Google Genie, o Genie 2 conseguia criar uma vasta gama de mundos 3D detalhados e interativos. Como modelo de mundo, simulava ambientes virtuais e respondia de forma realista a ações como saltar, nadar ou mover objetos. Treinado numa enorme coleção de vídeos, apresentava interações realistas com objetos e movimentos de personagens muito naturais.
O que é o Genie 3? O novo modelo de IA do Google#
Construído com base em modelos Genie anteriores, o Genie 3 é o mais recente e avançado da série. Ele se baseia particularmente no Genie 2, que podia gerar novos ambientes virtuais, e no Veo 3, o mais recente modelo de geração de vídeo do Google DeepMind. O Veo 3 demonstra uma profunda compreensão da física e de como os objetos interagem no mundo real.
Enquanto o Veo 3 usa um mecanismo de física codificado rigidamente, o Google Genie 3 ensina a si mesmo como a física funciona usando um método conhecido como aprendizado auto-supervisionado. É uma técnica de aprendizado de IA onde um modelo de IA aprende padrões e relações a partir de dados não rotulados gerando seus próprios sinais de aprendizado.
A capacidade de aprendizado auto-supervisionado do Google Genie 3 é crucial para treinar sistemas de IA, como agentes de IA ou robôs de IA, para lidar com várias tarefas. Na verdade, pesquisadores do Google DeepMind veem o Genie 3 como um passo importante em direção à criação da Inteligência Artificial Geral (AGI).

Fig 2. Um exemplo do uso do Google Genie 3 para simular o controle de um rover robótico. (Source)
A AGI é uma forma teórica de IA que pode compreender e aprender qualquer tarefa ou assunto e aplicar esse conhecimento em diferentes situações, tal como um humano. Ao contrário dos modelos de inteligência artificial atuais, que são criados para tarefas específicas e têm dificuldade em transferir as suas competências para novos problemas, a AGI seria capaz de se adaptar e aprender numa vasta gama de contextos.
Principais funcionalidades do Google Genie 3 relacionadas com a construção de um mundo de IA#
Aqui estão algumas das principais funcionalidades suportadas pelo Genie 3:
-
Geração de mundos Text-to-3D: Consegue transformar um simples prompt de texto (por exemplo, “um robô a caminhar pela rua”) num ambiente jogável semelhante a 3D com controlos de movimento básicos.
-
Eventos de mundo promptáveis: Os utilizadores podem alterar dinamicamente o ambiente escrevendo novos comandos (por exemplo, adicionar chuva à rua).
-
Memória visual: O Genie 3 consegue lembrar-se de objetos deixados para trás no ambiente e permitir que os voltes a visitar mais tarde, durante cerca de um minuto.
-
Saída de vídeo suave e consistente: Ele consegue manter uma saída de vídeo de 24 fps (quadros por segundo) a uma resolução de 720p, com maior tempo de engajamento em comparação com o Genie 2.

Fig 3. O Google Genie 3 pode gerar saídas que duram mais do que aquelas produzidas pelo Genie 2. (Source)
Da educação aos jogos: Aplicações do Genie 3 do Google DeepMind#
O Google Genie 3 pode tornar o aprendizado, a pesquisa e o treinamento mais imersivos e envolventes. Por exemplo, em salas de aula, ele pode dar vida à história, ciência ou geografia, permitindo que os alunos explorem cidades antigas ou viajem pelo espaço. Da mesma forma, para desenvolvedores de inteligência artificial, ele oferece mundos virtuais realistas para praticar estratégias, navegar por desafios e aprimorar habilidades de tomada de decisão.
Cientistas também podem usá-lo para criar simulações controladas para testar ideias, estudar ecossistemas ou observar o comportamento de objetos. Outra aplicação interessante é no desenvolvimento de jogos em vídeo. Desenvolvedores de jogos podem transformar comandos de texto em mundos de jogos detalhados, acelerando o desenvolvimento e reduzindo a necessidade de grandes equipes.

Fig 4. Jogos divertidos, coloridos e interativos podem ser projetados usando o Genie 3. (Source)
Limitações do Google Genie 3 como modelo de mundo#
Embora o Google Genie 3 ofereça muitas funcionalidades e benefícios, é também importante considerar os seus inconvenientes.
Aqui estão algumas limitações a considerar:
-
Alcance de ação limitado: Embora possas desencadear muitos eventos no mundo virtual, nem todos são realizados pelo próprio agente. As ações que um agente pode realizar diretamente ainda são limitadas.
-
Interação com outros agentes: A criação de interações realistas entre vários agentes independentes no mesmo ambiente ainda é um trabalho em curso.
-
Precisão no mundo real: O Google Genie 3 ainda não consegue recriar localizações do mundo real com precisão geográfica perfeita.
Principais pontos#
O Google Genie 3 representa um avanço significativo na criação de mundos 3D interativos e realistas com IA. Pode dar vida a ideias a partir de simples prompts de texto, simular a física e até treinar sistemas de IA em espaços virtuais seguros.
Embora ainda tenha limites, abre muitas possibilidades para a investigação, jogos e desenvolvimento de IA. É também um passo crucial para sistemas de AGI que consigam pensar e aprender mais como os humanos.
Confere o nosso repositório no GitHub para descobrir mais sobre IA. Junta-te à nossa comunidade ativa e descobre inovações em setores como IA na indústria de varejo e visão computacional na manufatura. Para começar com visão computacional hoje, consulta as nossas opções de licenciamento.






