Ultralytics YOLO27:
IA para visão

Google Genie 3 dá vida ao seu mundo 3D com IA

O modelo mundial de IA Genie 3 da DeepMind converte prompts de texto ou imagem em ambientes 3D. Este avanço representa mais um passo rumo a uma inteligência semelhante à humana.

ABAbirami Vina7 min read
Google DeepMind Genie 3 a gerar um mundo 3D

A 5 de agosto de 2025, a Google DeepMind lançou a versão mais recente do modelo Genie, conhecida como Genie 3. É um novo modelo de IA que pode converter os prompts de texto de um utilizador em ambientes dinâmicos e interativos.

Estes ambientes, ou mundos de IA, permitem ao utilizador navegar e interagir com eles em tempo real, tal como num videojogo. Os utilizadores também podem expandir ou modificar o ambiente fornecendo prompts de texto adicionais, permitindo alterações imediatas sem reiniciar a simulação.

O que torna o modelo Google Genie mais recente particularmente impactante é o facto de poder ser utilizado para treinar agentes de IA. Isto envolve ensinar agentes de IA a tomar decisões ou executar tarefas utilizando dados e feedback. Ao utilizar um ambiente 3D simulado em vez do mundo real, os investigadores podem evitar muitos dos desafios, custos e riscos associados ao treino no mundo real.

O Google Genie 3 também pode simular cenários complexos, como testar um carro autónomo a conduzir sob condições meteorológicas adversas ou um praticante de wingsuit a planar por um terreno montanhoso.

Neste artigo, vamos explorar o Google Genie 3 e as suas capacidades. Vamos começar!

Imagem de uma simulação do Genie 3 mostrando um praticante de wingsuit a planar

Fig. 1. Uma imagem de uma simulação do Genie 3 mostrando um praticante de wingsuit a planar. (Fonte)

Uma breve história dos modelos Genie da Google#

Antes de explorarmos os modelos Genie da Google DeepMind, vamos compreender melhor o que são modelos do mundo.

Os modelos do mundo são sistemas de IA que aprendem regras do mundo real, como a física, o movimento e as relações espaciais, a partir de conjuntos de dados de texto, imagens, vídeos e movimento. Isto permite-lhes criar cenas realistas e prever como estas evoluem. Os modelos Genie são exemplos deste tipo de sistemas.

Eis uma breve visão geral dos modelos Google Genie anteriores que abriram caminho para o Genie 3:

  • Genie 1: O Genie 1, frequentemente referido simplesmente como Google Genie, foi o primeiro modelo de mundo de IA da Google DeepMind capaz de criar ambientes virtuais interativos. Os utilizadores podiam descrever um mundo com texto, imagens, fotografias ou até esboços, e o Genie gerava-o, permitindo-lhes controlar as ações na cena. Foi concebido para processar dados de vídeo ao longo do tempo, prever a imagem seguinte e traduzir as entradas do utilizador em ações dentro do mundo.

  • Genie 2: Com base nas capacidades do Google Genie, o Genie 2 conseguia criar uma vasta gama de mundos 3D detalhados e interativos. Enquanto modelo do mundo, simulava ambientes virtuais e respondia de forma realista a ações como saltar, nadar ou mover objetos. Treinado com uma enorme coleção de vídeos, apresentava interações realistas entre objetos e movimentos de personagens semelhantes aos humanos.

O que é o Genie 3? O novo modelo de IA da Google#

Com base nos modelos Genie anteriores, o Genie 3 é o mais recente e avançado da série. Baseia-se especialmente no Genie 2, que conseguia gerar novos ambientes virtuais, e no Veo 3, o mais recente modelo de geração de vídeo da Google DeepMind. O Veo 3 demonstra uma compreensão profunda da física e da forma como os objetos interagem no mundo real.

Embora o Veo 3 utilize um motor de física codificado manualmente, o Google Genie 3 aprende por si próprio como funciona a física através de um método conhecido como aprendizagem auto-supervisionada. Trata-se de uma técnica de aprendizagem de IA na qual um modelo de IA aprende padrões e relações a partir de dados não anotados, gerando os seus próprios sinais de aprendizagem.

A capacidade de aprendizagem auto-supervisionada do Google Genie 3 é crucial para treinar sistemas de IA, como agentes de IA ou robôs de IA, para executarem várias tarefas. De facto, os investigadores da Google DeepMind veem o Genie 3 como um passo importante rumo à criação de Inteligência Artificial Geral (AGI).

Genie 3 a simular o controlo de um veículo robótico

Fig. 2. Um exemplo da utilização do Google Genie 3 para simular o controlo de um veículo robótico. (Fonte)

A AGI é uma forma teórica de IA capaz de compreender e aprender qualquer tarefa ou assunto e aplicar esse conhecimento em diferentes situações, tal como um ser humano. Ao contrário dos modelos de inteligência artificial atuais, que são desenvolvidos para tarefas específicas e têm dificuldade em transferir as suas competências para novos problemas, a AGI seria capaz de se adaptar e aprender numa vasta gama de contextos.

Principais funcionalidades do Google Genie 3 relacionadas com a criação de um mundo de IA#

Eis algumas das principais funcionalidades suportadas pelo Genie 3:

  • Geração de mundos 3D a partir de texto: Pode transformar um simples prompt de texto (por exemplo, “um robô a caminhar pela rua”) num ambiente semelhante a um mundo 3D jogável, com controlos básicos de movimento.

  • Eventos do mundo acionados por prompts: Os utilizadores podem alterar dinamicamente o ambiente escrevendo novos comandos (por exemplo, adicionar chuva à rua).

  • Memória visual: O Genie 3 consegue lembrar-se dos objetos deixados no ambiente e permitir que os revisites mais tarde, durante cerca de um minuto.

  • Saída de vídeo suave e consistente: Pode manter uma saída de vídeo de 24 fps (fotogramas por segundo) com resolução de 720p, permitindo interações mais longas em comparação com o Genie 2.

Genie 3 a gerar saídas mais duradouras do que o Genie 2

Fig. 3. O Google Genie 3 pode gerar saídas que duram mais tempo do que as produzidas pelo Genie 2. (Fonte)

Da educação aos videojogos: aplicações do Genie 3 da Google DeepMind#

O Google Genie 3 pode tornar a aprendizagem, a investigação e o treino mais imersivos e envolventes. Por exemplo, nas salas de aula, pode dar vida à história, à ciência ou à geografia, permitindo que os alunos explorem cidades antigas ou viajem pelo espaço. Do mesmo modo, para os programadores de inteligência artificial, oferece mundos virtuais realistas para praticar estratégias, enfrentar desafios e melhorar as capacidades de tomada de decisões.

Os cientistas também podem utilizá-lo para criar simulações controladas, testar ideias, estudar ecossistemas ou observar o comportamento de objetos. Outra aplicação interessante é no desenvolvimento de videojogos. Os programadores de jogos podem transformar prompts de texto em mundos de jogo detalhados, acelerando o desenvolvimento e reduzindo a necessidade de equipas numerosas.

Jogo interativo e colorido criado com o Genie 3

Fig. 4. É possível criar jogos divertidos, coloridos e interativos com o Genie 3. (Fonte)

Limitações do Google Genie 3 enquanto modelo do mundo#

Embora o Google Genie 3 ofereça muitas funcionalidades e benefícios, também é importante considerar as suas desvantagens.

Eis algumas limitações a considerar:

  • Amplitude de ações limitada: Embora seja possível desencadear muitos eventos no mundo virtual, nem todos são executados pelo próprio agente. As ações que um agente pode executar diretamente continuam a ser limitadas.

  • Interação com outros agentes: A criação de interações realistas entre vários agentes independentes no mesmo ambiente ainda está em desenvolvimento.

  • Precisão em relação ao mundo real: O Google Genie 3 ainda não consegue recriar localizações do mundo real com precisão geográfica perfeita.

Principais conclusões#

O Google Genie 3 representa um avanço significativo na criação de mundos 3D realistas e interativos com IA. Pode dar vida a ideias a partir de simples prompts de texto, simular a física e até treinar sistemas de IA em espaços virtuais seguros.

Embora ainda tenha limitações, abre muitas possibilidades para a investigação, os videojogos e o desenvolvimento de IA. É também um passo crucial rumo a sistemas de AGI capazes de pensar e aprender mais como os seres humanos.

Consulta o nosso repositório no GitHub para descobrires mais sobre IA. Junta-te à nossa comunidade ativa e descobre inovações em setores como a IA no retalho e a IA de visão na indústria. Para começares hoje com visão computacional, consulta as nossas opções de licenciamento.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática