Google Genie 3 donne vie à ton monde en 3D grâce à l’IA
Le modèle de monde IA Genie 3 de DeepMind convertit des invites textuelles ou d’image en environnements 3D. Cette avancée constitue une nouvelle étape vers une intelligence semblable à celle des humains.

Le 5 août 2025, Google DeepMind a publié la dernière version de son modèle Genie, appelée Genie 3. Il s’agit d’un nouveau modèle d’IA capable de convertir les prompts textuels d’un utilisateur en environnements dynamiques et interactifs.
Ces environnements, ou mondes d’IA, permettent à l’utilisateur de s’y déplacer et d’interagir en temps réel, un peu comme dans un jeu vidéo. Les utilisateurs peuvent également agrandir ou modifier l’environnement en fournissant des prompts textuels supplémentaires, ce qui permet d’effectuer des changements à la volée sans redémarrer la simulation.
Ce qui rend le dernier modèle Genie de Google particulièrement important, c’est qu’il peut être utilisé pour entraîner des agents d’IA. Cela consiste à apprendre à des agents d’IA à prendre des décisions ou à effectuer des tâches à l’aide de données et de retours. En utilisant un environnement 3D simulé plutôt que le monde réel, les chercheurs peuvent éviter bon nombre des difficultés, des coûts et des risques liés à l’entraînement dans le monde réel.
Google Genie 3 peut également simuler des scénarios complexes, comme tester une voiture autonome roulant par mauvais temps ou un pratiquant de wingsuit planant au-dessus d’un terrain montagneux.
Dans cet article, nous allons explorer Google Genie 3 et ses capacités. C’est parti !

Fig. 1. Image d’une simulation Genie 3 montrant un pratiquant de wingsuit en vol plané. (Source)
Bref historique des modèles Genie de Google#
Avant d’examiner les modèles Genie de Google DeepMind, voyons plus précisément ce que sont les modèles du monde.
Les modèles du monde sont des systèmes d’IA qui apprennent les règles du monde réel, comme la physique, le mouvement et les relations spatiales, à partir de texte, d’images, de vidéos et de jeux de données de mouvements. Cela leur permet de créer des scènes réalistes et de prédire leur évolution. Les modèles Genie sont des exemples de tels systèmes.
Voici un aperçu rapide des premiers modèles Genie de Google qui ont ouvert la voie à Genie 3 :
-
Genie 1 : Genie 1, souvent appelé simplement Google Genie, était le premier modèle de monde d’IA de Google DeepMind capable de créer des environnements virtuels interactifs. Les utilisateurs pouvaient décrire un monde avec du texte, des images, des photos ou même des croquis, puis Genie le générait en leur permettant de contrôler les actions dans la scène. Il a été conçu pour traiter des données vidéo au fil du temps, prédire l’image suivante et traduire les entrées des utilisateurs en actions dans le monde virtuel.
-
Genie 2 : S’appuyant sur les capacités de Google Genie, Genie 2 pouvait créer une grande variété de mondes 3D détaillés et interactifs. En tant que modèle du monde, il simulait des environnements virtuels et réagissait de manière réaliste à des actions comme sauter, nager ou déplacer des objets. Entraîné sur une immense collection de vidéos, il proposait des interactions réalistes entre les objets et des mouvements de personnages naturels.
Qu’est-ce que Genie 3 ? Le nouveau modèle d’IA de Google#
S’appuyant sur les modèles Genie précédents, Genie 3 est le modèle le plus récent et le plus avancé de la série. Il s’appuie notamment sur Genie 2, qui pouvait générer de nouveaux environnements virtuels, ainsi que sur Veo 3, le dernier modèle de génération vidéo de Google DeepMind. Veo 3 démontre une compréhension approfondie de la physique et de la manière dont les objets interagissent dans le monde réel.
Alors que Veo 3 utilise un moteur physique codé en dur, Google Genie 3 apprend par lui-même le fonctionnement de la physique grâce à une méthode appelée apprentissage auto-supervisé. Il s’agit d’une technique d’apprentissage de l’IA dans laquelle un modèle d’IA apprend des schémas et des relations à partir de données non annotées en générant ses propres signaux d’apprentissage.
La capacité d’apprentissage auto-supervisé de Google Genie 3 est essentielle pour entraîner des systèmes d’IA, comme des agents d’IA ou des robots dotés d’IA, à accomplir diverses tâches. En fait, les chercheurs de Google DeepMind considèrent Genie 3 comme une étape importante vers la création de l’intelligence artificielle générale (AGI).

Fig. 2. Exemple d’utilisation de Google Genie 3 pour simuler le contrôle d’un rover robotisé. (Source)
L’AGI est une forme théorique d’IA capable de comprendre et d’apprendre n’importe quelle tâche ou sujet, puis d’appliquer ces connaissances à différentes situations, à la manière d’un être humain. Contrairement aux modèles d’intelligence artificielle actuels, conçus pour des tâches spécifiques et qui peinent à transférer leurs compétences à de nouveaux problèmes, l’AGI pourrait s’adapter et apprendre dans un large éventail de contextes.
Principales fonctionnalités de Google Genie 3 pour créer un monde d’IA#
Voici quelques-unes des principales fonctionnalités prises en charge par Genie 3 :
-
Génération de mondes 3D à partir de texte : Il peut transformer un simple prompt textuel (par ex. « un robot qui marche dans la rue ») en un environnement semblable à un monde 3D jouable, doté de commandes de déplacement élémentaires.
-
Événements du monde déclenchés par des prompts : Les utilisateurs peuvent modifier dynamiquement l’environnement en saisissant de nouvelles commandes (par ex. ajouter de la pluie dans la rue).
-
Mémoire visuelle : Genie 3 peut se souvenir des objets laissés dans l’environnement et te permettre de les retrouver plus tard, pendant environ une minute.
-
Sortie vidéo fluide et cohérente : Il peut maintenir une sortie vidéo à 24 fps (images par seconde) en résolution 720p, avec une durée d’interaction supérieure à celle de Genie 2.

Fig. 3. Google Genie 3 peut générer des sorties qui durent plus longtemps que celles produites par Genie 2. (Source)
De l’éducation aux jeux vidéo : applications de Genie 3 de Google DeepMind#
Google Genie 3 peut rendre l’apprentissage, la recherche et l’entraînement plus immersifs et captivants. Par exemple, en classe, il peut donner vie à l’histoire, aux sciences ou à la géographie en permettant aux élèves d’explorer des villes anciennes ou de voyager dans l’espace. De même, pour les développeurs en intelligence artificielle, il propose des mondes virtuels réalistes permettant de s’exercer à différentes stratégies, de relever des défis et d’améliorer ses compétences de prise de décision.
Les scientifiques peuvent également l’utiliser pour créer des simulations contrôlées afin de tester des idées, d’étudier des écosystèmes ou d’observer le comportement des objets. Une autre application intéressante concerne le développement de jeux vidéo. Les développeurs de jeux peuvent transformer des prompts textuels en mondes de jeu détaillés, accélérant ainsi le développement et réduisant le besoin de grandes équipes.

Fig. 4. Des jeux amusants, colorés et interactifs peuvent être conçus avec Genie 3. (Source)
Limites de Google Genie 3 en tant que modèle du monde#
Bien que Google Genie 3 offre de nombreuses fonctionnalités et avantages, il est également important de prendre en compte ses inconvénients.
Voici quelques limites à prendre en compte :
-
Gamme d’actions limitée : Même si tu peux déclencher de nombreux événements dans le monde virtuel, l’agent ne les exécute pas tous lui-même. Les actions qu’un agent peut effectuer directement restent limitées.
-
Interaction avec d’autres agents : La création d’interactions réalistes entre plusieurs agents indépendants dans un même environnement est encore en cours de développement.
-
Fidélité au monde réel : Google Genie 3 ne peut pas encore recréer des lieux du monde réel avec une précision géographique parfaite.
Points clés à retenir#
Google Genie 3 représente une avancée significative dans la création de mondes 3D réalistes et interactifs avec l’IA. Il peut donner vie à des idées à partir de simples prompts textuels, simuler la physique et même entraîner des systèmes d’IA dans des espaces virtuels sûrs.
Même s’il présente encore des limites, il ouvre de nombreuses possibilités pour la recherche, les jeux vidéo et le développement de l’IA. Il constitue également une étape essentielle vers des systèmes AGI capables de réfléchir et d’apprendre davantage comme les humains.
Consulte notre dépôt GitHub pour en savoir plus sur l’IA. Rejoins notre communauté active et découvre les innovations dans des secteurs comme l’IA dans le commerce de détail et la vision par IA dans l’industrie manufacturière. Pour commencer dès aujourd’hui avec la vision par ordinateur, consulte nos options de licence.









