Ultralytics YOLO27 :
Vision par IA

Google Genie 3 donne vie à ton monde en 3D grâce à l’IA

Le modèle de monde IA Genie 3 de DeepMind convertit des invites textuelles ou d’image en environnements 3D. Cette avancée constitue une nouvelle étape vers une intelligence semblable à celle des humains.

ABAbirami Vina7 min read
Google DeepMind Genie 3 génère un monde en 3D

Le 5 août 2025, Google DeepMind a publié la dernière version de son modèle Genie, appelée Genie 3. Il s’agit d’un nouveau modèle d’IA capable de convertir les prompts textuels d’un utilisateur en environnements dynamiques et interactifs.

Ces environnements, ou mondes d’IA, permettent à l’utilisateur de s’y déplacer et d’interagir en temps réel, un peu comme dans un jeu vidéo. Les utilisateurs peuvent également agrandir ou modifier l’environnement en fournissant des prompts textuels supplémentaires, ce qui permet d’effectuer des changements à la volée sans redémarrer la simulation.

Ce qui rend le dernier modèle Genie de Google particulièrement important, c’est qu’il peut être utilisé pour entraîner des agents d’IA. Cela consiste à apprendre à des agents d’IA à prendre des décisions ou à effectuer des tâches à l’aide de données et de retours. En utilisant un environnement 3D simulé plutôt que le monde réel, les chercheurs peuvent éviter bon nombre des difficultés, des coûts et des risques liés à l’entraînement dans le monde réel.

Google Genie 3 peut également simuler des scénarios complexes, comme tester une voiture autonome roulant par mauvais temps ou un pratiquant de wingsuit planant au-dessus d’un terrain montagneux.

Dans cet article, nous allons explorer Google Genie 3 et ses capacités. C’est parti !

Image d’une simulation Genie 3 montrant un pratiquant de wingsuit en vol plané

Fig. 1. Image d’une simulation Genie 3 montrant un pratiquant de wingsuit en vol plané. (Source)

Bref historique des modèles Genie de Google#

Avant d’examiner les modèles Genie de Google DeepMind, voyons plus précisément ce que sont les modèles du monde.

Les modèles du monde sont des systèmes d’IA qui apprennent les règles du monde réel, comme la physique, le mouvement et les relations spatiales, à partir de texte, d’images, de vidéos et de jeux de données de mouvements. Cela leur permet de créer des scènes réalistes et de prédire leur évolution. Les modèles Genie sont des exemples de tels systèmes.

Voici un aperçu rapide des premiers modèles Genie de Google qui ont ouvert la voie à Genie 3 :

  • Genie 1 : Genie 1, souvent appelé simplement Google Genie, était le premier modèle de monde d’IA de Google DeepMind capable de créer des environnements virtuels interactifs. Les utilisateurs pouvaient décrire un monde avec du texte, des images, des photos ou même des croquis, puis Genie le générait en leur permettant de contrôler les actions dans la scène. Il a été conçu pour traiter des données vidéo au fil du temps, prédire l’image suivante et traduire les entrées des utilisateurs en actions dans le monde virtuel.

  • Genie 2 : S’appuyant sur les capacités de Google Genie, Genie 2 pouvait créer une grande variété de mondes 3D détaillés et interactifs. En tant que modèle du monde, il simulait des environnements virtuels et réagissait de manière réaliste à des actions comme sauter, nager ou déplacer des objets. Entraîné sur une immense collection de vidéos, il proposait des interactions réalistes entre les objets et des mouvements de personnages naturels.

Qu’est-ce que Genie 3 ? Le nouveau modèle d’IA de Google#

S’appuyant sur les modèles Genie précédents, Genie 3 est le modèle le plus récent et le plus avancé de la série. Il s’appuie notamment sur Genie 2, qui pouvait générer de nouveaux environnements virtuels, ainsi que sur Veo 3, le dernier modèle de génération vidéo de Google DeepMind. Veo 3 démontre une compréhension approfondie de la physique et de la manière dont les objets interagissent dans le monde réel.

Alors que Veo 3 utilise un moteur physique codé en dur, Google Genie 3 apprend par lui-même le fonctionnement de la physique grâce à une méthode appelée apprentissage auto-supervisé. Il s’agit d’une technique d’apprentissage de l’IA dans laquelle un modèle d’IA apprend des schémas et des relations à partir de données non annotées en générant ses propres signaux d’apprentissage.

La capacité d’apprentissage auto-supervisé de Google Genie 3 est essentielle pour entraîner des systèmes d’IA, comme des agents d’IA ou des robots dotés d’IA, à accomplir diverses tâches. En fait, les chercheurs de Google DeepMind considèrent Genie 3 comme une étape importante vers la création de l’intelligence artificielle générale (AGI).

Genie 3 simulant le contrôle d’un rover robotisé

Fig. 2. Exemple d’utilisation de Google Genie 3 pour simuler le contrôle d’un rover robotisé. (Source)

L’AGI est une forme théorique d’IA capable de comprendre et d’apprendre n’importe quelle tâche ou sujet, puis d’appliquer ces connaissances à différentes situations, à la manière d’un être humain. Contrairement aux modèles d’intelligence artificielle actuels, conçus pour des tâches spécifiques et qui peinent à transférer leurs compétences à de nouveaux problèmes, l’AGI pourrait s’adapter et apprendre dans un large éventail de contextes.

Principales fonctionnalités de Google Genie 3 pour créer un monde d’IA#

Voici quelques-unes des principales fonctionnalités prises en charge par Genie 3 :

  • Génération de mondes 3D à partir de texte : Il peut transformer un simple prompt textuel (par ex. « un robot qui marche dans la rue ») en un environnement semblable à un monde 3D jouable, doté de commandes de déplacement élémentaires.

  • Événements du monde déclenchés par des prompts : Les utilisateurs peuvent modifier dynamiquement l’environnement en saisissant de nouvelles commandes (par ex. ajouter de la pluie dans la rue).

  • Mémoire visuelle : Genie 3 peut se souvenir des objets laissés dans l’environnement et te permettre de les retrouver plus tard, pendant environ une minute.

  • Sortie vidéo fluide et cohérente : Il peut maintenir une sortie vidéo à 24 fps (images par seconde) en résolution 720p, avec une durée d’interaction supérieure à celle de Genie 2.

Genie 3 générant des sorties plus longues que Genie 2

Fig. 3. Google Genie 3 peut générer des sorties qui durent plus longtemps que celles produites par Genie 2. (Source)

De l’éducation aux jeux vidéo : applications de Genie 3 de Google DeepMind#

Google Genie 3 peut rendre l’apprentissage, la recherche et l’entraînement plus immersifs et captivants. Par exemple, en classe, il peut donner vie à l’histoire, aux sciences ou à la géographie en permettant aux élèves d’explorer des villes anciennes ou de voyager dans l’espace. De même, pour les développeurs en intelligence artificielle, il propose des mondes virtuels réalistes permettant de s’exercer à différentes stratégies, de relever des défis et d’améliorer ses compétences de prise de décision.

Les scientifiques peuvent également l’utiliser pour créer des simulations contrôlées afin de tester des idées, d’étudier des écosystèmes ou d’observer le comportement des objets. Une autre application intéressante concerne le développement de jeux vidéo. Les développeurs de jeux peuvent transformer des prompts textuels en mondes de jeu détaillés, accélérant ainsi le développement et réduisant le besoin de grandes équipes.

Jeu coloré et interactif conçu avec Genie 3

Fig. 4. Des jeux amusants, colorés et interactifs peuvent être conçus avec Genie 3. (Source)

Limites de Google Genie 3 en tant que modèle du monde#

Bien que Google Genie 3 offre de nombreuses fonctionnalités et avantages, il est également important de prendre en compte ses inconvénients.

Voici quelques limites à prendre en compte :

  • Gamme d’actions limitée : Même si tu peux déclencher de nombreux événements dans le monde virtuel, l’agent ne les exécute pas tous lui-même. Les actions qu’un agent peut effectuer directement restent limitées.

  • Interaction avec d’autres agents : La création d’interactions réalistes entre plusieurs agents indépendants dans un même environnement est encore en cours de développement.

  • Fidélité au monde réel : Google Genie 3 ne peut pas encore recréer des lieux du monde réel avec une précision géographique parfaite.

Points clés à retenir#

Google Genie 3 représente une avancée significative dans la création de mondes 3D réalistes et interactifs avec l’IA. Il peut donner vie à des idées à partir de simples prompts textuels, simuler la physique et même entraîner des systèmes d’IA dans des espaces virtuels sûrs.

Même s’il présente encore des limites, il ouvre de nombreuses possibilités pour la recherche, les jeux vidéo et le développement de l’IA. Il constitue également une étape essentielle vers des systèmes AGI capables de réfléchir et d’apprendre davantage comme les humains.

Consulte notre dépôt GitHub pour en savoir plus sur l’IA. Rejoins notre communauté active et découvre les innovations dans des secteurs comme l’IA dans le commerce de détail et la vision par IA dans l’industrie manufacturière. Pour commencer dès aujourd’hui avec la vision par ordinateur, consulte nos options de licence.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique