Google Genie 3がAIで3Dワールドに命を吹き込む
DeepMindのGenie 3 AIワールドモデルは、テキストまたは画像のプロンプトを3D環境に変換します。この進歩は、人間に近い知能に向けた新たな一歩となります。

2025年8月5日、Google DeepMindはGenieモデルの最新バージョンであるGenie 3をリリースしました。これは、ユーザーのテキストプロンプトを動的でインタラクティブな環境に変換できる新しいAIモデルです。
これらの環境、つまりAIワールドによって、ユーザーはビデオゲームのように、リアルタイムで環境内を移動したり操作したりできます。ユーザーは追加のテキストプロンプトを入力して環境を拡張または変更することもでき、シミュレーションを再起動せずにその場で変更を加えられます。
最新のGenie Googleモデルが特に大きな影響をもたらす理由は、AIエージェントのトレーニングに使用できることです。これには、データとフィードバックを使用して意思決定やタスクの実行を行うようAIエージェントを学習させることが含まれます。現実世界の代わりにシミュレーションされた3D環境を使用することで、研究者は現実世界でのトレーニングに伴う多くの課題、コスト、リスクを回避できます。
Google Genie 3は、悪天候の中を走行する自動運転車や、山岳地帯をウイングスーツで滑空する状況のテストなど、複雑なシナリオもシミュレートできます。
この記事では、Google Genie 3とその機能について詳しく説明します。さっそく始めましょう。

図1. ウイングスーツで滑空する様子を示すGenie 3シミュレーションのフレーム(出典)。
GoogleのGenieモデルの簡単な歴史#
Google DeepMindのGenieモデルについて詳しく説明する前に、ワールドモデルとは何かを理解しておきましょう。
ワールドモデルは、テキスト、画像、動画、動きのデータセットから、物理法則、動き、空間関係などの現実世界のルールを学習するAIシステムです。これにより、現実的なシーンを作成し、それらがどのように変化するかを予測できます。Genieモデルは、このようなシステムの一例です。
ここでは、Genie 3への道を切り開いた初期のGoogle Genieモデルを簡単に紹介します。
-
Genie 1: Genie 1は、単にGoogle Genieと呼ばれることも多く、インタラクティブな仮想環境を作成できるGoogle DeepMind初のAIワールドモデルでした。ユーザーはテキスト、画像、写真、さらにはスケッチで世界を説明でき、Genieはそれを生成して、シーン内のアクションをユーザーが操作できるようにしました。Genie 1は、時間の経過に伴う動画データを処理し、次のフレームを予測して、ユーザー入力を世界内のアクションに変換するよう設計されていました。
-
Genie 2: Google Genieの機能を基盤として、Genie 2は多様で詳細なインタラクティブ3Dワールドを作成できました。ワールドモデルとして仮想環境をシミュレートし、ジャンプ、水泳、物体の移動などのアクションに現実的に反応しました。膨大な動画コレクションでトレーニングされ、現実的な物体間の相互作用と生き生きとしたキャラクターの動きを実現しました。
Genie 3とは? Googleの新しいAIモデル#
初期のGenieモデルを基盤として、Genie 3はシリーズの中で最も新しく、高度なモデルです。新しい仮想環境を生成できたGenie 2と、Google DeepMindの最新動画生成モデルであるVeo 3を特に発展させています。Veo 3は、物理法則と現実世界で物体がどのように相互作用するかを深く理解していることを示しています。
Veo 3がハードコードされた物理エンジンを使用するのに対し、Google Genie 3は自己教師あり学習と呼ばれる手法を使用して、物理法則がどのように機能するかを自ら学習します。これは、独自に学習信号を生成することで、ラベルなしデータからパターンと関係性を学習するAI学習手法です。
Google Genie 3の自己教師あり学習機能は、AIエージェントやAIロボットなどのAIシステムにさまざまなタスクへの対応方法をトレーニングするうえで重要です。実際、Google DeepMindの研究者は、Genie 3を人工汎用知能(AGI)の創出に向けた重要な一歩と捉えています。

図2. Google Genie 3を使用してロボットローバーの操作をシミュレートする例(出典)。
AGIは、人間のように、あらゆるタスクや分野を理解して学習し、その知識をさまざまな状況に適用できる理論上のAIです。特定のタスク向けに構築され、新しい問題にスキルを応用するのが難しい現在の人工知能モデルとは異なり、AGIは幅広い状況に適応して学習できるようになります。
AIワールドの構築に関連するGoogle Genie 3の主な機能#
Genie 3がサポートする主な機能は次のとおりです。
-
テキストからの3Dワールド生成: 簡単なテキストプロンプト(例:「ロボットが通りを歩いている」)を、基本的な移動操作に対応したプレイ可能な3D風環境に変換できます。
-
プロンプトで指定できるワールドイベント: ユーザーは新しいコマンドを入力して環境を動的に変更できます(例:通りに雨を追加する)。
-
視覚的メモリ: Genie 3は環境内に残された物体を記憶し、後から再び訪れられるようにします。この記憶は約1分間維持されます。
-
滑らかで一貫性のある動画出力: Genie 2よりも長時間のインタラクションに対応し、720p解像度で24 fps(1秒あたりのフレーム数)の動画出力を維持できます。

図3. Google Genie 3は、Genie 2が生成したものよりも長時間持続する出力を生成できます(出典)。
教育からゲームまで:Google DeepMindのGenie 3の用途#
Google Genie 3は、学習、研究、トレーニングをより没入感のある魅力的なものにできます。例えば教室では、学生が古代都市を探索したり宇宙を旅したりできるようにすることで、歴史、科学、地理に命を吹き込めます。同様に、人工知能の開発者にとっては、戦略の練習、課題への対応、意思決定能力の向上に利用できる現実的な仮想世界を提供します。
科学者は、アイデアの検証、生態系の研究、物体の挙動の観察に使用する、管理されたシミュレーションを作成することもできます。もう一つの興味深い用途は、ビデオゲーム開発です。ゲーム開発者はテキストプロンプトを詳細なゲームワールドに変換できるため、開発を高速化し、大規模なチームの必要性を減らせます。

図4. Genie 3を使用して、楽しくカラフルでインタラクティブなゲームを設計できます(出典)。
ワールドモデルとしてのGoogle Genie 3の限界#
Google Genie 3には多くの機能とメリットがありますが、欠点も考慮することが重要です。
考慮すべき制限事項は次のとおりです。
-
アクション範囲の制限: 仮想世界では多くのイベントを発生させられますが、そのすべてをエージェント自身が実行するわけではありません。エージェントが直接実行できるアクションには、依然として制限があります。
-
他のエージェントとのインタラクション: 同じ環境内にいる複数の独立したエージェント間で、現実的なインタラクションを作成する機能は、まだ開発途上です。
-
現実世界の再現精度: Google Genie 3は、現時点では現実世界の場所を完全な地理的精度で再現することはできません。
主なポイント#
Google Genie 3は、AIによる現実的でインタラクティブな3Dワールドの作成における大きな進歩を示しています。簡単なテキストプロンプトからアイデアを形にし、物理法則をシミュレートし、安全な仮想空間でAIシステムをトレーニングすることもできます。
まだ限界はありますが、研究、ゲーム、AI開発に多くの可能性をもたらします。また、人間に近い思考と学習ができるAGIシステムに向けた重要な一歩でもあります。
AIについて詳しく知るには、GitHubリポジトリをご覧ください。活発なコミュニティに参加して、小売業界のAIや製造業におけるビジョンAIなどの分野のイノベーションを発見してください。今すぐコンピュータービジョンを始めるには、ライセンスオプションをご確認ください。









