Google Genie 3はAIであなたの3Dワールドに命を吹き込みます
DeepMindのGenie 3 AIワールドモデルは、テキストまたは画像のプロンプトを3D環境に変換します。この進歩は、人間のような知能に向けたまた一歩となるものです。

2025年8月5日、Google DeepMindはGenieモデルの最新バージョンであるGenie 3を発表しました。これは、ユーザーのテキストプロンプトを動的でインタラクティブな環境に変換できる新しいAIモデルです。
これらの環境(AIワールド)では、ユーザーはビデオゲームのようにリアルタイムで操作やインタラクションを行うことができます。また、ユーザーは追加のテキストプロンプトを入力することで環境を拡張・修正でき、シミュレーションを再起動することなく、その場で変更を加えることが可能です。
最新のGenie Googleモデルが特に強力である理由は、AIエージェントのトレーニングに使用できる点です。これには、データとフィードバックを使用して、AIエージェントに意思決定やタスクの実行を学習させることが含まれます。現実世界ではなくシミュレーションされた3D環境を使用することで、研究者は現実世界のトレーニングにおける多くの課題、コスト、リスクを回避できます。
Google Genie 3はまた、悪天候の中を走行する自動運転車や、山岳地帯を滑空するウイングスーツのテストなど、複雑なシナリオをシミュレートすることもできます。
本記事では、Google Genie 3とその機能について探っていきます。それでは始めましょう!

図1:ウイングスーツの滑空を示すGenie 3シミュレーションのフレーム(ソース)
GoogleのGenieモデルの簡単な歴史#
Google DeepMindのGenieモデルについて掘り下げる前に、まずはワールドモデルとは何かをより深く理解しましょう。
ワールドモデルは、テキスト、画像、動画、および移動のデータセットから、物理法則、動き、空間関係などの現実世界のルールを学習するAIシステムです。これにより、リアルなシーンを作成し、その進化を予測することが可能になります。Genieモデルはそのようなシステムの例です。
Genie 3への道を切り開いた、初期のGoogle Genieモデルを簡単に紹介します。
-
Genie 1: 単にGoogle Genieとも呼ばれるGenie 1は、インタラクティブな仮想環境を作成できるGoogle DeepMind初のAIワールドモデルです。ユーザーがテキスト、画像、写真、あるいはスケッチで世界を記述すると、Genieがそれを生成し、シーン内のアクションを制御できるようにしました。これは動画データを経時的に処理し、次のフレームを予測し、ユーザーの入力をワールド内のアクションに変換するように設計されていました。
-
Genie 2: Google Genieの機能を基盤として、Genie 2は詳細でインタラクティブな3Dワールドを幅広く作成できるようになりました。ワールドモデルとして、仮想環境をシミュレートし、ジャンプ、水泳、物体の移動といったアクションに対してリアルに反応しました。膨大な動画コレクションで学習されており、リアルな物体同士の相互作用や生き生きとしたキャラクターの動きが特徴でした。
Genie 3とは何か?Googleの新しいAIモデル#
これまでのGenieモデルを基盤とするGenie 3は、シリーズの中で最新かつ最も高度なモデルです。特に、新しい仮想環境を生成できたGenie 2と、Google DeepMindの最新の動画生成モデルであるVeo 3を基盤としています。Veo 3は、物理法則や現実世界におけるオブジェクトの相互作用についての深い理解を示しています。
Veo 3がハードコードされた物理エンジンを使用する一方、Google Genie 3は自己教師あり学習として知られる手法を使用して、物理法則の仕組みを自ら学習します。これは、AIモデルが独自の学習シグナルを生成することにより、ラベルなしデータからパターンや関係性を学習するAI学習技術です。
Google Genie 3の自己教師あり学習能力は、AIエージェントやAIロボットなどのAIシステムにさまざまなタスクを処理させるためのトレーニングにおいて極めて重要です。実際、Google DeepMindの研究者は、Genie 3を汎用人工知能(AGI)の創造に向けた重要なステップと捉えています。

図2:Google Genie 3を使用してロボットローバーの制御をシミュレートする例(ソース)
AGIは、人間のようにあらゆるタスクや主題を理解・学習し、その知識をさまざまな状況に適用できる理論上のAI形態です。特定のタスクのために構築され、新しい問題へのスキル移転に苦慮する今日のAIモデルとは異なり、AGIは幅広いコンテキストで適応し学習できると考えられています。
AIワールド構築に関連するGoogle Genie 3の主な機能#
Genie 3がサポートする主な機能をいくつか紹介します。
-
テキストから3Dワールドへの生成: 単純なテキストプロンプト(例:「通りを歩くロボット」)を、基本的な移動操作を備えたプレイ可能な3D風の環境に変換できます。
-
プロンプト可能なワールドイベント: ユーザーは新しいコマンドを入力することで(例:「通りに雨を降らせる」)、環境を動的に変更できます。
-
視覚的記憶: Genie 3は環境内に残された物体を記憶し、後でそれらを再訪できるようにします。この記憶は約1分間持続します。
-
スムーズで一貫した動画出力: Genie 2と比較してより長いエンゲージメントを持ちながら、720p解像度で24 fps(1秒あたりのフレーム数)の動画出力を維持できます。

図3:Google Genie 3は、Genie 2によって生成されたものよりも長持ちする出力を生成できます。(ソース)
教育からゲームまで:Google DeepMindのGenie 3のアプリケーション#
Google Genie 3は、学習、研究、トレーニングをより没入感があり魅力的なものにすることができます。たとえば教室では、生徒が古代都市を探索したり宇宙を旅したりできるようにすることで、歴史、科学、地理に命を吹き込むことができます。同様に、人工知能の開発者にとっては、戦略の練習、課題の克服、意思決定スキルの向上を行うためのリアルな仮想世界を提供します。
科学者はまた、アイデアのテスト、生態系の研究、オブジェクトの行動の観察を行うための制御されたシミュレーションを作成するためにもこれを使用できます。もう1つの興味深い用途はビデオのゲーム開発です。ゲーム開発者はテキストプロンプトを詳細なゲーム世界に変換し、開発をスピードアップして大規模チームの必要性を減らすことができます。

図4:Genie 3を使用して、楽しくカラフルでインタラクティブなゲームをデザインできます。(ソース)
ワールドモデルとしてのGoogle Genie 3の制限#
Google Genie 3には多くの機能と利点がありますが、その欠点を考慮することも重要です。
考慮すべき制限事項をいくつか挙げます。
-
限られたアクション範囲: 仮想世界では多くのイベントをトリガーできますが、そのすべてがエージェント自身によって実行されるわけではありません。エージェントが直接実行できるアクションはまだ限られています。
-
他のエージェントとのインタラクション: 同じ環境内で複数の独立したエージェント間でのリアルな相互作用を作成することは、まだ開発途上です。
-
現実世界の精度: Google Genie 3は、まだ現実世界の場所を地理的に完璧な精度で再現することはできません。
重要なポイント#
Google Genie 3は、AIを用いてリアルでインタラクティブな3Dワールドを作成する上での重要な進歩を意味します。シンプルなテキストプロンプトからアイデアを実現し、物理現象をシミュレートし、安全な仮想空間でAIシステムをトレーニングすることさえ可能です。
まだ制限はあるものの、研究、ゲーム、AI開発の可能性を大きく広げています。また、人間のように考え、学習できるAGIシステムへの重要なステップでもあります。
AIについての詳細を発見するには、弊社のGitHubリポジトリをご覧ください。アクティブなコミュニティに参加し、小売業界におけるAIや製造業におけるビジョンAIなどの分野におけるイノベーションを発見してください。今すぐコンピュータビジョンを始めるには、弊社のライセンスオプションをご確認ください。






