Google Genie 3 通过 AI 让你的 3D 世界栩栩如生
DeepMind 的 Genie 3 AI 世界模型可将文本或图像提示转换为 3D 环境。这一进展标志着其向类人智能又迈进一步。

2025 年 8 月 5 日,Google DeepMind 发布了最新版本的 Genie 模型,即 Genie 3。这是一种新的 AI 模型,可以将用户的文本提示转换为动态的交互式环境。
这些环境,也就是 AI 世界,让用户能够像在电子游戏中一样实时导航和与其互动。用户还可以通过提供额外的文本提示来扩展或修改环境,从而无需重启模拟即可即时进行更改。
最新的 Genie Google 模型之所以特别重要,是因为它可以用于训练 AI 代理。这包括教会 AI 代理 使用数据和反馈做出决策或执行任务。通过使用模拟的 3D 环境代替现实世界,研究人员可以避免现实训练中的许多挑战、成本和风险。
Google Genie 3 还可以模拟复杂场景,例如测试自动驾驶汽车在恶劣天气中行驶,或测试翼装飞行者在山地地形中滑翔。
在本文中,我们将探索 Google Genie 3 及其功能。让我们开始吧!

图 1. 展示翼装飞行者滑翔的 Genie 3 模拟画面。(来源)
Google Genie 模型简史#
在深入了解 Google DeepMind 的 Genie 模型之前,让我们先更好地了解什么是世界模型。
世界模型是从文本、图像、视频和运动数据集中学习物理、运动和空间关系等现实世界规律的 AI 系统。这使它们能够创建逼真的场景,并预测场景如何演变。Genie 模型就是此类系统的例子。
下面快速了解一下为 Genie 3 铺平道路的早期 Google Genie 模型:
-
Genie 1: Genie 1 通常简称为 Google Genie,是 Google DeepMind 首个能够创建交互式虚拟环境的 AI 世界模型。用户可以用文本、图像、照片甚至草图描述一个世界,Genie 会生成该世界,并让用户控制场景中的动作。它旨在随时间处理视频数据、预测下一帧,并将用户输入转换为世界内的动作。
-
Genie 2: Genie 2 在 Google Genie 的功能基础上进行了扩展,可以创建各种详细的交互式 3D 世界。作为世界模型,它能够模拟虚拟环境,并对跳跃、游泳或移动物体等动作做出逼真响应。它使用海量视频集合进行训练,具备逼真的物体交互和栩栩如生的角色动作。
什么是 Genie 3?Google 的新 AI 模型#
在早期 Genie 模型的基础上,Genie 3 是该系列最新、最先进的模型。它尤其基于能够生成新虚拟环境的 Genie 2,以及 Google DeepMind 最新的视频生成模型 Veo 3 构建。Veo 3 展现了对物理规律以及物体在现实世界中如何交互的深入理解。
Veo 3 使用硬编码的物理引擎,而 Google Genie 3 则通过一种称为自监督学习的方法自行学习物理规律。这是一种AI 学习技术,AI 模型通过生成自己的学习信号,从无标注数据中学习模式和关系。
Google Genie 3 的自监督学习能力对于训练 AI 系统(例如 AI 代理或 AI 机器人)以处理各种任务至关重要。事实上,Google DeepMind 的研究人员认为,Genie 3 是迈向创建人工通用智能 (AGI)的重要一步。

图 2. 使用 Google Genie 3 模拟控制机器人漫游车的示例。(来源)
AGI 是一种理论上的 AI 形态,能够理解和学习任何任务或主题,并像人类一样将这些知识应用于不同情境。与如今针对特定任务构建、难以将技能迁移到新问题上的人工智能模型不同,AGI 将能够在广泛的环境中适应和学习。
Google Genie 3 构建 AI 世界的主要功能#
以下是 Genie 3 支持的一些主要功能:
-
文本生成 3D 世界: 它可以将简单的文本提示(例如“一个机器人沿街行走”)转换为带有基本移动控制功能的可玩类 3D 环境。
-
可通过提示控制的世界事件: 用户可以通过输入新命令(例如“给街道添加降雨”)动态改变环境。
-
视觉记忆: Genie 3 可以记住留在环境中的物体,并让你稍后重新访问这些物体,记忆时长约为一分钟。
-
流畅且一致的视频输出: 它可以保持 720p 分辨率下 24 fps(每秒帧数)的视频输出,持续交互时间比 Genie 2 更长。

图 3. Google Genie 3 可以生成比 Genie 2 生成的输出持续时间更长的内容。(来源)
从教育到游戏:Google DeepMind Genie 3 的应用#
Google Genie 3 可以让学习、研究和训练更加沉浸和引人入胜。例如,在课堂上,它可以让学生探索古代城市或穿越太空,使历史、科学或地理知识栩栩如生。同样,对于人工智能开发者来说,它提供了逼真的虚拟世界,用于练习策略、应对挑战和提升决策能力。
科学家还可以使用它创建受控模拟,用于测试想法、研究生态系统或观察物体的行为。另一个有趣的应用领域是视频游戏开发。游戏开发者可以将文本提示转换为详细的游戏世界,从而加快开发速度,并减少对大型团队的需求。

图 4. 使用 Genie 3 可以设计有趣、色彩丰富且具交互性的游戏。(来源)
Google Genie 3 作为世界模型的局限性#
虽然 Google Genie 3 提供了许多功能和优势,但考虑它的缺点也很重要。
以下是需要考虑的一些局限性:
-
动作范围有限: 虽然你可以触发虚拟世界中的许多事件,但并非所有事件都由代理自身执行。代理能够直接执行的动作仍然有限。
-
与其他代理交互: 在同一环境中创建多个独立代理之间的逼真交互仍在持续完善中。
-
现实世界准确性: Google Genie 3 目前还无法以完美的地理精度重现现实世界中的地点。
要点总结#
Google Genie 3 代表了使用 AI 创建逼真交互式 3D 世界的一项重大进展。它可以通过简单的文本提示让想法成为现实、模拟物理规律,甚至在安全的虚拟空间中训练 AI 系统。
虽然它仍存在局限,但也为研究、游戏和 AI 开发带来了许多可能性。它还是迈向能够以更接近人类的方式思考和学习的 AGI 系统的关键一步。
查看我们的 GitHub 代码仓库,了解更多 AI 相关信息。加入活跃的社区,探索零售业中的 AI和制造业中的视觉 AI等领域的创新。要立即开始使用计算机视觉,请查看我们的许可选项。









